DPO: sustitución del modelo de recompensa por optimización de preferencias directas

RLHF (tratado en el Capítulo 2) requiere tres fases de capacitación separadas: SFT → Modelo de recompensa → PPO. Cada fase necesita su propia infraestructura, su propio ajuste de hiperparámetros e introduce nuevos modos de falla. En 2023, Rafailov et al. DPO publicado: un algoritmo que logra el mismo objetivo de alineación con un solo paso de ajuste, sin modelo de recompensa y un ciclo de aprendizaje supervisado estándar. Ahora es el método de alineación dominante en el ecosistema de código abierto.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.