DPO: sustitución del modelo de recompensa por optimización de preferencias directas
RLHF (tratado en el Capítulo 2) requiere tres fases de capacitación separadas: SFT → Modelo de recompensa → PPO. Cada fase necesita su propia infraestructura, su propio ajuste de hiperparámetros e introduce nuevos modos de falla. En 2023, Rafailov et al. DPO publicado: un algoritmo que logra el mismo objetivo de alineación con un solo paso de ajuste, sin modelo de recompensa y un ciclo de aprendizaje supervisado estándar. Ahora es el método de alineación dominante en el ecosistema de código abierto.