DPO : remplacer le modèle de récompense par une optimisation directe des préférences
RLHF (traité au chapitre 2) nécessite trois phases de formation distinctes : SFT → Modèle de récompense → PPO. Chaque phase nécessite sa propre infrastructure, son propre réglage d'hyperparamètres et introduit de nouveaux modes de défaillance. En 2023, Rafailov et al. DPO publié - un algorithme qui atteint le même objectif d'alignement avec une seule étape de réglage fin, aucun modèle de récompense et une boucle d'apprentissage supervisée standard. C'est désormais la méthode d'alignement dominante dans l'écosystème open source.