DPO : remplacer le modèle de récompense par une optimisation directe des préférences

RLHF (traité au chapitre 2) nécessite trois phases de formation distinctes : SFT → Modèle de récompense → PPO. Chaque phase nécessite sa propre infrastructure, son propre réglage d'hyperparamètres et introduit de nouveaux modes de défaillance. En 2023, Rafailov et al. DPO publié - un algorithme qui atteint le même objectif d'alignement avec une seule étape de réglage fin, aucun modèle de récompense et une boucle d'apprentissage supervisée standard. C'est désormais la méthode d'alignement dominante dans l'écosystème open source.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.