Alignement : SFT, modèles de récompense, PPO et DPO
Un modèle de langage pré-entraîné est extrêmement performant mais totalement non guidé. Posez-lui une question et cela pourrait produire plus de questions, écrire une nouvelle ou générer du contenu toxique – le tout comme des continuations de texte tout aussi valables. L'alignement est le processus consistant à prendre cette capacité brute et à la transformer en un modèle utile, honnête et inoffensif. Cette leçon couvre le pipeline en trois étapes qui transforme un modèle de base en ChatGPT ou Claude.