Alignement : SFT, modèles de récompense, PPO et DPO

Un modèle de langage pré-entraîné est extrêmement performant mais totalement non guidé. Posez-lui une question et cela pourrait produire plus de questions, écrire une nouvelle ou générer du contenu toxique – le tout comme des continuations de texte tout aussi valables. L'alignement est le processus consistant à prendre cette capacité brute et à la transformer en un modèle utile, honnête et inoffensif. Cette leçon couvre le pipeline en trois étapes qui transforme un modèle de base en ChatGPT ou Claude.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.