Согласование: SFT, модели вознаграждения, PPO и DPO.
Предварительно обученная языковая модель чрезвычайно эффективна, но совершенно неуправляема. Задайте ему вопрос, и он может породить еще больше вопросов, написать короткий рассказ или создать токсичный контент — и все это будет равноценным продолжением текста. Согласование – это процесс преобразования этих необработанных возможностей в полезную, честную и безвредную модель. В этом уроке рассматривается трехэтапный конвейер, который превращает базовую модель в ChatGPT или Claude.