Большинство классических задач машинного обучения являются дискриминативными: модель учится сопоставлять входные данные X с меткой Y. Спам-фильтр выводит спам/не спам. Детектор объектов возвращает координаты ограничивающего прямоугольника. Модель делает выводы о существующих данных — она не создает ничего нового.
Граница не абсолютна. BERT обучается без меток (предсказание токенов по маске), но используется для различительных задач. Классификатор на основе GPT технически представляет собой генеративную архитектуру, используемую для дискриминации. Ключевое отличие заключается в цели обучения, а не в архитектуре.
Идеи, лежащие в основе генеративных моделей, не новы: GAN были представлены в 2014 году, VAE — в 2013 году. Что изменилось, так это конвергенция трёх факторов, которая сделала масштабное обучение возможным и продуктивным.