Génération vs discrimination : quelle est la différence

La plupart des tâches de ML classiques sont discriminantes : le modèle apprend à mapper l'entrée X à l'étiquette Y. Un filtre anti-spam génère du spam/pas du spam. Un détecteur d'objet renvoie les coordonnées du cadre de délimitation. Le modèle fait des inférences sur les données existantes : il ne crée rien de nouveau.

Modèle génératif — un modèle qui apprend la distribution des données P(X) et peut échantillonner de nouveaux exemples à partir de celle-ci. Au lieu de demander « quel est cet objet ? il répond "à quoi ressemble un objet typique de ce monde ?" GPT génère du texte qui n'a jamais existé auparavant ; Stable Diffusion peint une image à partir d’un bruit aléatoire pur.
Principales différences entre les deux approches
AspectDiscriminantGénératif
Objectif de formationPrédire l'étiquette P(Y|X)Distribution des données du modèle P(X) ou P(X|Y)
SortirClasse, numéro, cadre de délimitationNouveau texte, image, audio, vidéo
ÉtiquettesObligatoire (supervisé)Souvent pas nécessaire (auto-supervisé)
Exemples de tâchesClassification, régression, TNSGénération de texte, synthèse d'images, traduction
Exemples de modèlesBERT, SVM, XGBoost, ResNetGPT, Claude, Diffusion Stable, GAN, VAE

La frontière n'est pas absolue. BERT s'entraîne sans étiquettes (prédiction de jeton masqué) mais est utilisé pour des tâches discriminantes. Un classificateur basé sur GPT est techniquement une architecture générative utilisée pour la discrimination. La principale différence réside dans l'objectif de formation, pas dans l'architecture.

Une carte de l'IA générative : six familles
Cliquez sur une carte pour en savoir plus
Pourquoi l'IA générative est possible dès maintenant

Les idées derrière les modèles génératifs ne sont pas nouvelles : les GAN ont été introduits en 2014, les VAE en 2013. Ce qui a changé, c'est la convergence de trois facteurs qui a rendu la formation à grande échelle à la fois possible et productive.

Trois facteurs ont convergé pour rendre GenAI possible ▶
Transformateur
2017 : attention à soi
GPU/TPU
×10 000 par rapport à 2012
Données
Corpus à l’échelle Internet
Lois de mise à l'échelle
Plus de données + paramètres = mieux
GénAI
GPT-3 → GPT-4 → Claude

Points clés à retenir

L'IA générative constitue un changement de paradigme : au lieu de déduire des étiquettes à partir des données, les modèles apprennent à créer de nouvelles données qui semblent provenir de la même distribution. Cela est devenu pratique grâce à la convergence de l’architecture du transformateur, de la mise à l’échelle du calcul GPU et des ensembles de données à l’échelle Internet.
Les modèles discriminatifs apprennent P(Y|X) — mappant les entrées aux étiquettes
Les modèles génératifs apprennent P(X) — la distribution des données elle-même, à partir de laquelle de nouveaux exemples peuvent être échantillonnés
L'architecture peut être identique (les deux utilisent des transformateurs) — la différence réside dans l'objectif de formation
Six grandes familles : LLM, Diffusion, GAN, VAE, Audio Gen, Video Gen
GenAI est devenu pratique grâce au transformateur (2017), à la mise à l'échelle du calcul et aux données à l'échelle Internet – les trois à la fois