La plupart des tâches de ML classiques sont discriminantes : le modèle apprend à mapper l'entrée X à l'étiquette Y. Un filtre anti-spam génère du spam/pas du spam. Un détecteur d'objet renvoie les coordonnées du cadre de délimitation. Le modèle fait des inférences sur les données existantes : il ne crée rien de nouveau.
La frontière n'est pas absolue. BERT s'entraîne sans étiquettes (prédiction de jeton masqué) mais est utilisé pour des tâches discriminantes. Un classificateur basé sur GPT est techniquement une architecture générative utilisée pour la discrimination. La principale différence réside dans l'objectif de formation, pas dans l'architecture.
Les idées derrière les modèles génératifs ne sont pas nouvelles : les GAN ont été introduits en 2014, les VAE en 2013. Ce qui a changé, c'est la convergence de trois facteurs qui a rendu la formation à grande échelle à la fois possible et productive.