Évaluation des modèles génératifs : perplexité, BLEU et FID
L'évaluation d'un modèle génératif est bien plus difficile que l'évaluation d'un classificateur. Pour la classification, il existe une étiquette correcte ; pour la génération, il existe une infinité de bons résultats. "Le soleil brille" et "Un soleil brillant brille" sont tous deux des continuations parfaites de la même invite - mais une métrique qui exige une correspondance exacte de chaîne échouera à la seconde.