Evaluación de modelos generativos: perplejidad, BLEU y FID
Evaluar un modelo generativo es mucho más difícil que evaluar un clasificador. Para la clasificación existe una etiqueta correcta; por generación hay infinitos resultados buenos. "El sol brilla" y "Un sol brillante brilla" son continuaciones perfectas del mismo mensaje, pero una métrica que exige una coincidencia exacta de cadenas fallará en la segunda.