Evaluación de modelos generativos: perplejidad, BLEU y FID

Evaluar un modelo generativo es mucho más difícil que evaluar un clasificador. Para la clasificación existe una etiqueta correcta; por generación hay infinitos resultados buenos. "El sol brilla" y "Un sol brillante brilla" son continuaciones perfectas del mismo mensaje, pero una métrica que exige una coincidencia exacta de cadenas fallará en la segunda.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.