Evaluación de solicitudes de LLM: métricas, LLM como juez y puntos de referencia
Cuando envía una solicitud de LLM, ¿cómo sabe que está mejorando y no empeorando? A diferencia de un clasificador donde la precisión lo dice todo, las aplicaciones LLM producen resultados abiertos que requieren una evaluación multidimensional. Esta lección cubre toda la pila de evaluación: desde métricas automáticas que puede ejecutar en CI, hasta LLM como juez que escala la evaluación a nivel humano, hasta los puntos de referencia públicos que le permiten comparar su modelo con el campo.