Creación de conjuntos de datos de ajuste: calidad, formatos y datos sintéticos
El conjunto de datos suele ser el lugar donde fallan los proyectos de ajuste: no el código de entrenamiento, ni los hiperparámetros, ni la elección del modelo base. Un modelo entrenado con 500 ejemplos diversos y de alta calidad casi siempre supera a uno entrenado con 50.000 ejemplos ruidosos. Esta lección cubre los tres formatos de conjuntos de datos, el proceso de datos que convierte la materia prima en datos listos para el entrenamiento y por qué los datos sintéticos generados por GPT-4 se han convertido en el enfoque dominante.