Construire des jeux de données de mise au point : qualité, formats et données synthétiques
C'est généralement l'ensemble de données qui est l'endroit où les projets de réglage fin échouent : ni le code de formation, ni les hyperparamètres, ni le choix du modèle de base. Un modèle formé sur 500 exemples divers et de haute qualité surpasse presque toujours un modèle formé sur 50 000 exemples bruyants. Cette leçon couvre les trois formats d'ensembles de données, le pipeline de données qui transforme les matières premières en données prêtes à être entraînées et pourquoi les données synthétiques générées par GPT-4 sont devenues l'approche dominante.