Modèles autorégressifs : prédire le prochain jeton
ℹ️
Jeton : unité de texte minimale traitée par un LLM. Un jeton n’est ni une lettre ni un mot – c’est quelque chose entre les deux. Le mot incroyable est divisé par l'algorithme BPE en trois jetons : `un` + `believ` + `able`. Les LLM modernes ont des vocabulaires de 32 000 à 128 000 jetons. Règle générale : 1 jeton ≈ 4 caractères, 100 jetons ≈ 75 mots anglais.
La règle de la chaîne : une condition à la fois
Un modèle de langage apprend à calculer P(jeton suivant | tous les jetons précédents). Cela découle directement de la règle de multiplication des probabilités : la probabilité d'une séquence est égale au produit des probabilités conditionnelles de chaque jeton étant donné tout ce qui le précède. Les modèles construits sur ce principe sont appelés autorégressifs car chaque sortie sert d'entrée pour l'étape suivante.
Formellement :
P(t1,t2,…,tn)=i=1∏nP(ti∣t1,…,ti−1) Chaque étape de génération est une inférence de probabilité conditionnelle. Pour générer une réponse de 200 jetons, le modèle exécute cette passe avant 200 fois.
Une étape de génération : le pipeline complet
Appuyez sur chaque étape pour retracer ce qui se passe à l'intérieur du modèle lorsqu'il sélectionne le jeton suivant :
ℹ️
Logits — les nombres bruts générés par la dernière couche du modèle, un par jeton de vocabulaire. Les logits ne sont pas des probabilités : ils peuvent être n'importe quel nombre réel, leur somme n'est pas égale à 1, ils peuvent être négatifs. Plus le logit est grand, plus le modèle « préfère » ce jeton. La fonction softmax convertit les logits en une distribution de probabilité appropriée.
Des logits aux probabilités : softmax
Softmax :σ(xi)=∑jexjexi. Chaque sortie est positive, la somme de toutes les sorties est égale à 1. Faites glisser les logits ci-dessous – remarquez comment un petit changement dans un logit éloigne la probabilité de tous les autres. Le paramètre température T divise tous les logits avant softmax : un T faible affine la distribution, un T élevé l'aplatit.
La boucle de génération dans le code
Regardez le contexte grandir : jeton par jeton
Chaque barre montre la probabilité que le modèle ait attribué à ce jeton candidat à cette position. La barre verte est celle qui a été échantillonnée et ajoutée au contexte.
ℹ️
Fenêtre contextuelle — le nombre maximum de jetons que le modèle peut « voir » en une seule passe. GPT-2 : 1 024 jetons. GPT-4 Turbo : 128 000. Claude 3 : jusqu'à 200 000. Tout ce qui se trouve au-delà de la fenêtre est invisible pour le modèle. L'extension du contexte coûte cher - la complexité de l'attention du transformateur est de O (n²) en longueur de séquence.