Stratégies d'échantillonnage : recherche de température, top-k, top-p et faisceau

Une fois que le modèle a calculé une distribution de probabilité sur le vocabulaire, quelque chose doit sélectionner le jeton suivant. Ce choix détermine si la production est créative ou conservatrice, diversifiée ou répétitive. Cette leçon couvre les cinq stratégies les plus courantes et quand les utiliser.

Stratégie 1 — Décodage gourmand
Le décodage gourmand sélectionne toujours le jeton avec la probabilité la plus élevée : `next = argmax P(t | context)`. C'est déterministe : la même invite produit toujours le même résultat. Le problème : gourmand est sujet aux boucles répétitives et aux complétions « sûres » mais ennuyeuses. En choisissant le meilleur jeton localement à chaque étape, il peut manquer des séquences globalement meilleures.
Stratégie 2 — Température
La température T divise tous les logits avant softmax : `probs = softmax(logits / T)`. À T < 1, la distribution s'accentue — le modèle devient plus confiant dans les meilleurs jetons. À T > 1, il s'aplatit : les jetons à faible probabilité obtiennent une part plus importante. Lorsque T → 0, le comportement se rapproche de la gourmandise. Valeurs typiques : 0,6 à 0,8 pour des tâches précises (code, faits), 1,0 à 1,2 pour l'écriture créative.
Essayez-le : déplacez les curseurs et observez le changement de distribution

Les barres ci-dessous montrent les probabilités des jetons après application des trois filtres dans l'ordre : température d'abord, puis top-k, puis top-p. Les jetons grisés sont exclus de l'échantillonnage.

Déplacez les curseurs – observez comment la distribution change ▶
SAMPLING STRATEGIES
Temperature
T = 1.0
Top-k (0 = off)
k = off
Top-p (1.0 = off)
p = off
Active tokens8
Entropy2.09 bits
Top tokentoit (47%)
toit
47%
canapé
26%
sol
12%
fenêtre
6%
tableau
4%
lit
3%
eau
1%
cour
1%
Stratégie 3 — Échantillonnage Top-k
L'échantillonnage Top-k conserve uniquement les k jetons avec la probabilité la plus élevée, met à zéro le reste et renormalise. Cela coupe la queue de la distribution, empêchant le modèle de choisir un jeton très improbable (et généralement incohérent). Valeurs typiques : k = 20–100. Limitation : k est fixe et ne s'adapte pas au degré de confiance du modèle à chaque position.
Stratégie 4 — Échantillonnage Top-p (noyau)
L'échantillonnage Top-p (noyau) sélectionne le plus petit ensemble de jetons dont la probabilité cumulée ≥ p (généralement 0,9 à 0,95), met à zéro le reste et renormalise. Contrairement à top-k, la taille du noyau est adaptative : lorsque le modèle est confiant (un jeton à p = 0,95), le noyau a 1 jeton ; lorsqu'il est incertain, il peut en avoir 50. Cela rend le top-p robuste à différents niveaux de confiance.
Stratégie 5 — Recherche de faisceau
La recherche de faisceau conserve les k meilleures séquences partielles (largeur du faisceau) à chaque étape. Chacun est étendu à tous les jetons suivants possibles ; les k séquences les mieux notées survivent. Le gagnant est la séquence avec la probabilité logarithmique totale la plus élevée. La recherche par faisceau est déterministe et populaire en traduction automatique (largeur 4 à 8). Il produit de mauvais résultats pour une génération ouverte : le résultat est plat, répétitif et manque de diversité.
Comparaison côte à côte
Cinq stratégies – choisissez par type de tâche
StratégieDéterministeParamètreIdéal pourPoint faible
GourmandOuiPrototypage rapide, tâches précisesOptimum local répétitif
TempératureNonT (0,1–2,0)Écriture créative, diversitéT élevé → incohérence
Top-kNonk (20-100)Coupure de queue contrôléek ne s'adapte pas à la confiance
Haut-pNonp (0,9-0,95)Noyau adaptatif, modèles de discussionInteragit mal avec un T élevé
Recherche de faisceauOuilargeur (4–8)Traduction, sortie structuréeTexte ouvert et ennuyeux
Recette pratique pour les modèles de chat : température = 0,7–0,8 combinée avec top-p = 0,9–0,95. OpenAI recommande de ne pas utiliser simultanément la température et le top-p (modifier l'un, laisser l'autre par défaut), mais une combinaison modérée fonctionne souvent mieux dans la pratique. Pour la génération de code : température = 0,2, top-p = 0,95, ou simplement gourmand.

Points clés à retenir

La stratégie d’échantillonnage est un cadran entre déterminisme et diversité. Aucune stratégie unique n'est idéale pour toutes les tâches : le bon choix dépend si vous avez besoin d'un résultat précis, créatif ou structuré.
Greedy = argmax à chaque étape. Déterministe, rapide, répétitif
La température T divise les logits avant softmax : T < 1 accentue, T > 1 aplatit
Top-k coupe la queue jusqu'aux k jetons les plus probables — bon mais pas adaptatif
Top-p (noyau) conserve le plus petit ensemble totalisant p — adaptatif à la confiance du modèle
Recherche par faisceau = k meilleures séquences en parallèle — excellent pour la traduction, médiocre pour le chat
Valeur par défaut pratique : température 0,7–0,8 + top-p 0,9–0,95