Estrategias de muestreo: temperatura, top-k, top-p y búsqueda de haz

Una vez que el modelo ha calculado una distribución de probabilidad sobre el vocabulario, algo debe elegir el siguiente token. Esa elección determina si el resultado es creativo o conservador, diverso o repetitivo. Esta lección cubre las cinco estrategias más comunes y cuándo usar cada una.

Estrategia 1: decodificación codiciosa
La decodificación codiciosa siempre elige el token con la probabilidad más alta: `siguiente = argmax P(t | contexto)`. Es determinista: el mismo mensaje siempre produce el mismo resultado. El problema: greedy es propenso a bucles repetitivos y terminaciones "seguras" pero aburridas. Al elegir el mejor token local en cada paso, se pueden perder secuencias globalmente mejores.
Estrategia 2: Temperatura
La temperatura T divide todos los logits antes de softmax: `probs = softmax(logits / T)`. En T < 1 la distribución se agudiza: el modelo adquiere más confianza en los tokens principales. En T > 1 se aplana: los tokens de menor probabilidad obtienen una mayor participación. Cuando T → 0, el comportamiento se acerca a la avaricia. Valores típicos: 0,6–0,8 para tareas precisas (código, hechos), 1,0–1,2 para escritura creativa.
Pruébalo: mueve los controles deslizantes y observa cómo cambia la distribución.

Las barras siguientes muestran las probabilidades simbólicas después de aplicar los tres filtros en orden: primero la temperatura, luego top-k y luego top-p. Los tokens atenuados están excluidos del muestreo.

Mueva los controles deslizantes: observe cómo cambia la distribución ▶
SAMPLING STRATEGIES
Temperature
T = 1.0
Top-k (0 = off)
k = off
Top-p (1.0 = off)
p = off
Active tokens8
Entropy2.09 bits
Top tokentecho (47%)
techo
47%
sofá
26%
piso
12%
ventana
6%
mesa
4%
cama
3%
agua
1%
patio
1%
Estrategia 3: muestreo Top-k
El muestreo Top-k mantiene solo los k tokens con la mayor probabilidad, pone a cero el resto y vuelve a normalizar. Esto corta el final de la distribución, evitando que el modelo elija alguna vez una ficha muy improbable (y normalmente incoherente). Valores típicos: k = 20–100. Limitación: k es fijo y no se adapta a la confianza del modelo en cada posición.
Estrategia 4: muestreo Top-p (núcleo)
Muestreo top-p (núcleo) selecciona el conjunto más pequeño de tokens cuya probabilidad acumulada ≥ p (normalmente 0,9–0,95), pone a cero el resto y vuelve a normalizar. A diferencia de top-k, el tamaño del núcleo es adaptativo: cuando el modelo es seguro (una ficha en p = 0,95), el núcleo tiene 1 ficha; cuando es incierto, puede tener 50. Esto hace que topp sea robusto en diferentes niveles de confianza.
Estrategia 5: búsqueda de haz
Búsqueda de haz mantiene k mejores secuencias parciales (ancho de haz) en cada paso. Cada uno se expande a todos los siguientes tokens posibles; las k secuencias con mayor puntuación sobreviven. La ganadora es la secuencia con la probabilidad logarítmica total más alta. La búsqueda por haz es determinista y popular en la traducción automática (ancho 4–8). Produce malos resultados para la generación abierta: la producción es plana, repetitiva y carece de diversidad.
Comparación lado a lado
Cinco estrategias: elija por tipo de tarea
EstrategiadeterministaParámetroLo mejor parapunto débil
codiciosoCreación rápida de prototipos, tareas exactasÓptimo local repetitivo
TemperaturaNoT (0,1-2,0)Escritura creativa, diversidad.T alta → incoherencia
Top-kNok (20–100)Corte de cola controladok no se adapta a la confianza
arriba-pNop (0,9–0,95)Núcleo adaptativo, modelos de chat.Interactúa mal con T alta
búsqueda de hazancho (4–8)Traducción, salida estructuradaAburrido texto abierto
Receta práctica para modelos de chat: temperatura = 0,7–0,8 combinada con top-p = 0,9–0,95. OpenAI recomienda no usar temperatura y top-p simultáneamente (alterar una, dejar la otra por defecto), pero una combinación moderada suele funcionar mejor en la práctica. Para generación de código: temperatura = 0,2, top-p = 0,95 o simplemente codicioso.

Conclusiones clave

La estrategia de muestreo es un dial entre el determinismo y la diversidad. Ninguna estrategia es mejor para todas las tareas; la elección correcta depende de si necesita resultados exactos, creativos o estructurados.
Codicioso = argmax en cada paso. Determinista, rápido, repetitivo.
La temperatura T divide logits antes de softmax: T < 1 agudiza, T > 1 aplana
Top-k corta la cola a las k fichas más probables: buena pero no adaptable
Top-p (núcleo) mantiene el conjunto más pequeño sumando p: adaptable a la confianza del modelo
Búsqueda por haz = k mejores secuencias en paralelo: excelente para traducción, deficiente para chatear
Valor predeterminado práctico: temperatura 0,7–0,8 + top-p 0,9–0,95