Estrategias de muestreo: temperatura, top-k, top-p y búsqueda de haz
Una vez que el modelo ha calculado una distribución de probabilidad sobre el vocabulario, algo debe elegir el siguiente token. Esa elección determina si el resultado es creativo o conservador, diverso o repetitivo. Esta lección cubre las cinco estrategias más comunes y cuándo usar cada una.
Estrategia 1: decodificación codiciosa
ℹ️
La decodificación codiciosa siempre elige el token con la probabilidad más alta: `siguiente = argmax P(t | contexto)`. Es determinista: el mismo mensaje siempre produce el mismo resultado. El problema: greedy es propenso a bucles repetitivos y terminaciones "seguras" pero aburridas. Al elegir el mejor token local en cada paso, se pueden perder secuencias globalmente mejores.
Estrategia 2: Temperatura
ℹ️
La temperatura T divide todos los logits antes de softmax: `probs = softmax(logits / T)`. En T < 1 la distribución se agudiza: el modelo adquiere más confianza en los tokens principales. En T > 1 se aplana: los tokens de menor probabilidad obtienen una mayor participación. Cuando T → 0, el comportamiento se acerca a la avaricia. Valores típicos: 0,6–0,8 para tareas precisas (código, hechos), 1,0–1,2 para escritura creativa.
Pruébalo: mueve los controles deslizantes y observa cómo cambia la distribución.
Las barras siguientes muestran las probabilidades simbólicas después de aplicar los tres filtros en orden: primero la temperatura, luego top-k y luego top-p. Los tokens atenuados están excluidos del muestreo.
Estrategia 3: muestreo Top-k
ℹ️
El muestreo Top-k mantiene solo los k tokens con la mayor probabilidad, pone a cero el resto y vuelve a normalizar. Esto corta el final de la distribución, evitando que el modelo elija alguna vez una ficha muy improbable (y normalmente incoherente). Valores típicos: k = 20–100. Limitación: k es fijo y no se adapta a la confianza del modelo en cada posición.
Estrategia 4: muestreo Top-p (núcleo)
ℹ️
Muestreo top-p (núcleo) selecciona el conjunto más pequeño de tokens cuya probabilidad acumulada ≥ p (normalmente 0,9–0,95), pone a cero el resto y vuelve a normalizar. A diferencia de top-k, el tamaño del núcleo es adaptativo: cuando el modelo es seguro (una ficha en p = 0,95), el núcleo tiene 1 ficha; cuando es incierto, puede tener 50. Esto hace que topp sea robusto en diferentes niveles de confianza.
Estrategia 5: búsqueda de haz
ℹ️
Búsqueda de haz mantiene k mejores secuencias parciales (ancho de haz) en cada paso. Cada uno se expande a todos los siguientes tokens posibles; las k secuencias con mayor puntuación sobreviven. La ganadora es la secuencia con la probabilidad logarítmica total más alta. La búsqueda por haz es determinista y popular en la traducción automática (ancho 4–8). Produce malos resultados para la generación abierta: la producción es plana, repetitiva y carece de diversidad.
Comparación lado a lado
💡
Receta práctica para modelos de chat: temperatura = 0,7–0,8 combinada con top-p = 0,9–0,95. OpenAI recomienda no usar temperatura y top-p simultáneamente (alterar una, dejar la otra por defecto), pero una combinación moderada suele funcionar mejor en la práctica. Para generación de código: temperatura = 0,2, top-p = 0,95 o simplemente codicioso.