Modelos autorregresivos: predecir el próximo token
ℹ️
Token: la unidad mínima de texto que procesa un LLM. Una ficha no es una letra ni una palabra, es algo intermedio. La palabra increíble se divide mediante el algoritmo BPE en tres tokens: `un` + `believ` + `able`. Los LLM modernos tienen vocabularios de 32 000 a 128 000 tokens. Regla general: 1 ficha ≈ 4 caracteres, 100 fichas ≈ 75 palabras en inglés.
La regla de la cadena: un condicional a la vez
Un modelo de lenguaje aprende a calcular P(siguiente token | todos los tokens anteriores). Esto se deriva directamente de la regla de multiplicación de la probabilidad: la probabilidad de una secuencia es igual al producto de las probabilidades condicionales de cada token dado todo lo anterior. Los modelos creados según este principio se denominan autoregresivos porque cada salida se retroalimenta como entrada para el siguiente paso.
Formalmente:
P(t1,t2,…,tn)=i=1∏nP(ti∣t1,…,ti−1) Cada paso de generación es una inferencia de probabilidad condicional. Para generar una respuesta de 200 tokens, el modelo ejecuta este pase directo 200 veces.
Un paso generacional: el proceso completo
Presione cada paso para rastrear lo que sucede dentro del modelo cuando elige la siguiente ficha:
ℹ️
Logits: los números brutos generados por la última capa del modelo, uno por token de vocabulario. Los logits no son probabilidades: pueden ser cualquier número real, no suman 1 y pueden ser negativos. Cuanto más grande es el logit, más "prefiere" el modelo ese token. La función softmax convierte logits en una distribución de probabilidad adecuada.
De logits a probabilidades: softmax
Softmax:σ(xi)=∑jexjexi. Cada salida es positiva, todas las salidas suman 1. Arrastre los logits a continuación: observe cómo un pequeño cambio en un logit aleja la probabilidad de todos los demás. El parámetro de temperatura T divide todos los logits antes de softmax: una T baja agudiza la distribución, una T alta la aplana.
El bucle de generación en el código.
Observe cómo crece el contexto: token por token
Cada barra muestra la probabilidad que el modelo asignó a ese token candidato en esa posición. La barra verde es la que se muestreó y se agregó al contexto.
ℹ️
Ventana de contexto: la cantidad máxima de tokens que el modelo puede "ver" en un pase hacia adelante. GPT-2: 1.024 fichas. GPT-4 Turbo: 128 000. Claude 3: hasta 200 000. Todo lo que está más allá de la ventana es invisible para el modelo. Ampliar el contexto es costoso: la complejidad de la atención del transformador es O(n²) en la longitud de la secuencia.