Atención: cada token ve el contexto completo a la vez
Antes de los transformadores, los RNN leían el texto secuencialmente, palabra por palabra. Una palabra al comienzo de una frase larga apenas influyó en el final: la señal se desvaneció. La atención cambió esto: cada token mira todos los demás tokens en paralelo y decide qué tan importante es cada uno. Paralelo, no secuencial. Eso es lo que permite a los transformadores escalar a miles de millones de parámetros.