Atención: cada token ve el contexto completo a la vez

Antes de los transformadores, los RNN leían el texto secuencialmente, palabra por palabra. Una palabra al comienzo de una frase larga apenas influyó en el final: la señal se desvaneció. La atención cambió esto: cada token mira todos los demás tokens en paralelo y decide qué tan importante es cada uno. Paralelo, no secuencial. Eso es lo que permite a los transformadores escalar a miles de millones de parámetros.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.