Atención eficiente: Atención Flash, RoPE y contexto largo

El mecanismo de autoatención del transformador es lo que hace que los LLM sean tan poderosos: cada token puede atender a todos los demás tokens en el contexto. Pero hay un precio: la matriz de atención crece con el cuadrado de la longitud de la secuencia. Duplicar la ventana de contexto no duplica el costo: lo cuadriplica. Esta lección cubre los avances de ingeniería que hicieron prácticas las ventanas de contexto de 128K y 1M de tokens.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.