Atención eficiente: Atención Flash, RoPE y contexto largo
El mecanismo de autoatención del transformador es lo que hace que los LLM sean tan poderosos: cada token puede atender a todos los demás tokens en el contexto. Pero hay un precio: la matriz de atención crece con el cuadrado de la longitud de la secuencia. Duplicar la ventana de contexto no duplica el costo: lo cuadriplica. Esta lección cubre los avances de ingeniería que hicieron prácticas las ventanas de contexto de 128K y 1M de tokens.