Эффективное внимание: мгновенное внимание, RoPE и длинный контекст
Механизм самообслуживания преобразователя делает LLM такими мощными: каждый токен может обрабатывать любой другой токен в контексте. Но есть цена: матрица внимания растет пропорционально квадрату длины последовательности. Удвоение контекстного окна не удваивает стоимость, а увеличивает ее в четыре раза. В этом уроке рассматриваются инженерные достижения, которые сделали контекстные окна с токенами 128 КБ и 1 М на практике.