Attention efficace : Flash Attention, RoPE et contexte long
Le mécanisme d'auto-attention du transformateur est ce qui rend les LLM si puissants : chaque jeton peut s'occuper de tous les autres jetons dans le contexte. Mais il y a un prix : la matrice d'attention grandit avec le carré de la longueur de la séquence. Doubler la fenêtre contextuelle ne double pas le coût, mais le quadruple. Cette leçon couvre les avancées techniques qui ont rendu pratiques les fenêtres contextuelles de 128 Ko et 1 million de jetons.