Attention efficace : Flash Attention, RoPE et contexte long

Le mécanisme d'auto-attention du transformateur est ce qui rend les LLM si puissants : chaque jeton peut s'occuper de tous les autres jetons dans le contexte. Mais il y a un prix : la matrice d'attention grandit avec le carré de la longueur de la séquence. Doubler la fenêtre contextuelle ne double pas le coût, mais le quadruple. Cette leçon couvre les avancées techniques qui ont rendu pratiques les fenêtres contextuelles de 128 Ko et 1 million de jetons.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.