Attention : chaque jeton voit le contexte complet à la fois
Avant les transformateurs, les RNN lisaient le texte de manière séquentielle, mot par mot. Un mot au début d’une longue phrase n’a pratiquement pas influencé la fin : le signal s’est estompé. L'attention a changé cela : chaque jeton examine tous les autres jetons en parallèle et décide de l'importance de chacun. Parallèle et non séquentiel. C’est ce qui permet aux transformateurs de s’adapter à des milliards de paramètres.