Attention : chaque jeton voit le contexte complet à la fois

Avant les transformateurs, les RNN lisaient le texte de manière séquentielle, mot par mot. Un mot au début d’une longue phrase n’a pratiquement pas influencé la fin : le signal s’est estompé. L'attention a changé cela : chaque jeton examine tous les autres jetons en parallèle et décide de l'importance de chacun. Parallèle et non séquentiel. C’est ce qui permet aux transformateurs de s’adapter à des milliards de paramètres.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.