BERT vs GPT : un Transformer, deux objectifs de formation
L’attention personnelle peut relier n’importe quelle position – le masque décide de ce qui est autorisé. Dans les encodeurs de style BERT, le masque d'attention est (presque) tout à un : pour MLM, le modèle voit à gauche et à droite de [MASK] — contexte bidirectionnel. Dans les décodeurs de style GPT, le jeton t ne doit pas s'occuper des futurs jetons : un masque causal ne conserve que le triangle inférieur. Utilisez le widget : survolez les jetons BERT pour les courbes ; du côté GPT, appuyez sur le jeton suivant et passez au masque d'attention.