BERT vs GPT : un Transformer, deux objectifs de formation

L’attention personnelle peut relier n’importe quelle position – le masque décide de ce qui est autorisé. Dans les encodeurs de style BERT, le masque d'attention est (presque) tout à un : pour MLM, le modèle voit à gauche et à droite de [MASK] — contexte bidirectionnel. Dans les décodeurs de style GPT, le jeton t ne doit pas s'occuper des futurs jetons : un masque causal ne conserve que le triangle inférieur. Utilisez le widget : survolez les jetons BERT pour les courbes ; du côté GPT, appuyez sur le jeton suivant et passez au masque d'attention.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.