BERT vs GPT: un transformador, dos objetivos de formación

La atención propia puede conectar cualquier posición: la máscara decide lo que está permitido. En los codificadores estilo BERT, la máscara de atención es (casi) todos unos: para MLM, el modelo ve a la izquierda y a la derecha de [MASK] - contexto bidireccional. En los decodificadores de estilo GPT, el token t no debe atender a tokens futuros: una máscara causal mantiene solo el triángulo inferior. Utilice el widget: coloque el cursor sobre los tokens BERT para las curvas; en el lado GPT, presione Siguiente token y cambie a Máscara de atención.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.