BERT vs GPT: un transformador, dos objetivos de formación
La atención propia puede conectar cualquier posición: la máscara decide lo que está permitido. En los codificadores estilo BERT, la máscara de atención es (casi) todos unos: para MLM, el modelo ve a la izquierda y a la derecha de [MASK] - contexto bidireccional. En los decodificadores de estilo GPT, el token t no debe atender a tokens futuros: una máscara causal mantiene solo el triángulo inferior. Utilice el widget: coloque el cursor sobre los tokens BERT para las curvas; en el lado GPT, presione Siguiente token y cambie a Máscara de atención.