BERT и GPT: один Transformer — разные задачи
После self-attention остаётся важный вопрос: какие позиции может видеть каждый токен? В BERT (encoder) маска внимания почти полная: при обучении MLM модель видит контекст слева и справа от [MASK] — это двунаправленный контекст. В GPT (decoder) при генерации токен t не имеет права «подглядывать» в будущее: действует каузальная (авторегрессивная) маска — нижний треугольник. Ниже — интерактив: наведите на токен BERT и посмотрите стрелки; на стороне GPT нажимайте «Следующий токен» и переключитесь на «Маска внимания».