Оптимизаторы: как нейросеть идёт к минимуму
Все оптимизаторы решают одну задачу: обновить веса чтобы loss уменьшился. Разница в том как именно они используют градиент. SGD — прямолинейно: шаг в сторону антиградиента. Momentum — с инерцией: помнит предыдущие шаги. Adam — умно: адаптирует размер шага для каждого параметра отдельно на основе истории градиентов. Именно эта адаптивность делает Adam стандартом для трансформеров.