Optimizadores: cómo una red neuronal alcanza el mínimo
Todos los optimizadores resuelven el mismo problema: actualizar los pesos para que la pérdida disminuya. La diferencia es cómo usan el degradado. SGD es directo: un paso opuesto al gradiente. El impulso añade inercia: recuerda pasos pasados. Adam es adaptativo: escala el paso por parámetro del historial de gradientes. Esa adaptabilidad es la razón por la que Adam es el predeterminado para los transformadores.