Optimiseurs : comment un réseau de neurones atteint le minimum
Tous les optimiseurs résolvent le même problème : mettre à jour les pondérations pour réduire les pertes. La différence réside dans la manière dont ils utilisent le dégradé. SGD est direct : un pas opposé au gradient. L'élan ajoute de l'inertie : il se souvient des étapes passées. Adam est adaptatif : il met à l'échelle le pas par paramètre à partir de l'historique du gradient. Cette adaptabilité est la raison pour laquelle Adam est la valeur par défaut pour les transformateurs.