Optimiseurs : comment un réseau de neurones atteint le minimum

Tous les optimiseurs résolvent le même problème : mettre à jour les pondérations pour réduire les pertes. La différence réside dans la manière dont ils utilisent le dégradé. SGD est direct : un pas opposé au gradient. L'élan ajoute de l'inertie : il se souvient des étapes passées. Adam est adaptatif : il met à l'échelle le pas par paramètre à partir de l'historique du gradient. Cette adaptabilité est la raison pour laquelle Adam est la valeur par défaut pour les transformateurs.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.