Normalisation de l'activation : pourquoi le réseau est instable sans elle

Même avec une bonne initialisation Xavier/He, la variance d'activation dérive pendant l'entraînement. Les poids changent, les distributions changent – ​​c’est ce qu’on appelle le changement de covariable interne. Chaque couche reçoit une contribution progressivement « pire » et doit continuer à s’adapter. Les couches de normalisation corrigent ce problème directement : elles forcent les activations vers une distribution cible après chaque couche.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.