ResNet : pourquoi 152 couches peuvent en battre 20

Avant 2015, l’ajout de couches au-delà d’un certain point nuisait à la précision, même sur l’ensemble d’entraînement. Pas de surajustement : le réseau a simplement arrêté d’apprendre. C'est ce qu'on a appelé le problème de la dégradation. Lui et coll. Je l'ai corrigé avec une idée : si les couches supplémentaires n'ajoutent rien d'utile, laissez-les apprendre à prédire zéro. Ensuite, la sortie du bloc est égale à l’entrée (identité). Une connexion sautée rend cela trivial et le gradient a toujours une autoroute directe.

Full content is available with a subscription.
Get full access to all courses on the platform for one year with a single payment.
Unlike other platforms that charge per course, here you get everything for one price, and after one year of use there will be no automatic charge for the following year.