ResNet : pourquoi 152 couches peuvent en battre 20
Avant 2015, l’ajout de couches au-delà d’un certain point nuisait à la précision, même sur l’ensemble d’entraînement. Pas de surajustement : le réseau a simplement arrêté d’apprendre. C'est ce qu'on a appelé le problème de la dégradation. Lui et coll. Je l'ai corrigé avec une idée : si les couches supplémentaires n'ajoutent rien d'utile, laissez-les apprendre à prédire zéro. Ensuite, la sortie du bloc est égale à l’entrée (identité). Une connexion sautée rend cela trivial et le gradient a toujours une autoroute directe.