GUIDE DE L'IA Visuelle

Réseaux résiduels

Les réseaux résiduels (ResNets) sont des réseaux de neurones profonds qui ajoutent des « connexions sautées » permettant aux couches d'apprendre de petits ajustements au lieu de transformations complètes.

2 minutes de lectureDernière mise à jour

Aperçu

This simple trick made it possible to train networks hundreds of layers deep, sparking a leap in image recognition accuracy.

Plongée profonde

Avant les ResNets, l’empilement de plusieurs couches rendait paradoxalement les performances des réseaux moins bonnes, même sur les données de formation, un problème appelé dégradation. En 2015, les chercheurs de Microsoft Kaiming He et ses collègues ont introduit le bloc résiduel : au lieu de demander à une pile de couches de produire directement une sortie H(x), ils lui ont laissé apprendre un résidu F(x) = H(x) - x, puis ont ajouté l'entrée d'origine x via un raccourci. Si un calque n'est pas nécessaire, il peut simplement apprendre à ne rien faire (F(x) = 0). ResNet-152 a remporté le concours ImageNet 2015 avec une erreur dans le top 5 d'environ 3,6 %, dépassant les estimations au niveau humain, et son architecture est devenue l'épine dorsale de la détection, de la segmentation et de l'imagerie médicale.

Aperçu technique

La connexion sautée transforme le travail de chaque bloc en y = F(x) + x. Lors de la rétropropagation, le dégradé traverse le raccourci d'identité sans changement, de sorte qu'il ne peut pas disparaître jusqu'à près de zéro, même sur des centaines de couches. Cela permet aux deep stacks de pouvoir être entraînés. Les raccourcis d'identité n'ajoutent aucun paramètre supplémentaire ; ce n'est que lorsque les tailles d'entrée et de sortie diffèrent qu'une petite projection (convolution 1x1) ajuste les dimensions avant l'ajout.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir des réseaux résiduels

Les connexions résiduelles sont désormais quasi universelles : les transformateurs, les modèles de diffusion et les grands modèles de langage les utilisent tous pour stabiliser la formation de piles très profondes. La recherche se poursuit sur des variantes telles que les ResNets de pré-activation, les chemins groupés de ResNeXt et la combinaison d'idées résiduelles avec une formation sans normalisation. Attendez-vous à ce que le principe fondamental de saut de connexion persiste en tant qu'élément de base par défaut, même si les architectures environnantes s'éloignent des convolutions pures pour se tourner vers l'attention et les conceptions hybrides.

Mise en œuvre dans le monde réel

Piliers de classification ImageNet (ResNet-50, ResNet-101) utilisés comme extracteurs de fonctionnalités pré-entraînés pour l'apprentissage par transfert

Détection de tumeurs et de lésions dans les images de radiologie et de pathologie à l'aide d'encodeurs basés sur ResNet

Cadres de détection d'objets et de segmentation d'instances tels que Faster R-CNN et Mask R-CNN qui utilisent les backbones ResNet

Pipelines de perception autonomes qui classent les piétons, les véhicules et les panneaux à partir des cadres de caméras

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Residual Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Réseaux pyramidaux de fonctionnalités

Questions fréquemment posées

What is Residual Networks?

Les réseaux résiduels (ResNets) sont des réseaux de neurones profonds qui ajoutent des « connexions sautées » permettant aux couches d'apprendre de petits ajustements au lieu de transformations complètes. Cette astuce simple a permis d’entraîner des réseaux sur des centaines de couches de profondeur, déclenchant ainsi un bond en avant dans la précision de la reconnaissance d’images.

Quel problème les connexions résiduelles ont-elles spécifiquement résolu ?

Avant ResNets, l’ajout de couches supplémentaires entraînait une dégradation de la précision, même sur les données d’entraînement. Ignorer les connexions a résolu ce problème en rendant les couches faciles à optimiser.

Que calcule réellement un bloc résiduel comme sortie ?

Un bloc résiduel génère y = F(x) + x, en ajoutant le résidu appris à l'entrée via une connexion de saut.

Pourquoi les connexions sautées facilitent-elles les dégradés pendant l'entraînement ?

Le raccourci d'identité fournit un chemin direct pour que les dégradés reviennent sans changement, évitant ainsi le problème de disparition des dégradés dans les piles très profondes.

Environ combien de couches le modèle ResNet gagnant de 2015 comportait-il ?

ResNet-152, avec 152 couches, a remporté le concours ImageNet 2015, démontrant que les réseaux très profonds pouvaient désormais être formés avec succès.

Si les couches d'un bloc résiduel apprennent F(x) = 0, que fait le bloc ?

Lorsque F(x) = 0, la sortie est juste x, donc le bloc devient un mappage d'identité. Cela rend les couches supplémentaires inoffensives si elles ne sont pas nécessaires.