GUIDE DE L'IA Visuelle

Réseaux de transformateurs spatiaux

Les réseaux de transformateurs spatiaux (STN) sont des modules d'apprentissage qui permettent à un réseau neuronal de déformer, de faire pivoter, de recadrer ou de redimensionner activement son entrée pour se concentrer sur ce qui compte.

2 minutes de lectureDernière mise à jour

Aperçu

They give CNNs a built-in sense of spatial attention and invariance.

Plongée profonde

Les réseaux convolutifs standard ne sont que faiblement invariants aux changements de position, d'échelle et de rotation, s'appuyant sur la mise en commun pour un peu de tolérance. Réseaux de transformateurs spatiaux, introduits par Jaderberg et al. en 2015, corrigez ce problème en insérant un module différentiable qui effectue une transformation géométrique explicite sur les cartes de caractéristiques. Le module comporte trois parties : un réseau de localisation qui prédit les paramètres de transformation, un générateur de grille qui construit une grille d'échantillonnage à partir de ces paramètres et un échantillonneur qui interpole l'entrée aux points de la grille. Parce que chaque étape est différentiable, l’ensemble du transformateur est formé de bout en bout par rétropropagation sans supervision supplémentaire. Le réseau apprend, par exemple, à redresser les chiffres inclinés ou à zoomer sur la région concernée, améliorant ainsi la précision et la robustesse.

Aperçu technique

Le réseau de localisation génère des paramètres (souvent une matrice affine 2x3) pour la translation, l'échelle, la rotation et le cisaillement. Le générateur de grille mappe chaque pixel de sortie à une coordonnée source via cette matrice. L'échantillonneur lit ensuite l'entrée à l'aide d'une interpolation bilinéaire, qui est différentiable afin que les gradients soient transmis au réseau de localisation. Cela permet au module d'apprendre des transformations uniquement à partir de la perte de tâches, en s'occupant et en canonisant les régions pertinentes.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir des réseaux de transformateurs spatiaux

Les STN ont influencé la façon dont les réseaux gèrent la géométrie et l'attention, en alimentant les convolutions déformables et les modules de déformation appris. Alors que les transformateurs d'auto-attention dominent désormais, l'échantillonnage différenciable de style STN persiste dans les tâches nécessitant un alignement géométrique explicite : reconnaissance de texte, classification fine et normalisation des poses. Attendez-vous à ce qu’une déformation différenciable continue d’apparaître dans la vision 3D, le rendu neuronal et l’enregistrement d’images médicales, souvent combinée à l’attention plutôt que remplacée par celle-ci.

Mise en œuvre dans le monde réel

Redresser et aligner le texte incurvé ou pivoté avant la reconnaissance dans les systèmes OCR de texte de scène

Zoom sur des régions discriminantes (comme le bec ou l'aile d'un oiseau) pour une classification d'images à grain fin

Normalisation de la pose et de l'alignement du visage en tant qu'étape de prétraitement dans les pipelines de reconnaissance faciale

Correction des distorsions et alignement des scans lors de l'enregistrement des images médicales

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spatial Transformer Networks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Détection du transformateur DETR

Questions fréquemment posées

What is Spatial Transformer Networks?

Les réseaux de transformateurs spatiaux (STN) sont des modules d'apprentissage qui permettent à un réseau neuronal de déformer, de faire pivoter, de recadrer ou de redimensionner activement son entrée pour se concentrer sur ce qui compte. Ils confèrent aux CNN un sentiment intégré d’attention spatiale et d’invariance.

Quelle capacité un réseau de transformateurs spatiaux ajoute-t-il à un réseau neuronal ?

Les STN insèrent un module d'apprentissage qui peut traduire, faire pivoter, mettre à l'échelle ou déformer les cartes de fonctionnalités pour se concentrer sur le contenu pertinent.

Quels sont les trois composants qui composent un module de transformateur spatial ?

Un STN se compose d'un réseau de localisation (prédit les paramètres), d'un générateur de grille (construit les coordonnées d'échantillonnage) et d'un échantillonneur (interpole l'entrée).

Pourquoi un réseau de transformateurs spatiaux peut-il être formé avec une rétropropagation ordinaire ?

L'interpolation bilinéaire dans l'échantillonneur est différentiable, de sorte que les gradients reviennent via le générateur de grille vers le réseau de localisation, permettant un entraînement de bout en bout.

Que produit généralement le réseau de localisation pour une transformation affine ?

Pour les transformations affines, le réseau de localisation prédit six valeurs disposées sous forme de matrice 2x3 codant pour la traduction, l'échelle, la rotation et le cisaillement.

Pourquoi les CNN standards ne sont-ils que faiblement invariants aux changements spatiaux, ce qui motive les STN ?

Les CNN n'atteignent qu'une invariance spatiale modeste grâce à la mise en commun ; Les STN ajoutent une manière explicite et apprenable de gérer la position, l'échelle et la rotation.