GUIDE DE L'IA Visuelle

Transformateur Swin

Le Swin Transformer est un transformateur de vision qui traite les images dans des fenêtres hiérarchiques décalées, rendant l'attention suffisamment efficace pour évoluer sur des images haute résolution.

2 minutes de lectureDernière mise à jour

Aperçu

It works as a general-purpose backbone for classification, detection, and segmentation.

Plongée profonde

Les transformateurs de vision standard calculent l'attention sur toutes les zones d'image, dont les coûts augmentent quadratiquement avec la taille de l'image, un obstacle pour les tâches denses comme la détection. Introduit par Microsoft Research en 2021, Swin (Shifted WINdows) divise à la place l'image en petites fenêtres qui ne se chevauchent pas et calcule l'auto-attention uniquement dans chaque fenêtre, ce qui fait augmenter le coût linéairement avec la taille de l'image. Pour permettre aux informations de traverser les limites de la fenêtre, les couches alternées déplacent la grille de la fenêtre, de sorte que les correctifs séparés partagent désormais une fenêtre. Swin construit également une hiérarchie : il commence par de petits correctifs et les fusionne progressivement, produisant des cartes de fonctionnalités multi-échelles un peu comme un CNN, qui s'intègre parfaitement dans les cadres de détection et de segmentation existants.

Aperçu technique

L'efficacité de Swin vient de l'auto-attention multi-têtes basée sur les fenêtres (W-MSA) : l'attention est confinée aux fenêtres fixes (par exemple les correctifs 7x7), de sorte que la complexité évolue de manière linéaire plutôt que quadratique avec le nombre de correctifs. Le bloc suivant utilise l'attention de fenêtre décalée (SW-MSA), déplaçant la partition de fenêtre d'une demi-fenêtre afin que des connexions entre fenêtres se forment. Les couches de fusion de patchs concatènent les patchs voisins entre les étapes, réduisant de moitié la résolution spatiale et doublant les canaux pour construire une pyramide de fonctionnalités.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir du transformateur Swin

Swin a démontré que les transformateurs hiérarchiques et sensibles à la localité peuvent rivaliser ou battre les CNN en tant que piliers de la vision universelle, et Swin V2 a poussé cela vers des modèles comportant des milliards de paramètres et des résolutions très élevées. Attendez-vous à un mélange continu de biais inductifs convolutionnels avec l'attention, des variantes d'attention plus efficaces et des structures de type Swin alimentant des modèles multimodaux et vidéo. À mesure que les modèles de base pour la vision mûrissent, les conceptions hiérarchiques produisant des caractéristiques multi-échelles restent particulièrement utiles pour les tâches de prédiction denses.

Mise en œuvre dans le monde réel

Classification ImageNet de haute précision en tant que colonne vertébrale pré-entraînée

Détection d'objets et segmentation d'instances dans des frameworks tels que Mask R-CNN et Cascade R-CNN

Segmentation sémantique des scènes de rue et des images satellite

Analyse d'images médicales où la haute résolution et les détails multi-échelles sont importants

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Transformateurs de diffusion

Questions fréquemment posées

What is Swin Transformer?

Le Swin Transformer est un transformateur de vision qui traite les images dans des fenêtres hiérarchiques décalées, rendant l'attention suffisamment efficace pour évoluer sur des images haute résolution. Il fonctionne comme une épine dorsale à usage général pour la classification, la détection et la segmentation.

Que signifie le « Swin » dans Swin Transformer ?

Swin signifie Shifted Windows, le mécanisme qui permet aux fenêtres d'attention locale d'échanger des informations entre les couches.

Pourquoi l’auto-attention informatique dans les fenêtres locales est-elle bénéfique ?

Limiter l'attention aux fenêtres de taille fixe entraîne une croissance linéaire du coût de calcul avec la taille de l'image, contrairement à la croissance quadratique de l'attention globale.

Comment Swin permet-il aux informations de circuler entre des fenêtres distinctes ?

Les couches alternées décalent la grille des fenêtres d'une demi-fenêtre, de sorte que les correctifs précédemment présents dans différentes fenêtres puissent s'occuper les uns des autres.

Que font les couches de fusion de patchs entre les étapes Swin ?

La fusion de patchs concatène les patchs voisins pour réduire de moitié la résolution spatiale et doubler la profondeur de canal, créant ainsi une hiérarchie multi-échelle.

Pourquoi la sortie hiérarchique et multi-échelle de Swin est-elle particulièrement utile ?

Les cartes de fonctionnalités multi-échelles imitent les backbones CNN, de sorte que Swin s'intègre facilement aux cadres de prédiction dense comme Mask R-CNN.