GUIDE DE L'IA Visuelle

Autodistillation DINO

DINO est une méthode auto-supervisée qui entraîne un transformateur de vision à comprendre des images sans aucune étiquette, en laissant le réseau s'auto-apprendre.

2 minutes de lectureDernière mise à jour

Aperçu

It produces features so clean that object boundaries emerge for free in the attention maps.

Plongée profonde

DINO, abréviation de auto-distillation sans étiquettes, a été publié par Meta AI (puis Facebook AI) en 2021. Il utilise deux copies du même réseau – un étudiant et un enseignant – et leur alimente différentes cultures augmentées d'une seule image. L'élève essaie de correspondre à la distribution des résultats de l'enseignant, même si l'enseignant ne voit qu'un point de vue différent. Surtout, l'enseignant n'est pas formé directement ; ses poids sont une moyenne mobile exponentielle de ceux de l'élève, lentement à la traîne. Pour empêcher le réseau de s'effondrer en une seule réponse constante, DINO centre et affine les résultats de l'enseignant. Un résultat frappant est que les cartes d’auto-attention du transformateur de vision résultant segmentent les objets sans jamais savoir ce qu’est un objet.

Aperçu technique

Les deux réseaux génèrent une distribution de probabilité de grande dimension après un softmax. L’élève voit de petites cultures locales ainsi que des vues globales, tandis que l’enseignant ne voit que des vues globales – une stratégie multi-cultures qui favorise la cohérence du local au mondial. La perte est une entropie croisée entre les distributions des enseignants et des étudiants, les gradients traversant uniquement l'étudiant. Deux astuces empêchent l'effondrement : le centrage soustrait une moyenne mobile aux logits de l'enseignant, et une basse température les aiguise, s'équilibrant afin que les résultats restent diversifiés.

Impact stratégique

Vitesse et échelle

L’IA visuelle peut automatiser les tâches d’inspection, de détection et de marquage à grande échelle.

Choix de construction

Les équipes créatives peuvent prototyper des concepts plus rapidement avec moins de révisions manuelles.

Équipe et flux de travail

Les opérations peuvent utiliser des signaux d’image et vidéo qui étaient auparavant difficiles à traiter.

L'avenir de l'autodistillation DINO

DINO a lancé un important axe de travail. DINOv2 (2023) a étendu la recette à plus d’un milliard d’images organisées, produisant des fonctionnalités visuelles polyvalentes qui rivalisent avec les modèles supervisés en matière d’estimation de profondeur, de segmentation et de récupération – utilisables sans réglage fin. Attendez-vous à ce que l’autodistillation reste centrale alors que le domaine recherche des modèles de base sans étiquette pour la vision, la robotique et les systèmes multimodaux, où l’annotation est coûteuse. La propriété de segmentation émergente continue également d’alimenter la recherche sur la perception d’un vocabulaire interprétable et ouvert.

Mise en œuvre dans le monde réel

Segmentation d'objets non supervisée, où les cartes d'attention de DINO décrivent les objets sans aucune étiquette de masque

Récupération d'images et détection de copie, à l'aide des fonctionnalités de DINO pour trouver des images quasi-dupliquées ou visuellement similaires

DINOv2 fonctionne comme une épine dorsale gelée pour les tâches d'estimation de profondeur et de prédiction dense

Pré-entraînement de modèles médicaux ou de vision satellite où les données étiquetées sont rares ou coûteuses

Risques et garde-fous

Les droits à l’image et le consentement peuvent devenir des risques juridiques si la provenance n’est pas claire.

Les performances du modèle peuvent varier en fonction de l'éclairage, des données démographiques et des environnements.

Les faux positifs peuvent passer inaperçus si les seuils de confiance ne sont pas surveillés.

Feuille de route de mise en œuvre

1

Définissez des critères d’acceptation pour la précision, le rappel et les coûts d’erreur.

2

Testez avec des données qui correspondent aux conditions de production réelles.

3

Ajoutez un examen humain pour les prédictions peu fiables ou à fort impact.

4

Suivez la dérive du modèle et revalidez après les modifications de la caméra ou de l’ensemble de données.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DINO Self-Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Échantillonnage par distillation DreamFusion et Score

Questions fréquemment posées

What is DINO Self-Distillation?

DINO est une méthode auto-supervisée qui entraîne un transformateur de vision à comprendre des images sans aucune étiquette, en laissant le réseau s'auto-apprendre. Il produit des caractéristiques si nettes que les limites des objets émergent librement dans les cartes d'attention.

Que signifie le « NON » dans DINO ?

DINO signifie auto-distillation sans étiquette : il est entièrement auto-supervisé et ne nécessite aucune annotation humaine.

Comment les pondérations du réseau d'enseignants sont-elles mises à jour dans DINO ?

L'enseignant est une EMA de l'élève, il suit donc l'élève en douceur plutôt que d'être formé directement.

Quel problème le centrage et l’affinement des résultats des enseignants évitent-ils ?

Le centrage et l’affinage s’équilibrent pour maintenir la diversité des résultats des enseignants, évitant ainsi la solution triviale et constante.

Dans la stratégie multi-cultures de DINO, quels points de vue l'enseignant reçoit-il ?

L'enseignant ne voit que les cultures mondiales tandis que l'élève voit également les petites cultures locales, encourageant ainsi la cohérence du local au mondial.

Quelle propriété surprenante émerge dans les cartes d'attention d'un transformateur de vision formé par DINO ?

L'attention personnelle de DINO met naturellement en évidence les limites des objets, effectuant une segmentation même s'il ne voit jamais de masques.