GUÍA visual de IA

Autodestilación DINO

DINO es un método autosupervisado que entrena a un transformador de visión para que comprenda imágenes sin ninguna etiqueta, haciendo que la red se autoenseñe.

2 minutos de lecturaÚltima actualización

Descripción general

It produces features so clean that object boundaries emerge for free in the attention maps.

Buceo profundo

DINO, abreviatura de autodestilación sin etiquetas, fue publicado por Meta AI (entonces Facebook AI) en 2021. Utiliza dos copias de la misma red, un estudiante y un maestro, y les proporciona diferentes cultivos aumentados de una imagen. El estudiante intenta igualar la distribución de producción del profesor, aunque el profesor sólo ve una visión diferente. Fundamentalmente, el profesor no recibe formación directa; sus pesos son un promedio móvil exponencial del del estudiante, que va lentamente detrás. Para evitar que la red colapse en una única respuesta constante, DINO centra y agudiza los resultados del profesor. Un resultado sorprendente es que los mapas de autoatención del transformador de visión resultante segmentan los objetos sin que nunca se les diga qué es un objeto.

Información técnica

Ambas redes generan una distribución de probabilidad de alta dimensión después de un softmax. El estudiante ve pequeños cultivos locales además de vistas globales, mientras que el profesor sólo ve vistas globales: una estrategia de cultivos múltiples que impulsa la coherencia de lo local a lo global. La pérdida es la entropía cruzada entre las distribuciones de profesores y estudiantes, con gradientes que fluyen sólo a través del estudiante. Dos trucos evitan el colapso: el centrado resta una media móvil a los logits de los profesores, y una temperatura baja los agudiza, equilibrándose entre sí para que los resultados sigan siendo diversos.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro de la autodestilación DINO

DINO lanzó una importante línea de trabajo. DINOv2 (2023) amplió la receta a más de mil millones de imágenes seleccionadas, generando características visuales multiuso que rivalizan con los modelos supervisados ​​en estimación de profundidad, segmentación y recuperación, utilizables sin ajustes. Se espera que la autodestilación siga siendo central a medida que el campo busca modelos básicos sin etiquetas para sistemas de visión, robótica y multimodales, donde la anotación es costosa. La propiedad de segmentación emergente también sigue impulsando la investigación sobre la percepción de vocabulario abierto e interpretable.

Implementación en el mundo real

Segmentación de objetos no supervisada, donde los mapas de atención de DINO delinean objetos sin etiquetas de máscara

Recuperación de imágenes y detección de copias, utilizando funciones DINO para encontrar imágenes casi duplicadas o visualmente similares

DINOV2 se presenta como una columna vertebral congelada para tareas de estimación de profundidad y predicción densa

Entrenamiento previo de modelos médicos o de visión satelital donde los datos etiquetados son escasos o costosos

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DINO Self-Distillation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

DreamFusion y muestreo de destilación de partituras

Preguntas frecuentes

What is DINO Self-Distillation?

DINO es un método autosupervisado que entrena a un transformador de visión para que comprenda imágenes sin ninguna etiqueta, haciendo que la red se autoenseñe. Produce características tan claras que los límites de los objetos emergen de forma gratuita en los mapas de atención.

¿Qué significa el 'NO' en DINO?

DINO significa autodestilación sin etiquetas; es totalmente autosupervisado y no requiere anotaciones humanas.

¿Cómo se actualizan los pesos de la red de profesores en DINO?

El profesor es un EMA del estudiante, por lo que lo sigue suavemente en lugar de recibir capacitación directa.

¿Qué problema previene el centrado y afinamiento de la producción docente?

Centrar y agudizar se contrarrestan entre sí para mantener la diversidad de los resultados de los docentes, evitando la trivial solución constante.

En la estrategia multicultivo de DINO, ¿qué opiniones recibe el docente?

El profesor sólo ve cultivos globales, mientras que el estudiante también ve pequeños cultivos locales, lo que fomenta la coherencia entre lo local y lo global.

¿Qué propiedad sorprendente surge en los mapas de atención de un transformador de visión entrenado por DINO?

La autoatención de DINO resalta naturalmente los límites de los objetos, realizando la segmentación a pesar de no ver nunca máscaras.