Transformadores de visión
Vision Transformers (ViT) aplica la arquitectura de transformador que alimenta ChatGPT a las imágenes, tratando una imagen como una secuencia de parches en lugar de una cuadrícula de píxeles.
Descripción general
They proved that you do not need convolutions to achieve state-of-the-art image recognition.
Buceo profundo
Durante años, las redes neuronales convolucionales (CNN) dominaron la visión por computadora al escanear pequeños filtros a través de una imagen. El artículo de 2020 'Una imagen vale 16 x 16 palabras' de Google cuestionó esto cortando una imagen en parches fijos, generalmente de 16 x 16 píxeles, aplanando cada uno en un vector y alimentando la secuencia resultante en un transformador estándar. Cada parche se convierte en un "token", muy parecido a una palabra en una oración. Luego, el modelo utiliza la atención propia para que cada parche pueda relacionarse directamente con todos los demás parches, capturando relaciones de largo alcance que un pequeño filtro convolucional no puede ver en un solo paso. El problema: los ViT necesitan datos porque carecen de los supuestos integrados de las CNN. Capacitados con enormes conjuntos de datos como JFT-300M, igualaron o superaron a las mejores CNN, remodelando la investigación de la visión moderna.
Información técnica
Un ViT divide una imagen en parches que no se superponen, proyecta cada uno linealmente en una incrustación y agrega codificaciones posicionales para que el modelo sepa dónde se encontraba cada parche en la imagen original. Se antepone un 'token de clase' especial que se puede aprender; su representación final impulsa la clasificación. Las capas de autoatención apiladas permiten que cada parche sopese la información de todos los demás, brindando un campo receptivo global desde la capa uno. Debido a que la atención escala cuadráticamente con el número de parches, las imágenes de alta resolución se vuelven costosas, razón por la cual el tamaño del parche y las variantes de atención eficientes son importantes.
Impacto Estratégico
Speed and scale
La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.
Construir opciones
Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.
Equipo y flujo de trabajo
Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.
El futuro de los transformadores de visión
Los híbridos ViT y CNN-transformador ahora impulsan los principales sistemas de visión, y la arquitectura sustenta modelos multimodales que fusionan imágenes con texto, como CLIP y modernos asistentes de visión y lenguaje. Se espera un trabajo continuo para abaratar la atención en alta resolución y vídeo, además de un entrenamiento previo autosupervisado (como el modelado de imágenes enmascaradas) que reduzca el enorme apetito por los datos etiquetados. A medida que la computación crece, la línea entre el "modelo de lenguaje" y el "modelo de visión" se vuelve borrosa, y los transformadores sirven como columna vertebral compartida entre modalidades en lugar de diseños especializados separados.
Implementación en el mundo real
Los sistemas de clasificación de imágenes y clasificación de búsqueda de Google que adoptaron redes troncales transformadoras después de que ViT demostrara ser competitivo con las CNN
CLIP y otros modelos de imagen-texto que utilizan un ViT para codificar imágenes de modo que las fotos y los títulos puedan coincidir en un espacio compartido
Investigación de imágenes médicas que utiliza ViT para detectar patrones en una exploración completa en lugar de solo texturas locales
Pilas de percepción robótica y de conducción autónoma que combinan atención estilo ViT para comprender la escena en todo el campo de visión.
Riesgos y barandillas
Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.
El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.
Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.
Hoja de ruta de implementación
Defina criterios de aceptación para costos de precisión, recuperación y error.
Pruebe con datos que coincidan con las condiciones reales de producción.
Agregue revisión humana para predicciones de baja confianza o de alto impacto.
Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision Transformers quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
CLIP y modelos visión-lenguaje
Preguntas frecuentes
What is Vision Transformers?
Vision Transformers (ViT) aplica la arquitectura de transformador que alimenta ChatGPT a las imágenes, tratando una imagen como una secuencia de parches en lugar de una cuadrícula de píxeles. Demostraron que no se necesitan convoluciones para lograr un reconocimiento de imágenes de última generación.
¿Cómo procesa inicialmente un Vision Transformer una imagen de entrada?
Un ViT divide la imagen en parches fijos (a menudo de 16x16 píxeles), incorpora cada parche como un token y alimenta la secuencia a un transformador.
¿Qué mecanismo clave permite a un ViT relacionar partes distantes de una imagen entre sí?
La autoatención permite que cada parche sopese directamente la información de todos los demás parches, brindando una vista global desde la primera capa.
¿Por qué los Vision Transformers simples suelen necesitar conjuntos de datos de entrenamiento muy grandes para sobresalir?
A diferencia de las CNN, las ViT no asumen localidad ni invariancia de traducción, por lo que deben aprender estos patrones a partir de grandes cantidades de datos.
¿Cuál es el propósito de las codificaciones posicionales en un Vision Transformer?
La autoatención es independiente del orden, por lo que las codificaciones posicionales restauran la ubicación espacial de cada parche.
¿Qué afirmación refleja mejor el impacto de ViT en la visión por computadora?
ViT demostró que un transformador puro, con suficientes datos y escala, puede rivalizar o superar a las mejores redes convolucionales.