GUÍA visual de IA

Transformador giratorio

Swin Transformer es un transformador de visión que procesa imágenes en ventanas jerárquicas desplazadas, lo que hace que la atención sea lo suficientemente eficiente como para escalar imágenes de alta resolución.

2 minutos de lecturaÚltima actualización

Descripción general

It works as a general-purpose backbone for classification, detection, and segmentation.

Buceo profundo

Los Vision Transformers estándar calculan la atención en todos los parches de imagen, cuyos costos crecen cuadráticamente con el tamaño de la imagen, un obstáculo para tareas densas como la detección. Introducido por Microsoft Research en 2021, Swin (Shifted WINdows) divide la imagen en pequeñas ventanas que no se superponen y calcula la autoatención solo dentro de cada ventana, lo que hace que el costo crezca linealmente con el tamaño de la imagen. Para permitir que la información cruce los límites de las ventanas, las capas alternas desplazan la cuadrícula de la ventana, de modo que los parches que estaban separados ahora comparten una ventana. Swin también construye una jerarquía: comienza con pequeños parches y los fusiona progresivamente, produciendo mapas de características de múltiples escalas muy parecidos a una CNN, que encaja perfectamente en los marcos de detección y segmentación existentes.

Información técnica

La eficiencia de Swin proviene de la autoatención de múltiples cabezales basada en ventanas (W-MSA): la atención se limita a ventanas fijas (por ejemplo, parches de 7x7), por lo que la complejidad aumenta linealmente en lugar de cuadráticamente con el número de parches. El siguiente bloque utiliza atención de ventana desplazada (SW-MSA), desplazando la partición de la ventana media ventana para que se formen conexiones entre ventanas. Las capas de fusión de parches concatenan parches vecinos entre etapas, reduciendo a la mitad la resolución espacial y duplicando los canales para construir una pirámide de características.

Impacto Estratégico

Speed and scale

La IA visual puede automatizar tareas de inspección, detección y etiquetado a escala.

Construir opciones

Los equipos creativos pueden crear prototipos de conceptos más rápido y con menos revisiones manuales.

Equipo y flujo de trabajo

Las operaciones pueden utilizar señales de imagen y vídeo que antes eran difíciles de procesar.

El futuro del transformador Swin

Swin demostró que los Transformers jerárquicos y con reconocimiento de localidad pueden rivalizar o superar a las CNN como columna vertebral de visión universal, y Swin V2 llevó esto a modelos de mil millones de parámetros y resoluciones muy altas. Espere una combinación continua de sesgos inductivos convolucionales con atención, variantes de atención más eficientes y columnas vertebrales estilo Swin que alimentan modelos multimodales y de video. A medida que maduran los modelos básicos para la visión, los diseños jerárquicos que producen características de múltiples escalas siguen siendo especialmente valiosos para tareas de predicción densas.

Implementación en el mundo real

Clasificación ImageNet de alta precisión como columna vertebral previamente entrenada

Columnas centrales de detección de objetos y segmentación de instancias en marcos como Mask R-CNN y Cascade R-CNN

Segmentación semántica de escenas callejeras e imágenes de satélite.

Análisis de imágenes médicas donde la alta resolución y los detalles a múltiples escalas son importantes

Riesgos y barandillas

Los derechos de imagen y el consentimiento pueden convertirse en riesgos legales si la procedencia no está clara.

El rendimiento del modelo puede variar según la iluminación, la demografía y los entornos.

Los falsos positivos pueden pasar desapercibidos a menos que se controlen los umbrales de confianza.

Hoja de ruta de implementación

1

Defina criterios de aceptación para costos de precisión, recuperación y error.

2

Pruebe con datos que coincidan con las condiciones reales de producción.

3

Agregue revisión humana para predicciones de baja confianza o de alto impacto.

4

Realice un seguimiento de la deriva del modelo y vuelva a validarlo después de cambios en la cámara o el conjunto de datos.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Swin Transformer quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Transformadores de difusión

Preguntas frecuentes

What is Swin Transformer?

Swin Transformer es un transformador de visión que procesa imágenes en ventanas jerárquicas desplazadas, lo que hace que la atención sea lo suficientemente eficiente como para escalar imágenes de alta resolución. Funciona como una columna vertebral de uso general para clasificación, detección y segmentación.

¿Qué significa 'Swin' en Swin Transformer?

Swin significa Shifted Windows, el mecanismo que permite que las ventanas de atención local intercambien información entre capas.

¿Por qué es beneficioso calcular la autoatención dentro de las ventanas locales?

Limitar la atención a ventanas de tamaño fijo hace que el costo computacional crezca linealmente con el tamaño de la imagen, a diferencia del crecimiento cuadrático de la atención global.

¿Cómo permite Swin que la información se mueva entre ventanas separadas?

Las capas alternas desplazan la cuadrícula de la ventana media ventana, de modo que los parches que anteriormente estaban en diferentes ventanas puedan atenderse entre sí.

¿Qué hacen las capas de fusión de parches entre las etapas de Swin?

La fusión de parches concatena parches vecinos para reducir a la mitad la resolución espacial y duplicar la profundidad del canal, creando una jerarquía de múltiples escalas.

¿Por qué es especialmente útil la producción jerárquica y multiescala de Swin?

Los mapas de características de múltiples escalas imitan las redes troncales de CNN, por lo que Swin se integra fácilmente con marcos de predicción densos como Mask R-CNN.