Atención de ventana corrediza
La atención de la ventana deslizante restringe cada token para que atienda solo a un vecindario de tamaño fijo de tokens cercanos en lugar de a toda la secuencia.
Descripción general
This cuts the quadratic cost of standard attention down to linear, making long-context models far cheaper to run.
Buceo profundo
La autoatención estándar compara cada token con todos los demás tokens, por lo que una secuencia de longitud N requiere comparaciones aproximadamente de N cuadrados. La atención de la ventana deslizante soluciona este problema dándole a cada token una ventana de tamaño W (digamos 4096 tokens) y atendiendo solo a los vecinos dentro de esa ventana. El costo crece N veces W en lugar de N-cuadrado. Fundamentalmente, apilar muchas capas con ventanas expande el campo receptivo efectivo: después de L capas, la información puede propagarse a través de aproximadamente L veces W tokens, como el creciente campo receptivo de una CNN. Mistral 7B popularizó esto con una ventana de 4.096 tokens en 32 capas, alcanzando un lapso teórico de 131.000 tokens. Los modelos a menudo mezclan capas en ventanas con capas ocasionales de atención total para preservar enlaces de largo alcance.
Información técnica
En la máscara de atención, una consulta en la posición i solo puede ver claves de las posiciones i menos W más 1 a i (caso causal). Esta máscara escasa significa que la caché KV solo necesita los últimos W tokens por capa, lo que reduce drásticamente la memoria durante la generación. Debido a que la ventana cambia con cada nuevo token, se combina naturalmente con un caché de búfer continuo que sobrescribe las entradas más antiguas en lugar de crecer para siempre.
Impacto Estratégico
Speed and scale
Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.
Access and reach
Amplía el acceso a través de idiomas y estilos de comunicación.
Decisiones más claras
Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.
El futuro de la atención de las ventanas corredizas
Los diseños híbridos ahora intercalan algunas capas globales o de atención total entre muchas capas de ventanas deslizantes, equilibrando la eficiencia con un verdadero razonamiento de largo alcance. Gemma 2 y otros alternan bloques locales y globales. Espere que la atención de la ventana se combine con modelos de espacio de estado, sumideros de atención y compresión de caché KV para que los modelos de frontera manejen contextos de millones de tokens sin memoria descontrolada. Se está convirtiendo en un elemento básico predeterminado en lugar de una optimización exótica.
Implementación en el mundo real
Mistral 7B utiliza una ventana deslizante de 4.096 tokens en sus capas para manejar indicaciones largas de forma económica en GPU de consumo.
Longformer aplica atención en ventanas más algunos tokens globales para clasificar y resumir documentos de varias páginas.
Gemma 2 alterna capas de ventanas deslizantes locales con capas de atención global para equilibrar la velocidad y la recuperación de largo alcance.
Los cachés KV de búfer continuo en los asistentes de chat mantienen solo la ventana de tokens más reciente, lo que limita la memoria durante conversaciones largas.
Riesgos y barandillas
Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.
La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.
Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.
Hoja de ruta de implementación
Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.
Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.
Mantenga un punto de control de revisión humana para los resultados de alto riesgo.
Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sliding Window Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Atención de consultas agrupadas
Preguntas frecuentes
What is Sliding Window Attention?
La atención de la ventana deslizante restringe cada token para que atienda solo a un vecindario de tamaño fijo de tokens cercanos en lugar de a toda la secuencia. Esto reduce el costo cuadrático de la atención estándar a lineal, lo que hace que la ejecución de modelos de contexto largo sea mucho más barata.
¿Cuál es el principal beneficio computacional de la atención de ventana deslizante sobre la autoatención estándar?
Al limitar cada token a una ventana fija de W vecinos, el costo crece N veces W (lineal en N) en lugar de N cuadrado.
En el diseño de Mistral 7B, ¿cómo puede la información viajar mucho más allá de una única ventana de 4.096 tokens?
Al igual que una CNN, cada capa empuja la información una ventana más allá, por lo que L capas dan un lapso efectivo de aproximadamente L veces W tokens.
¿Por qué la atención de la ventana deslizante reduce la memoria durante la generación de texto?
Dado que un token solo atiende a su ventana reciente, las entradas de clave/valor más antiguas se pueden descartar, a menudo a través de un caché de búfer continuo.
¿Qué elección de diseño utilizan modelos como Gemma 2 junto con las ventanas correderas para mantener el razonamiento a largo plazo?
Mezclar capas ocasionales globales/de atención total con capas locales preserva verdaderas conexiones de larga distancia que las ventanas puras debilitan.
Para una ventana deslizante causal de tamaño W, ¿a qué claves puede atender una consulta en la posición i?
En el caso causal, la consulta se ve a sí misma y a los tokens W menos 1 inmediatamente anteriores, nunca a los tokens futuros.