GUÍA de IA en idiomas

Escalado de ventana de contexto de YaRN

YaRN (Yet another RoPE extensioN) es una técnica que extiende la ventana de contexto utilizable de un transformador mucho más allá de lo que fue entrenado, con un mínimo de ajuste.

2 minutos de lecturaÚltima actualización

Descripción general

It matters because it lets existing models handle much longer documents without retraining from scratch.

Buceo profundo

La mayoría de los LLM modernos codifican las posiciones de las palabras mediante incrustaciones de posiciones rotativas (RoPE), que funcionan bien solo hasta la longitud que el modelo vio durante el entrenamiento. Si se alimenta en una secuencia más larga, el modelo se degrada gravemente. YaRN resuelve esto reescalando las frecuencias de rotación de RoPE de una manera consciente de la frecuencia: las dimensiones de alta frecuencia (que capturan las relaciones locales cercanas) se dejan prácticamente intactas, mientras que las dimensiones de baja frecuencia (que capturan la posición de largo alcance) se interpolan. También agrega un ajuste de temperatura a la atención para mantener el buen comportamiento de los logits a largas distancias. El resultado, demostrado en modelos LLaMA, amplía el contexto de tokens de 4K a 64K-128K utilizando solo alrededor del 0,1% de los datos de entrenamiento originales y unos pocos cientos de pasos de ajuste.

Información técnica

RoPE rota los vectores clave y de consulta en un ángulo proporcional a la posición y una frecuencia por dimensión. La ingenua interpolación lineal (interpolación de posición) aplasta todas las frecuencias por igual, dañando los detalles locales. En cambio, YaRN aplica 'NTK por partes': interpola solo las dimensiones de baja frecuencia (longitud de onda larga), deja las de alta frecuencia sin tocar y realiza rampas entre ellas. Una escala de temperatura de atención compensa el cambio de entropía, preservando la precisión en longitudes ampliadas.

Impacto Estratégico

Speed and scale

Los flujos de trabajo lingüísticos pueden avanzar más rápido sin sacrificar la coherencia.

Access and reach

Amplía el acceso a través de idiomas y estilos de comunicación.

Decisiones más claras

Los equipos pueden dedicar más tiempo a juzgar mientras la automatización se encarga de la repetición.

El futuro del escalado de la ventana de contexto de YaRN

La extensión con reconocimiento de frecuencia estilo YaRN se ha convertido en un ingrediente predeterminado para enviar modelos de contexto largo; Siguen apareciendo variantes y sucesores a medida que los laboratorios avanzan hacia ventanas de un millón de tokens. Espere una integración más estrecha con atención eficiente, compresión de caché KV y escalado dinámico que se ajusta sobre la marcha por solicitud. La tendencia más amplia es desacoplar "cuánto tiempo se entrenó un modelo" de "cuánto tiempo puede leerse de manera útil", haciendo del contexto largo una característica post-entrenamiento barata en lugar de un costoso compromiso arquitectónico.

Implementación en el mundo real

Ampliar un modelo LLaMA abierto de 4K a 128K tokens para que pueda ingerir una base de código completa o un contrato largo en una sola pasada.

Permitir que un chatbot conserve historiales de conversaciones muy largos sin truncar turnos anteriores

Resumir documentos extensos como libros o transcripciones de varias horas que exceden la ventana nativa del modelo base.

Adaptar de forma económica un modelo previamente entrenado para tareas de recuperación de contexto prolongado utilizando solo una pequeña ejecución de ajuste

Riesgos y barandillas

Los hechos alucinados pueden aparecer silenciosamente en informes, flujos de apoyo o resultados de investigaciones.

La sensibilidad rápida puede crear resultados inconsistentes en solicitudes similares.

Los datos de texto confidenciales pueden quedar expuestos si los controles de acceso son débiles.

Hoja de ruta de implementación

1

Defina el formato de salida, el tono y los estándares de calidad antes del lanzamiento.

2

Respuestas terrestres con fuentes confiables siempre que la precisión sea importante.

3

Mantenga un punto de control de revisión humana para los resultados de alto riesgo.

4

Realice un seguimiento de los patrones de error y vuelva a capacitar las indicaciones o los flujos de trabajo con regularidad.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN Context Window Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is YaRN Context Window Scaling?

YaRN (Yet another RoPE extensioN) es una técnica que extiende la ventana de contexto utilizable de un transformador mucho más allá de lo que fue entrenado, con un mínimo de ajuste. Es importante porque permite que los modelos existentes manejen documentos mucho más largos sin necesidad de volver a capacitarlos desde cero.

¿Qué esquema de codificación de posición modifica YaRN para ampliar la longitud del contexto?

YaRN significa 'Otra extensión de cuerda' y funciona reescalando las frecuencias de rotación utilizadas en las incrustaciones de posición rotatoria.

¿Cómo trata YaRN las dimensiones de RoPE de alta frecuencia versus las de baja frecuencia?

El enfoque 'NTK por partes' de YaRN preserva las dimensiones de alta frecuencia (locales) al tiempo que interpola las de baja frecuencia (largo alcance) para evitar dañar los detalles locales.

¿Cuál es una ventaja clave de eficiencia de YaRN sobre el entrenamiento de un modelo de contexto largo desde cero?

YaRN puede ampliar el contexto utilizando aproximadamente el 0,1% de los datos de entrenamiento originales y una pequeña cantidad de pasos de ajuste, mucho más barato que volver a entrenar.

Además de reescalar las frecuencias, ¿qué ajuste adicional aplica YaRN para mantener estable la atención de largo alcance?

YaRN modifica la temperatura de atención para compensar el cambio de entropía/logit que se produce cuando las secuencias se vuelven mucho más largas.

¿Qué problema ocurre si alimenta un modelo RoPE con secuencias mucho más largas de lo que fue entrenado, sin ningún escalado?

RoPE generaliza mal a posiciones largas invisibles, por lo que la calidad colapsa a menos que se reescalen las frecuencias.