GUÍA Técnica

YaRN y extensión de longitud de contexto

YaRN (Otra extensión de RoPE) es una técnica eficaz para ampliar la ventana de contexto utilizable de un modelo mucho más allá de aquello en lo que fue entrenado.

  • 2 minutos de lectura
  • Última actualización
En esta pagina2 minutos de lectura
  1. Descripción general
  2. Buceo profundo
  3. Impacto Estratégico
  4. El futuro de YaRN y la extensión de la longitud del contexto
  5. Implementación en el mundo real
  6. Riesgos y barandillas
  7. Hoja de ruta de implementación
  8. Sigue explorando
  9. Preguntas frecuentes

Descripción general

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Buceo profundo

La mayoría de los LLM modernos codifican posiciones de tokens con RoPE (Rotary Position Embeddings), que rotan los vectores clave y de consulta en ángulos vinculados a la posición. Cuando alimentas secuencias más largas que la duración del entrenamiento, estas rotaciones entran en rangos invisibles y el modelo se descompone. YaRN, presentado en 2023 por Bowen Peng y sus colaboradores, soluciona este problema con una interpolación compatible con NTK aplicada por frecuencia: deja las dimensiones de alta frecuencia (que capturan relaciones locales de corto alcance) prácticamente intactas, mientras que interpola dimensiones de baja frecuencia (que rastrean la posición de largo alcance). YaRN también agrega un ajuste de temperatura a la atención para contrarrestar los cambios de entropía que provienen de contextos más largos. El resultado es un sólido rendimiento en contextos prolongados después de realizar ajustes en solo una pequeña fracción de los datos y los pasos que requieren los enfoques ingenuos.

Impacto Estratégico

Costo y presupuesto

Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.

Decisiones más claras

La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.

control de calidad

Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.

El futuro de YaRN y la extensión de la longitud del contexto

La extensión del contexto es ahora una práctica estándar: los modelos abiertos envían habitualmente variantes extendidas de YaRN que alcanzan los 128.000 tokens o más. La investigación avanza hacia métodos que amplían el contexto con ajustes nulos o casi nulos, combinan el reescalamiento de RoPE con trucos de patrones de atención y mantienen la calidad en toda la ventana en lugar de solo en los extremos. Espere una integración más estrecha de estas técnicas en la capacitación previa, siempre que el contexto sea nativo en lugar de modernizado.

Implementación en el mundo real

Ampliar un modelo de contexto abierto de 4K a 32K o 128K para responder preguntas en documentos extensos con breves ajustes

Permitir que los sistemas de recuperación aumentada ingieran muchos pasajes concatenados sin truncamiento

Impulsando asistentes de código que necesitan un archivo de repositorio grande completo o varios archivos en un solo mensaje

Adaptar un modelo base para conversaciones largas de varios turnos que acumulan grandes historiales de chat

Riesgos y barandillas

  • La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.

  • Los costos de infraestructura y mantenimiento a menudo se subestiman.

  • Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.

Hoja de ruta de implementación

  1. Defina objetivos de latencia, calidad y costos antes de la implementación.

  2. Comparación en condiciones realistas de carga y datos.

  3. Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.

  4. Prepare rutas de reversión y respuesta a incidentes antes de escalar.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Preguntas frecuentes

What is YaRN and Context Length Extension?

YaRN (Otra extensión de RoPE) es una técnica eficaz para ampliar la ventana de contexto utilizable de un modelo mucho más allá de aquello en lo que fue entrenado. Reescala inteligentemente las incrustaciones de posiciones rotativas para que un modelo entrenado con, digamos, tokens 4K pueda manejar 32K o más con un ajuste mínimo.

¿Qué método de codificación de posición modifica YaRN para ampliar el contexto?

YaRN, cuyo nombre significa otra extensión de cuerda, reescala las incrustaciones de posición giratoria utilizadas en la mayoría de los LLM modernos.

¿Qué sale mal cuando un modelo RoPE ve secuencias más largas que la duración de su entrenamiento?

Las posiciones más allá del entrenamiento producen ángulos de rotación que el modelo nunca vio, por lo que el comportamiento de atención se degrada drásticamente.

¿Cómo trata YaRN las diferentes dimensiones de frecuencia de RoPE?

YaRN utiliza una rampa NTK por partes que interpola atenuaciones de baja frecuencia de longitud de onda larga y deja atenuaciones de alta frecuencia de corto alcance prácticamente intactas.

Además de reescalar las frecuencias, ¿qué ajuste adicional aplica YaRN?

YaRN agrega una escala de temperatura a los logits de atención para contrarrestar los cambios de entropía que ocurren a medida que crece el contexto.

¿Cuál es una ventaja práctica clave de YaRN sobre la interpolación ingenua?

YaRN logra una sólida calidad de contexto prolongado después de realizar ajustes en una pequeña fracción de los datos que requieren los métodos ingenuos.