A continuaciónSiguiente guía
Interpolación de posición para extensión de contexto
Idioma IA
GUÍA Técnica
YaRN (Otra extensión de RoPE) es una técnica eficaz para ampliar la ventana de contexto utilizable de un modelo mucho más allá de aquello en lo que fue entrenado.
It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.
La mayoría de los LLM modernos codifican posiciones de tokens con RoPE (Rotary Position Embeddings), que rotan los vectores clave y de consulta en ángulos vinculados a la posición. Cuando alimentas secuencias más largas que la duración del entrenamiento, estas rotaciones entran en rangos invisibles y el modelo se descompone. YaRN, presentado en 2023 por Bowen Peng y sus colaboradores, soluciona este problema con una interpolación compatible con NTK aplicada por frecuencia: deja las dimensiones de alta frecuencia (que capturan relaciones locales de corto alcance) prácticamente intactas, mientras que interpola dimensiones de baja frecuencia (que rastrean la posición de largo alcance). YaRN también agrega un ajuste de temperatura a la atención para contrarrestar los cambios de entropía que provienen de contextos más largos. El resultado es un sólido rendimiento en contextos prolongados después de realizar ajustes en solo una pequeña fracción de los datos y los pasos que requieren los enfoques ingenuos.
Las decisiones de arquitectura impulsan el rendimiento y los costos operativos durante años.
La educación técnica ayuda a los equipos a elegir la pila adecuada, no sólo la más nueva.
Mejores opciones de ingeniería reducen los incidentes de confiabilidad en la producción.
La extensión del contexto es ahora una práctica estándar: los modelos abiertos envían habitualmente variantes extendidas de YaRN que alcanzan los 128.000 tokens o más. La investigación avanza hacia métodos que amplían el contexto con ajustes nulos o casi nulos, combinan el reescalamiento de RoPE con trucos de patrones de atención y mantienen la calidad en toda la ventana en lugar de solo en los extremos. Espere una integración más estrecha de estas técnicas en la capacitación previa, siempre que el contexto sea nativo en lugar de modernizado.
Ampliar un modelo de contexto abierto de 4K a 32K o 128K para responder preguntas en documentos extensos con breves ajustes
Permitir que los sistemas de recuperación aumentada ingieran muchos pasajes concatenados sin truncamiento
Impulsando asistentes de código que necesitan un archivo de repositorio grande completo o varios archivos en un solo mensaje
Adaptar un modelo base para conversaciones largas de varios turnos que acumulan grandes historiales de chat
La optimización de un punto de referencia puede ocultar debilidades más amplias del sistema.
Los costos de infraestructura y mantenimiento a menudo se subestiman.
Las brechas de seguridad y observabilidad pueden crecer a medida que los sistemas se vuelven más complejos.
Defina objetivos de latencia, calidad y costos antes de la implementación.
Comparación en condiciones realistas de carga y datos.
Monitoreo de instrumentos para detectar errores, deriva e impacto para el usuario.
Prepare rutas de reversión y respuesta a incidentes antes de escalar.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
YaRN (Otra extensión de RoPE) es una técnica eficaz para ampliar la ventana de contexto utilizable de un modelo mucho más allá de aquello en lo que fue entrenado. Reescala inteligentemente las incrustaciones de posiciones rotativas para que un modelo entrenado con, digamos, tokens 4K pueda manejar 32K o más con un ajuste mínimo.
YaRN, cuyo nombre significa otra extensión de cuerda, reescala las incrustaciones de posición giratoria utilizadas en la mayoría de los LLM modernos.
Las posiciones más allá del entrenamiento producen ángulos de rotación que el modelo nunca vio, por lo que el comportamiento de atención se degrada drásticamente.
YaRN utiliza una rampa NTK por partes que interpola atenuaciones de baja frecuencia de longitud de onda larga y deja atenuaciones de alta frecuencia de corto alcance prácticamente intactas.
YaRN agrega una escala de temperatura a los logits de atención para contrarrestar los cambios de entropía que ocurren a medida que crece el contexto.
YaRN logra una sólida calidad de contexto prolongado después de realizar ajustes en una pequeña fracción de los datos que requieren los métodos ingenuos.
sigue aprendiendo
Más guías seleccionadas para este tema.
A continuaciónSiguiente guía
Interpolación de posición para extensión de contexto
Idioma IA