GUIDE Technique

YaRN et extension de longueur de contexte

YaRN (Yet another RoPE extensioN) est une technique efficace pour étendre la fenêtre contextuelle utilisable d'un modèle bien au-delà de ce sur quoi il a été formé.

2 minutes de lectureDernière mise à jour

Aperçu

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

Plongée profonde

La plupart des LLM modernes codent les positions des jetons avec RoPE (Rotary Position Embeddings), qui font pivoter les requêtes et les vecteurs clés selon des angles liés à la position. Lorsque vous alimentez des séquences plus longues que la durée de l'entraînement, ces rotations entrent dans des plages invisibles et le modèle tombe en panne. YaRN, introduit en 2023 par Bowen Peng et ses collaborateurs, corrige ce problème avec une interpolation compatible NTK appliquée par fréquence : il laisse les dimensions haute fréquence (qui capturent les relations locales à courte portée) pour la plupart intactes tout en interpolant les dimensions basse fréquence (qui suivent la position à longue portée). YaRN ajoute également un ajustement de température à l'attention pour contrer les changements d'entropie provenant de contextes plus longs. Le résultat est de solides performances dans un contexte long après un ajustement précis sur seulement une infime fraction des données et des étapes requises par les approches naïves.

Aperçu technique

RoPE attribue à chaque dimension d'intégration une fréquence de rotation. L'interpolation linéaire naïve compresse toutes les fréquences de manière égale, nuisant aux dimensions haute fréquence qui codent les détails locaux les plus fins. YaRN utilise une fonction de rampe pour interpoler uniquement les dimensions basse fréquence (longueur d'onde longue) tout en préservant celles à haute fréquence, ainsi qu'une mise à l'échelle de température d'attention 1/sqrt(t) qui maintient la netteté softmax stable à mesure que la longueur de la séquence augmente. Cette approche NTK par parties étend le contexte avec beaucoup moins de dégradation.

Impact stratégique

Coût et budget

Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.

Décisions plus claires

La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.

Contrôle qualité

De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.

L'avenir de YaRN et de l'extension de longueur de contexte

L'extension de contexte est désormais une pratique courante : les modèles ouverts fournissent régulièrement des variantes étendues de YaRN atteignant 128 000 jetons ou plus. La recherche s'oriente vers des méthodes qui étendent le contexte avec un réglage fin nul ou proche de zéro, combinent le redimensionnement RoPE avec des astuces de modèle d'attention et maintiennent la qualité sur toute la fenêtre plutôt que seulement jusqu'aux extrémités. Attendez-vous à une intégration plus étroite de ces techniques dans la pré-formation tant que le contexte est natif plutôt que modernisé.

Mise en œuvre dans le monde réel

Extension d'un modèle de contexte 4K ouvert à 32K ou 128K pour répondre à des questions sur des documents longs avec de brefs ajustements

Permettre aux systèmes de récupération augmentée d'ingérer de nombreux passages concaténés sans troncature

Alimenter les assistants de code qui ont besoin d'un fichier de référentiel volumineux entier ou de plusieurs fichiers dans une seule invite

Adaptation d'un modèle de base pour les longues conversations à plusieurs tours qui accumulent de grands historiques de discussion

Risques et garde-fous

L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.

Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.

Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.

Feuille de route de mise en œuvre

1

Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.

2

Benchmark dans des conditions de charge et de données réalistes.

3

Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.

4

Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Interpolation de position pour l'extension de contexte

Questions fréquemment posées

What is YaRN and Context Length Extension?

YaRN (Yet another RoPE extensioN) est une technique efficace pour étendre la fenêtre contextuelle utilisable d'un modèle bien au-delà de ce sur quoi il a été formé. Il redimensionne intelligemment les intégrations de positions rotatives afin qu'un modèle formé, par exemple, sur des jetons 4K puisse gérer 32K ou plus avec un minimum de réglages.

Quelle méthode de codage de position YaRN modifie-t-il pour étendre le contexte ?

YaRN, dont le nom signifie Encore une autre extension RoPE, redimensionne les intégrations de positions rotatives utilisées dans la plupart des LLM modernes.

Qu'est-ce qui ne va pas lorsqu'un modèle RoPE voit des séquences plus longues que sa durée d'entraînement ?

Les positions au-delà de l’entraînement produisent des angles de rotation que le modèle n’a jamais vus, de sorte que le comportement attentionnel se dégrade fortement.

Comment YaRN traite-t-il les différentes dimensions de fréquence RoPE ?

YaRN utilise une rampe NTK par parties qui interpole les gradations basse fréquence à longue longueur d'onde et laisse les gradations haute fréquence à courte portée pratiquement intactes.

Outre le redimensionnement des fréquences, quel ajustement supplémentaire YaRN applique-t-il ?

YaRN ajoute une échelle de température aux logits d'attention pour contrecarrer les changements d'entropie qui se produisent à mesure que le contexte s'agrandit.

Quel est l’avantage pratique clé de YaRN par rapport à l’interpolation naïve ?

YaRN atteint une forte qualité de contexte long après avoir affiné une petite fraction des données requises par les méthodes naïves.