Mise à l'échelle de la fenêtre contextuelle YaRN
YaRN (Yet another RoPE extensioN) est une technique qui étend la fenêtre contextuelle utilisable d'un transformateur bien au-delà de ce sur quoi il a été formé, avec un minimum de réglages.
Aperçu
It matters because it lets existing models handle much longer documents without retraining from scratch.
Plongée profonde
La plupart des LLM modernes codent les positions des mots à l'aide de Rotary Position Embeddings (RoPE), qui ne fonctionnent bien que jusqu'à la longueur que le modèle a vue pendant la formation. Nourrissez dans une séquence plus longue et le modèle se dégrade gravement. YaRN résout ce problème en redimensionnant les fréquences de rotation de RoPE en fonction de la fréquence : les dimensions à haute fréquence (qui capturent les relations locales et proches) sont laissées pour la plupart intactes, tandis que les dimensions à basse fréquence (qui capturent la position à longue portée) sont interpolées. Il ajoute également un ajustement de la température à l'attention pour que les logits se comportent bien à longue distance. Le résultat, démontré sur les modèles LLaMA, étend le contexte de 4K à 64K-128K jetons en utilisant seulement environ 0,1 % des données de formation d'origine et quelques centaines d'étapes de réglage fin.
Aperçu technique
RoPE fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à la position et à une fréquence par dimension. L'interpolation linéaire naïve (interpolation de position) écrase toutes les fréquences de manière égale, nuisant aux détails locaux. YaRN applique à la place « NTK par parties » : il interpole uniquement les dimensions basse fréquence (longue longueur d'onde), laisse les dimensions haute fréquence seules et effectue une rampe entre elles. Une mise à l'échelle de la température d'attention compense le changement d'entropie, préservant ainsi la précision sur des longueurs étendues.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L'avenir de la mise à l'échelle de la fenêtre contextuelle YaRN
L'extension sensible à la fréquence de style YaRN est devenue un ingrédient par défaut pour la livraison de modèles à contexte long ; des variantes et des successeurs continuent d'apparaître à mesure que les laboratoires s'orientent vers des fenêtres comportant un million de jetons. Attendez-vous à une intégration plus étroite avec une attention efficace, une compression du cache KV et une mise à l'échelle dynamique qui s'ajuste à la volée selon la demande. La tendance plus large consiste à dissocier « la durée pendant laquelle un modèle a été formé » de « la durée pendant laquelle il peut être utilement lu », faisant du contexte long une fonctionnalité post-formation bon marché plutôt qu'un engagement architectural coûteux.
Mise en œuvre dans le monde réel
Extension d'un modèle LLaMA ouvert de 4K à 128K jetons afin qu'il puisse ingérer une base de code entière ou un contrat long en un seul passage
Permettre à un chatbot de conserver de très longs historiques de conversations sans tronquer les tours précédents
Résumer des documents de la longueur d'un livre ou des transcriptions de plusieurs heures qui dépassent la fenêtre native du modèle de base
Adaptation à moindre coût d'un modèle pré-entraîné pour des tâches de récupération de contexte long en utilisant seulement une petite exécution de réglage fin
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Fenêtres contextuelles
Questions fréquemment posées
What is YaRN Context Window Scaling?
YaRN (Yet another RoPE extensioN) est une technique qui étend la fenêtre contextuelle utilisable d'un transformateur bien au-delà de ce sur quoi il a été formé, avec un minimum de réglages. C’est important car cela permet aux modèles existants de gérer des documents beaucoup plus longs sans avoir à repartir de zéro.
Quel schéma de codage de position YaRN modifie-t-il pour étendre la longueur du contexte ?
YaRN signifie « Encore une autre extension RoPE » et fonctionne en redimensionnant les fréquences de rotation utilisées dans les intégrations de positions rotatives.
Comment YaRN traite-t-il les dimensions RoPE haute fréquence et basse fréquence ?
L'approche « NTK par parties » de YaRN préserve les dimensions haute fréquence (locales) tout en interpolant celles à basse fréquence (longue portée) pour éviter de nuire aux détails locaux.
Quel est l'avantage clé en termes d'efficacité de YaRN par rapport à la formation d'un modèle à contexte long à partir de zéro ?
YaRN peut étendre le contexte en utilisant environ 0,1 % des données d'entraînement d'origine et un petit nombre d'étapes de réglage fin, bien moins coûteuses que le recyclage.
Outre le rééchelonnement des fréquences, quel ajustement supplémentaire YaRN applique-t-il pour maintenir la stabilité de l’attention à longue portée ?
YaRN modifie la température d'attention pour compenser le changement d'entropie/logit qui se produit lorsque les séquences deviennent beaucoup plus longues.
Quel problème se produit si vous alimentez un modèle RoPE avec des séquences beaucoup plus longues que celles sur lesquelles il a été formé, sans aucune mise à l'échelle ?
RoPE se généralise mal aux positions longues invisibles, donc la qualité s'effondre à moins que les fréquences ne soient redimensionnées.