Incrustations de positions rotatives
Les Rotary Position Embeddings (RoPE) codent l'emplacement de chaque jeton dans une séquence en faisant pivoter sa requête et ses vecteurs clés d'un angle proportionnel à la position.
Aperçu
This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.
Plongée profonde
Les transformateurs n'ont pas de sens de l'ordre intégré, ils ont donc besoin d'ajouter des informations de position d'une manière ou d'une autre. Les premiers modèles ajoutaient des vecteurs sinusoïdaux fixes ou des intégrations de positions apprises aux entrées. RoPE, proposé par Su et ses collègues en 2021, adopte une approche différente : au lieu d'ajouter un vecteur de position, il fait pivoter les paires de dimensions dans la requête et les vecteurs clés d'un angle qui augmente avec la position du jeton. Lorsque le modèle calcule le produit scalaire entre une requête en position m et une clé en position n, le calcul fonctionne de sorte que le résultat dépend uniquement de leur distance relative m moins n. Cela donne une véritable conscience de la position relative, joue bien avec les noyaux d'attention efficaces et diminue progressivement l'attention avec la distance. RoPE est maintenant utilisé dans les modèles ouverts Llama, Mistral, Qwen et la plupart des modèles ouverts modernes.
Aperçu technique
RoPE traite les dimensions intégrées par paires et applique une rotation 2D à chaque paire, avec différentes paires tournant à différentes fréquences, un peu comme les aiguilles de nombreuses horloges tournant à des vitesses différentes. Parce que la rotation selon la position m puis la prise d'un produit scalaire avec quelque chose tourné par la position n ne laisse que la différence d'angle, les scores d'attention deviennent des fonctions de la position relative. Les paires haute fréquence capturent un ordre local précis ; les paires basse fréquence capturent la position à longue portée. Surtout, il modifie les requêtes et les clés, pas les valeurs.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir des intégrations de positions rotatives
De nombreux travaux récents se concentrent sur l’extension du RoPE à des contextes bien plus longs que ceux sur lesquels un modèle a été formé. Des techniques telles que l'interpolation de position, la mise à l'échelle compatible NTK et YaRN ajustent les fréquences de rotation afin qu'un modèle formé, par exemple, sur des jetons 4K puisse gérer 32K ou plus avec un léger réglage. Attendez-vous à ce que RoPE reste le schéma positionnel dominant, avec des améliorations continues de sa fréquence de base et une mise à l'échelle pour des contextes comportant un million de jetons, ainsi qu'une étude continue de la façon dont il interagit avec le comportement d'attention.
Mise en œuvre dans le monde réel
Giving Llama, Mistral et Qwen modélise leur sens de l'ordre des jetons sans intégration de positions séparées
Extension du contexte utilisable d'un modèle de quelques milliers à des dizaines de milliers de jetons via interpolation ou YaRN
Aider les modèles de code à suivre les distances relatives entre les crochets, les fonctions et les références dans les fichiers longs
Prise en charge des réponses à des questions sur des documents longs lorsque la position relative entre la question et les preuves est importante
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rotary Position Embeddings quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Biais de position ALiBi
Questions fréquemment posées
What is Rotary Position Embeddings?
Les Rotary Position Embeddings (RoPE) codent l'emplacement de chaque jeton dans une séquence en faisant pivoter sa requête et ses vecteurs clés d'un angle proportionnel à la position. Cette astuce élégante permet aux transformateurs de comprendre les distances relatives et de s'étendre gracieusement à des contextes plus longs.
Comment RoPE injecte-t-il des informations de position dans un transformateur ?
RoPE fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à la position, plutôt que d'ajouter un vecteur de position distinct.
Quelles parties du calcul de l’attention RoPE modifie-t-il ?
RoPE applique ses rotations aux vecteurs de requête et de clé, laissant les vecteurs de valeur intacts.
Pourquoi différentes paires de dimensions tournent-elles à des fréquences différentes dans RoPE ?
Comme les aiguilles d'une horloge tournant à des vitesses différentes, des fréquences variées permettent à certaines paires de coder un ordre à courte portée et d'autres une position à longue portée.
Quel est l’objectif de techniques telles que l’interpolation de position, la mise à l’échelle compatible NTK et YaRN ?
Ces méthodes redimensionnent les fréquences de rotation de RoPE afin qu'un modèle puisse gérer des contextes beaucoup plus longs que sa durée de formation d'origine.