GUIDE IA du langage

Incrustations de positions rotatives

Les Rotary Position Embeddings (RoPE) codent l'emplacement de chaque jeton dans une séquence en faisant pivoter sa requête et ses vecteurs clés d'un angle proportionnel à la position.

2 minutes de lectureDernière mise à jour

Aperçu

This elegant trick lets transformers understand relative distances and extend gracefully to longer contexts.

Plongée profonde

Les transformateurs n'ont pas de sens de l'ordre intégré, ils ont donc besoin d'ajouter des informations de position d'une manière ou d'une autre. Les premiers modèles ajoutaient des vecteurs sinusoïdaux fixes ou des intégrations de positions apprises aux entrées. RoPE, proposé par Su et ses collègues en 2021, adopte une approche différente : au lieu d'ajouter un vecteur de position, il fait pivoter les paires de dimensions dans la requête et les vecteurs clés d'un angle qui augmente avec la position du jeton. Lorsque le modèle calcule le produit scalaire entre une requête en position m et une clé en position n, le calcul fonctionne de sorte que le résultat dépend uniquement de leur distance relative m moins n. Cela donne une véritable conscience de la position relative, joue bien avec les noyaux d'attention efficaces et diminue progressivement l'attention avec la distance. RoPE est maintenant utilisé dans les modèles ouverts Llama, Mistral, Qwen et la plupart des modèles ouverts modernes.

Aperçu technique

RoPE traite les dimensions intégrées par paires et applique une rotation 2D à chaque paire, avec différentes paires tournant à différentes fréquences, un peu comme les aiguilles de nombreuses horloges tournant à des vitesses différentes. Parce que la rotation selon la position m puis la prise d'un produit scalaire avec quelque chose tourné par la position n ne laisse que la différence d'angle, les scores d'attention deviennent des fonctions de la position relative. Les paires haute fréquence capturent un ordre local précis ; les paires basse fréquence capturent la position à longue portée. Surtout, il modifie les requêtes et les clés, pas les valeurs.

Impact stratégique

Vitesse et échelle

Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.

Accès et portée

Il étend l’accès à toutes les langues et styles de communication.

Décisions plus claires

Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.

L’avenir des intégrations de positions rotatives

De nombreux travaux récents se concentrent sur l’extension du RoPE à des contextes bien plus longs que ceux sur lesquels un modèle a été formé. Des techniques telles que l'interpolation de position, la mise à l'échelle compatible NTK et YaRN ajustent les fréquences de rotation afin qu'un modèle formé, par exemple, sur des jetons 4K puisse gérer 32K ou plus avec un léger réglage. Attendez-vous à ce que RoPE reste le schéma positionnel dominant, avec des améliorations continues de sa fréquence de base et une mise à l'échelle pour des contextes comportant un million de jetons, ainsi qu'une étude continue de la façon dont il interagit avec le comportement d'attention.

Mise en œuvre dans le monde réel

Giving Llama, Mistral et Qwen modélise leur sens de l'ordre des jetons sans intégration de positions séparées

Extension du contexte utilisable d'un modèle de quelques milliers à des dizaines de milliers de jetons via interpolation ou YaRN

Aider les modèles de code à suivre les distances relatives entre les crochets, les fonctions et les références dans les fichiers longs

Prise en charge des réponses à des questions sur des documents longs lorsque la position relative entre la question et les preuves est importante

Risques et garde-fous

Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.

La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.

Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.

Feuille de route de mise en œuvre

1

Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.

2

Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.

3

Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.

4

Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.

Continuez à explorer

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rotary Position Embeddings quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Démarrer le quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Guide suivant

Biais de position ALiBi

Questions fréquemment posées

What is Rotary Position Embeddings?

Les Rotary Position Embeddings (RoPE) codent l'emplacement de chaque jeton dans une séquence en faisant pivoter sa requête et ses vecteurs clés d'un angle proportionnel à la position. Cette astuce élégante permet aux transformateurs de comprendre les distances relatives et de s'étendre gracieusement à des contextes plus longs.

Comment RoPE injecte-t-il des informations de position dans un transformateur ?

RoPE fait pivoter les vecteurs de requête et de clé d'un angle proportionnel à la position, plutôt que d'ajouter un vecteur de position distinct.

Quelles parties du calcul de l’attention RoPE modifie-t-il ?

RoPE applique ses rotations aux vecteurs de requête et de clé, laissant les vecteurs de valeur intacts.

Pourquoi différentes paires de dimensions tournent-elles à des fréquences différentes dans RoPE ?

Comme les aiguilles d'une horloge tournant à des vitesses différentes, des fréquences variées permettent à certaines paires de coder un ordre à courte portée et d'autres une position à longue portée.

Quel est l’objectif de techniques telles que l’interpolation de position, la mise à l’échelle compatible NTK et YaRN ?

Ces méthodes redimensionnent les fréquences de rotation de RoPE afin qu'un modèle puisse gérer des contextes beaucoup plus longs que sa durée de formation d'origine.