Modèles d’attention clairsemés
Une attention éparse rend les Transformers moins chers en laissant chaque jeton s'occuper uniquement d'un sous-ensemble soigneusement choisi d'autres jetons plutôt que de tous.
Aperçu
This trades a little global reach for big savings in memory and compute on long sequences.
Plongée profonde
Une attention personnelle totale compare chaque jeton à chaque autre jeton, de sorte que le coût augmente avec le carré de la longueur de la séquence, ce qui devient pénible pour les documents longs. Une attention éparse remplace le modèle dense par un modèle structuré. Les conceptions courantes incluent une attention à fenêtre coulissante (locale), où chaque jeton ne voit que les voisins proches ; des modèles striés ou dilatés qui avancent pour atteindre un contexte distant à moindre coût ; et des jetons globaux, quelques positions spéciales qui s'occupent de tout et auxquelles tout s'occupe, agissant comme des centres d'information. Des modèles tels que Longformer, BigBird et Sparse Transformer les combinent de sorte que le nombre total de connexions augmente à peu près linéairement au lieu de quadratiquement, permettant des contextes de milliers à dizaines de milliers de jetons.
Aperçu technique
Au lieu d'une matrice d'attention N par N complète, l'attention éparse calcule uniquement les entrées sélectionnées, souvent une union d'une fenêtre locale et d'une poignée de lignes et de colonnes globales. BigBird a prouvé que la combinaison de connexions aléatoires, de fenêtres et globales préserve l'expressivité théorique de la pleine attention tout en réduisant la complexité de O(N au carré) vers O(N). Les noyaux efficaces ignorent complètement les entrées masquées plutôt que de les calculer puis de les remettre à zéro.
Impact stratégique
Vitesse et échelle
Les flux de travail linguistiques peuvent évoluer plus rapidement sans sacrifier la cohérence.
Accès et portée
Il étend l’accès à toutes les langues et styles de communication.
Décisions plus claires
Les équipes peuvent consacrer plus de temps au jugement tandis que l’automatisation gère les répétitions.
L’avenir des modèles d’attention clairsemés
L'attention éparse reste au cœur de la modélisation de contexte long, de plus en plus associée à des noyaux optimisés comme FlashAttention et à une parcimonie apprise ou dynamique qui sélectionne les jetons à prendre en compte par entrée. À mesure que les fenêtres contextuelles s'étendent vers des millions de jetons, les piles hybrides mélangent des couches clairsemées, denses et d'espace d'état. Attendez-vous à ce que des noyaux clairsemés sensibles au matériel et une attention basée sur le routage continuent de réduire le coût de lecture d'entrées très longues.
Mise en œuvre dans le monde réel
Longformer traite des articles scientifiques ou des documents juridiques entiers en un seul passage à l'aide d'une fenêtre coulissante et d'une attention globale
BigBird gère les réponses aux questions et les séquences génomiques de longs documents avec une attention à échelle linéaire
Résumer un texte de la longueur d'un livre où toute l'attention épuiserait la mémoire du GPU
Systèmes de récupération et de discussion en contexte long qui utilisent des jetons de hub global pour acheminer les informations clés entre des milliers de jetons
Risques et garde-fous
Les faits hallucinés peuvent discrètement entrer dans des rapports, des flux de support ou des résultats de recherche.
La sensibilité des invites peut créer des résultats incohérents pour des demandes similaires.
Les données textuelles sensibles peuvent être exposées si les contrôles d’accès sont faibles.
Feuille de route de mise en œuvre
Définissez le format de sortie, le ton et les normes de qualité avant le déploiement.
Établissez des réponses auprès de sources fiables chaque fois que la précision est importante.
Gardez un point de contrôle d’examen humain pour les résultats à enjeux élevés.
Suivez les modèles de défaillance et recyclez régulièrement les invites ou les flux de travail.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Sparse Attention Patterns quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Attention dispersée en blocs et native
Questions fréquemment posées
What is Sparse Attention Patterns?
Une attention éparse rend les Transformers moins chers en laissant chaque jeton s'occuper uniquement d'un sous-ensemble soigneusement choisi d'autres jetons plutôt que de tous. Cela échange une petite portée mondiale contre de grosses économies de mémoire et de calcul sur de longues séquences.
Pourquoi une pleine attention sur soi coûte-t-elle cher sur de longues séquences ?
Une attention totale compare chaque jeton à chaque autre jeton, ce qui donne un coût O (N au carré) en temps et en mémoire.
Qu’est-ce que l’attention (locale) à fenêtre coulissante ?
L'attention locale limite la vue de chaque jeton à une fenêtre fixe de jetons environnants, ce qui réduit considérablement les coûts.
Quel est le but des « jetons globaux » en cas d'attention éparse ?
Quelques jetons globaux se connectent à toutes les positions, permettant aux informations de circuler à moindre coût sur toute la séquence.
Quel modèle a prouvé que la combinaison de l'attention aléatoire, de l'attention de fenêtre et de l'attention globale permet de conserver une expressivité totale ?
BigBird a montré que son modèle clairsemé est un approximateur universel des fonctions de séquence tout en évoluant à peu près linéairement.
À peu près, comment le nombre de connexions évolue-t-il dans une attention clairsemée bien conçue ?
En limitant les connexions aux fenêtres locales et à quelques liens globaux, le nombre total de connexions augmente de manière linéaire.