Attention dispersée en blocs et native
L'attention fragmentée en blocs et native permet aux transformateurs de s'occuper uniquement des morceaux les plus pertinents d'une longue séquence au lieu de chaque jeton, réduisant ainsi le coût quadratique de l'attention standard.
Aperçu
This is what makes efficient long-context models practical on real hardware.
Plongée profonde
L'auto-attention standard compare chaque jeton à chaque autre jeton, de sorte que le coût augmente quadratiquement avec la longueur de la séquence, devenant prohibitif pour les documents très longs. Une attention éparse restreint chaque jeton à un sous-ensemble d’autres. Les approches par blocs divisent la séquence en blocs et calculent l'attention uniquement pour les paires de blocs sélectionnées, qui sont mappées efficacement sur les cœurs tenseurs du GPU. Native Sparse Attention (NSA), de DeepSeek, va plus loin : il est entraînable de bout en bout et aligné sur le matériel, combinant trois branches, une compression de jetons à gros grain, une sélection fine des blocs les plus importants et une fenêtre coulissante pour le contexte local. Étant donné que le modèle de parcimonie est appris pendant le pré-entraînement plutôt que intégré par la suite, la NSA préserve la précision tout en offrant des accélérations importantes sur de longues séquences.
Aperçu technique
La NSA traite les clés et les valeurs via trois chemins parallèles, puis les fusionne avec des portes apprises. La compression regroupe des blocs de jetons en représentations récapitulatives ; la sélection marque les blocs et ne conserve que les mieux classés pour toute l'attention ; une fenêtre coulissante couvre les jetons à proximité. Les opérations au niveau des blocs s'alignent sur l'accès à la mémoire GPU et le débit du tenseur-cœur, de sorte que les économies théoriques de FLOP se traduisent par de véritables accélérations d'horloge murale pendant la formation et l'inférence, en particulier pour l'étape de décodage liée à la mémoire.
Impact stratégique
Coût et budget
Les décisions en matière d'architecture déterminent les performances et les coûts d'exploitation pendant des années.
Décisions plus claires
La formation technique aide les équipes à choisir la bonne pile, pas seulement la plus récente.
Contrôle qualité
De meilleurs choix d’ingénierie réduisent les incidents de fiabilité en production.
L’avenir de l’attention dispersée en blocs et native
La parcimonie entraînable et sensible au matériel devient la voie vers un contexte d'un million de jetons sans exploser les coûts. Attendez-vous à ce qu’une attention éparse soit co-conçue avec des noyaux et des accélérateurs, mélangée à des idées d’attention linéaire et d’espace d’état, et adoptée dans des modèles de raisonnement et de contexte long frontière. À mesure que les modèles deviennent apprenables et dynamiques, les modèles alloueront un budget d'attention de manière adaptative à chaque requête, et les benchmarks mesureront de plus en plus le débit de décodage sur de longues séquences, et pas seulement la qualité brute.
Mise en œuvre dans le monde réel
Exécuter un modèle sur l'intégralité d'une base de code ou sur un long contrat juridique où toute l'attention épuiserait la mémoire du GPU.
La NSA de DeepSeek accélère à la fois le pré-entraînement et l'inférence à long contexte tout en correspondant ou en dépassant la précision de la pleine attention.
Résumer des documents de la longueur d'un livre en consultant des résumés de blocs compressés ainsi que des passages pertinents au niveau local.
Accélérer les assistants de discussion à contexte long dont l'étape de décodage est limitée en mémoire en limitant chaque jeton aux blocs les mieux classés.
Risques et garde-fous
L’optimisation d’un benchmark peut masquer des faiblesses plus larges du système.
Les coûts d’infrastructure et de maintenance sont souvent sous-estimés.
Les lacunes en matière de sécurité et d’observabilité peuvent se creuser à mesure que les systèmes deviennent plus complexes.
Feuille de route de mise en œuvre
Définissez les objectifs de latence, de qualité et de coût avant la mise en œuvre.
Benchmark dans des conditions de charge et de données réalistes.
Surveillance des instruments pour détecter les erreurs, la dérive et l'impact sur l'utilisateur.
Préparez les chemins de restauration et de réponse aux incidents avant la mise à l’échelle.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Block-Sparse and Native Sparse Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Modèles d’attention clairsemés
Questions fréquemment posées
What is Block-Sparse and Native Sparse Attention?
L'attention fragmentée en blocs et native permet aux transformateurs de s'occuper uniquement des morceaux les plus pertinents d'une longue séquence au lieu de chaque jeton, réduisant ainsi le coût quadratique de l'attention standard. C’est ce qui rend les modèles efficaces à contexte long pratiques sur du matériel réel.
Pourquoi l’auto-attention standard est-elle coûteuse pour les longues séquences ?
Chaque jeton s'occupe de tous les autres jetons, donc le calcul et la mémoire évoluent avec le carré de la longueur de la séquence.
Quelle est l’idée centrale de l’attention parsemée de blocs ?
La séquence est divisée en blocs et l'attention est calculée uniquement pour les paires de blocs choisies, qui correspondent également bien aux cœurs tenseurs du GPU.
Qu’est-ce qui différencie Native Sparse Attention (NSA) des nombreuses méthodes clairsemées antérieures ?
La NSA apprend son modèle de parcimonie lors du pré-entraînement et est conçue pour s'aligner sur le matériel, de sorte qu'elle préserve la précision tout en fonctionnant rapidement.
Quelles sont les trois branches que la NSA combine pour ses clés et ses valeurs ?
La NSA fusionne une compression grossière de jetons, une sélection de blocs à granularité fine et une fenêtre coulissante locale à l'aide de portes apprises.
Pourquoi la NSA utilise-t-elle des opérations au niveau des blocs plutôt qu'une parcimonie arbitraire au niveau des jetons ?
Les modèles d'accès au niveau des blocs conviennent au matériel GPU, de sorte que les économies théoriques de FLOP se transforment en véritables accélérations d'horloge murale.