Техническо РЪКОВОДСТВО

Block-Sparse и Native Sparse внимание

Block-sparse и естественото разредено внимание позволяват на трансформаторите да обръщат внимание само на най-подходящите части от дълга последователност вместо на всеки токен, намалявайки квадратичната цена на стандартното внимание.

2 min readПоследна актуализация

Преглед

This is what makes efficient long-context models practical on real hardware.

Дълбоко гмуркане

Стандартното самовнимание сравнява всеки токен с всеки друг токен, така че разходите нарастват квадратично с дължината на последователността, ставайки непосилни за много дълги документи. Разреденото внимание ограничава всеки токен до подмножество от други. Подходите с разредени блокове разделят последователността на блокове и изчисляват вниманието само за избрани двойки блокове, което се нанася ефективно върху тензорните ядра на GPU. Native Sparse Attention (NSA), от DeepSeek, отива по-далеч: той може да се обучава от край до край и е хардуерно подравнен, комбинирайки три клона, едрозърнеста компресия на токени, фина селекция на най-важните блокове и плъзгащ се прозорец за локален контекст. Тъй като моделът на рядкост се научава по време на предварителното обучение, вместо да се закрепва след това, NSA запазва точността, като същевременно осигурява големи ускорения на дълги последователности.

Техническа информация

NSA обработва ключове и стойности през три паралелни пътя, след което ги обединява с научени портове. Компресията агрегира блокове от токени в обобщени представяния; селекцията отбелязва блокове и запазва само най-високо класираните за пълно внимание; плъзгащ се прозорец покрива близките жетони. Операциите на ниво блок са в съответствие с достъпа до паметта на GPU и пропускателната способност на тензорното ядро, така че теоретичните спестявания на FLOP се превръщат в реални ускорявания на стенен часовник както по време на обучение, така и по време на извод, особено за стъпката на декодиране, свързана с паметта.

Стратегическо въздействие

Cost and budget

Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.

Clearer decisions

Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.

Quality control

По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.

Бъдещето на Block-Sparse и Native Sparse Attention

Подлежаща на обучение, хардуерно разреденост се превръща в път към контекст с милиони токени без експлозивни разходи. Очаквайте оскъдно внимание да бъде съвместно проектирано с ядра и ускорители, смесено с идеи за линейно внимание и пространство на състоянието и възприето в граничен дълъг контекст и модели на разсъждение. Тъй като моделите стават обучаеми и динамични, моделите ще разпределят бюджета за внимание адаптивно за всяка заявка, а сравнителните тестове все повече ще измерват пропускателната способност на декодиране на дълги последователности, а не само на сурово качество.

Внедряване в реалния свят

Изпълнението на модел върху цяла кодова база или дълъг юридически договор, където пълното внимание би изчерпало GPU паметта.

NSA на DeepSeek ускорява както предварителното обучение, така и извода за дълъг контекст, като същевременно съпоставя или надминава точността на пълното внимание.

Обобщаване на документи с дължина на книга, като се обръща внимание на компресирани блокови резюмета плюс местно подходящи пасажи.

Ускоряване на асистенти за чат с дълъг контекст, чиято стъпка на декодиране е обвързана с паметта чрез ограничаване на всеки токен до блокове с най-висок ранг.

Рискове и предпазни огради

Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.

Разходите за инфраструктура и поддръжка често се подценяват.

Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.

Пътна карта за изпълнение

1

Определете целите за латентност, качество и разходи преди внедряването.

2

Бенчмарк при реалистични условия на натоварване и данни.

3

Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.

4

Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Block-Sparse and Native Sparse Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Модели на оскъдно внимание

Frequently asked questions

What is Block-Sparse and Native Sparse Attention?

Block-sparse и естественото разредено внимание позволяват на трансформаторите да обръщат внимание само на най-подходящите части от дълга последователност вместо на всеки токен, намалявайки квадратичната цена на стандартното внимание. Това прави ефективните модели с дълъг контекст практични на реален хардуер.

Защо стандартното самовнимание е скъпо за дълги поредици?

Всеки токен се грижи за всеки друг токен, така че изчислете и мащабирайте паметта с квадрата на дължината на последователността.

Каква е основната идея за блоково оскъдно внимание?

Последователността е разделена на блокове и вниманието се изчислява само за избрани двойки блокове, което също се преобразува добре върху тензорните ядра на GPU.

Какво прави Native Sparse Attention (NSA) различен от много по-ранни sparse методи?

NSA научава своя модел на разреденост по време на предварително обучение и е проектиран да се приведе в съответствие с хардуера, така че запазва точността, докато работи бързо.

Кои три клона NSA комбинира за своите ключове и ценности?

NSA обединява грубо компресиране на токени, фина селекция на блокове и локален плъзгащ се прозорец, използвайки научени врати.

Защо NSA използва операции на ниво блок, а не произволна рядкост на ниво токен?

Моделите за достъп на ниво блок отговарят на хардуера на графичния процесор, така че теоретичните спестявания на FLOP се превръщат в действително ускоряване на стенния часовник.