PagedAttention и vLLM
PagedAttention е техника за управление на паметта, която съхранява кеша за внимание на езиков модел в малки блокове за многократна употреба вместо в едно голямо непрекъснато парче.
Преглед
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
Дълбоко гмуркане
Когато езиков модел генерира текст, той запазва „KV кеш“ (вектори на ключ и стойност) за всеки токен, който е видял, така че следващият токен да може да се погрижи за пълния контекст. Традиционно всяка заявка запазваше една голяма непрекъсната плоча GPU памет, оразмерена за максималната възможна дължина, като се губеха огромни количества, когато последователностите бяха по-къси или с различна дължина. PagedAttention, въведен в доклада за vLLM от 2023 г. от Калифорнийския университет в Бъркли, заимства идеята за пейджинг на виртуална памет от операционните системи: той разделя KV кеша на блокове с фиксиран размер, които могат да живеят навсякъде в паметта и да бъдат разпределени при поискване. Справочна таблица картографира позициите на логически токени към физически блокове. Това почти елиминира фрагментирането на паметта и позволява споделянето на блокове, например между множество изходи от една и съща подкана.
Техническа информация
KV кешът е разделен на страници с фиксиран размер, всяка от които съдържа ключовете и стойностите за определен брой токени. Блокова таблица за последователност картографира логическите позиции към местоположенията на физическите страници, така че не е необходимо кешът на последователността да е непрекъснат. Тъй като идентични префикси (споделена системна подкана или клонове за търсене на лъч) могат да сочат към едни и същи физически страници чрез копиране при запис, паметта се използва повторно, вместо да се дублира, намалявайки отпадъците от над 60% до няколко процента.
Стратегическо въздействие
Cost and budget
Архитектурните решения стимулират производителността и оперативните разходи в продължение на години.
Clearer decisions
Техническото образование помага на екипите да изберат правилния стек, а не само най-новия.
Quality control
По-добрият инженерен избор намалява инцидентите, свързани с надеждността в производството.
Бъдещето на PagedAttention и vLLM
vLLM се превърна в основа за изводи с отворен код по подразбиране и идеите на PagedAttention вече се появяват в повечето стекове за обслужване. Очаквайте по-задълбочено кеширане на префикси (повторно използване на кеширани системни подкани между потребителите), дезагрегирано предварително попълване и декодиране на отделни машини, по-интелигентни политики за изваждане и тясна интеграция с квантуване и спекулативно декодиране. Тъй като контекстните прозорци се разрастват в милиони токени, ефективното странично управление на KV става още по-централно за поддържане на достъпното обслужване.
Внедряване в реалния свят
Хостинг на LLM API с отворен код, където vLLM обслужва много едновременни потребители на чат от един GPU при висока пропускателна способност
Споделяне на дълга системна подкана в хиляди заявки чрез кеширане на префикси, така че да се обработва веднъж, а не многократно
Търсене с бягащ лъч или множество извадки завършвания, които споделят KV блокове за общата подкана чрез копиране при запис
Намаляване на загубата на GPU памет от фрагментация, така че доставчикът да може да пакетира повече едновременни сесии на един и същ хардуер
Рискове и предпазни огради
Оптимизирането на един бенчмарк може да скрие по-широки системни слабости.
Разходите за инфраструктура и поддръжка често се подценяват.
Пропуските в сигурността и видимостта могат да нарастват, когато системите стават по-сложни.
Пътна карта за изпълнение
Определете целите за латентност, качество и разходи преди внедряването.
Бенчмарк при реалистични условия на натоварване и данни.
Мониторинг на инструмента за грешки, отклонение и въздействие върху потребителя.
Подгответе пътеките за връщане назад и реакция на инцидент преди мащабиране.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Диференциална поверителност
Frequently asked questions
What is PagedAttention and vLLM?
PagedAttention е техника за управление на паметта, която съхранява кеша за внимание на езиков модел в малки блокове за многократна употреба вместо в едно голямо непрекъснато парче. Той захранва vLLM, обслужваща машина с отворен код, която драстично увеличава колко заявки може да обработи един GPU.
Какво съхранява „KV кеша“ по време на генериране на текст?
KV кешът съдържа вектори на ключове и стойности за всеки предишен токен, позволявайки на модела да се погрижи за пълния контекст, без да го изчислява отново на всяка стъпка.
Каква концепция за операционна система вдъхнови PagedAttention?
PagedAttention заема страниране на виртуална памет: KV кешът е разделен на страници с фиксиран размер, които могат да живеят навсякъде, картографирани от блокова таблица.
Какъв проблем с традиционното разпределение на KV кеш решава PagedAttention?
Резервирането на една голяма непрекъсната плоча на заявка, оразмерена за максимална дължина, губи огромни количества GPU памет. Странирането разпределя малки блокове при поискване, намалявайки отпадъците.
Как PagedAttention позволява на множество изходи да споделят памет за обща подкана?
Идентични префикси (споделени подкани или клонове за търсене на лъч) препращат към едни и същи физически KV страници, като се копират само когато клон се отклонява.
Къде първоначално са разработени vLLM и PagedAttention?
vLLM и алгоритъмът PagedAttention излязоха от UC Berkeley в документ от 2023 г. и бързо се превърнаха в широко използвана машина за обслужване с отворен код.