PagedAttention és vLLM
A PagedAttention egy memóriakezelési technika, amely a nyelvi modell figyelmi gyorsítótárát kis, újrafelhasználható blokkokban tárolja egy nagy összefüggő darab helyett.
Áttekintés
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
Mély merülés
Amikor egy nyelvi modell szöveget generál, minden látott jogkivonathoz megőrzi a „KV gyorsítótárat” (kulcs- és értékvektorok), így a következő token a teljes kontextusra képes figyelni. Hagyományosan minden kérés egy nagy, összefüggő GPU-memóriát foglalt le, a lehető legnagyobb hosszra méretezve, így hatalmas mennyiséget pazaroltak el, amikor a sorozatok rövidebbek vagy változó hosszúságúak voltak. A UC Berkeley 2023-as vLLM-anyagában bemutatott PagedAttention a virtuális memória lapozás ötletét az operációs rendszerektől kölcsönzi: a KV gyorsítótárat fix méretű blokkokra osztja, amelyek bárhol elhelyezhetők a memóriában, és igény szerint lefoglalhatók. A keresőtábla leképezi a logikai token pozíciókat fizikai blokkokra. Ez szinte kiküszöböli a memória töredezettségét, és lehetővé teszi a blokkok megosztását, például ugyanazon prompt több kimenetén.
Technikai betekintés
A KV gyorsítótár fix méretű oldalakra van felosztva, amelyek mindegyike egy meghatározott számú token kulcsait és értékeit tartalmazza. A sorozatonkénti blokktáblázat a logikai pozíciókat a fizikai oldalhelyekhez rendeli hozzá, így a sorozat gyorsítótárának nem kell szomszédosnak lennie. Mivel az azonos előtagok (megosztott rendszerprompt vagy sugárkereső ágak) ugyanazokra a fizikai oldalakra mutathatnak írás-másolás révén, a memória újrafelhasználásra kerül a duplikált helyett, ami több mint 60%-ról néhány százalékra csökkenti a veszteséget.
Stratégiai hatás
Költség és költségvetés
Az építészeti döntések évekig növelik a teljesítményt és a működési költségeket.
Tisztább döntések
A technikai oktatás segít a csapatoknak a megfelelő verem kiválasztásában, nem csak a legújabb készletben.
Minőségellenőrzés
A jobb mérnöki döntések csökkentik a termelés megbízhatósági incidenseit.
A PagedAttention és a vLLM jövője
A vLLM alapértelmezett nyílt forráskódú következtetési gerincvé vált, és a PagedAttention ötletei a legtöbb kiszolgálóveremben megjelennek. Mélyebb előtag-gyorsítótárazásra (a gyorsítótárazott rendszerkérdések újrafelhasználása a felhasználók között), a különálló gépeken lebontott előtöltésre és dekódolásra, intelligensebb kilakoltatási szabályzatokra, valamint a kvantálás és a spekulatív dekódolás szoros integrációjára számíthat. Ahogy a kontextusablakok több millió tokenekké nőnek, a hatékony lapozott KV-kezelés még központibbá válik a kiszolgálás megfizethető megőrzése szempontjából.
Valós megvalósítás
Nyílt forráskódú LLM API tárolása, ahol a vLLM sok egyidejű csevegőfelhasználót szolgál ki egyetlen GPU-ról nagy átviteli sebességgel
Hosszú rendszerparancs megosztása több ezer kérelem között az előtag gyorsítótárazásával, így egyszeri feldolgozásra kerül, nem ismétlődően
Futósugár-keresés vagy több mintavételezett befejezés, amelyek megosztják a KV-blokkokat a közös prompthoz másolás-írás útján
A GPU-memória-pazarlás csökkentése a töredezettségből, hogy a szolgáltató több egyidejű munkamenetet csomagolhasson ugyanarra a hardverre
Kockázatok és védőkorlátok
Egy benchmark optimalizálása elrejtheti a rendszer általános hiányosságait.
Az infrastrukturális és karbantartási költségeket gyakran alábecsülik.
A biztonsági és megfigyelhetőségi hiányosságok a rendszerek bonyolultabbá válásával nőhetnek.
Végrehajtási ütemterv
Határozza meg a késleltetési, minőségi és költségcélokat a megvalósítás előtt.
Benchmark reális terhelési és adatviszonyok mellett.
Műszerfigyelés a hibák, az eltolódás és a felhasználói hatások szempontjából.
A méretezés előtt készítse elő a visszagörgetési és az incidensre adott válaszútvonalakat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
Differenciális adatvédelem
Gyakran ismételt kérdések
What is PagedAttention and vLLM?
A PagedAttention egy memóriakezelési technika, amely a nyelvi modell figyelmi gyorsítótárát kis, újrafelhasználható blokkokban tárolja egy nagy összefüggő darab helyett. Ez hajtja a vLLM-et, egy nyílt forráskódú kiszolgálómotort, amely drámaian megnöveli, hogy egy GPU hány kérést tud kezelni.
Mit tárol a „KV gyorsítótár” a szöveggenerálás során?
A KV gyorsítótár kulcs- és értékvektorokat tartalmaz minden korábbi jogkivonathoz, lehetővé téve a modell számára, hogy a teljes kontextusra figyeljen anélkül, hogy minden lépést újraszámítana.
Milyen operációs rendszer-koncepció ihlette a PagedAttentiont?
A PagedAttention virtuális memória lapozást kölcsönöz: a KV gyorsítótár fix méretű oldalakra van felosztva, amelyek bárhol élhetnek, blokktáblázattal leképezve.
Milyen problémát old meg a PagedAttention a hagyományos KV gyorsítótár-kiosztással?
Ha kérésenként egy nagy összefüggő födémet foglalt le, a maximális hosszra méretezve, hatalmas mennyiségű GPU-memória pazarolt el. A lapozás igény szerint kiosztja a kis blokkokat, levágva a hulladékot.
Hogyan teszi lehetővé a PagedAttention több kimenetnek a memória megosztását egy közös prompthoz?
Az azonos előtagok (megosztott promptok vagy sugárkeresési ágak) ugyanazokra a fizikai KV-oldalakra hivatkoznak, és csak akkor másolnak, ha egy ág eltér.
Hol fejlesztették ki eredetileg a vLLM-et és a PagedAttentiont?
A vLLM és a PagedAttention algoritmus az UC Berkeley-ben jelent meg egy 2023-as cikkben, és gyorsan széles körben használt nyílt forráskódú kiszolgálómotorokká váltak.