KV gyorsítótár
A KV gyorsítótár tárolja azokat a kulcs- és értékvektorokat, amelyeket a transzformátor már kiszámolt a korábbi tokenekhez, így nem kell újraszámítania azokat minden új szóhoz, amelyet generál.
Áttekintés
It is the single biggest reason text generation is fast — and the main thing eating your GPU memory during long conversations.
Mély merülés
A transzformátorok szöveget egyenként generálnak, és minden új token figyelmi rétegét összehasonlítani kell minden korábbi tokennel. A figyelemmechanizmus minden tokent lekérdezés-, kulcs- és értékvektorrá alakít. Gyorsítótárazás nélkül az 1000-es számú token generálása azt jelentené, hogy minden lépésben újraszámítanák a kulcsokat és értékeket mind a 999 korábbi tokenhez – négyzetes, pazarló munka. A KV-gyorsítótár elmenti ezeket a kulcs- és értékvektorokat az első kiszámításuk után, és újrafelhasználja őket, így minden új lépés csak az egyetlen legújabb token vektorait számítja ki, és a tárolt gyorsítótáron vesz részt. Ez a tokenenkénti költséget a sorozathosszúságú skálázásról nagyjából állandóra csökkenti. A kompromisszum a memória: a gyorsítótár lineárisan növekszik a kontextus hosszával, a rétegek számával és a figyelemfejekkel, és gyakran a domináns memóriafogyasztóvá válik a hosszú kontextus kiszolgálásában.
Technikai betekintés
Az „előtöltés” fázisban a modell feldolgozza a teljes promptot, és kitölti a gyorsítótárat; a 'dekódolás' során lépésenként egy token K/V értékét fűzi hozzá, és újra részt vesz. A gyorsítótár mérete 2 (K és V) × réteg × fej × head_dim × sorozat_hossza × köteg, a választott pontossággal. Ennek megszelídítésére a modern modellek csoportos lekérdezéseket vagy többlekérdezéseket használnak a kulcsok/értékek fejek közötti megosztására, a kiszolgáló rendszerek pedig, mint a vLLM, a PagedAttention segítségével foglalják le a gyorsítótárat a nem összefüggő blokkokban, csökkentve a töredezettséget és a veszteséget.
Stratégiai hatás
Sebesség és méretarány
A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.
Hozzáférés és elérés
Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.
Tisztább döntések
A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.
A KV Cache jövője
Ahogy a kontextusablakok több százezer tokenbe nyúlnak bele, a KV gyorsítótár válik a központi szűk keresztmetszetté, ezért az innováció heves: a gyorsítótár kvantálása 8 vagy 4 bitre, a kis jelentőségű tokeneket eldobó kilakoltatási szabályzatok, keresztkérések előtagok megosztása, valamint a CPU-ra vagy lemezre történő kitöltés. Az olyan építészeti eltolódások, mint a többfejes látens figyelem, magát a gyorsítótárat tömörítik. A figyelem változatok és memóriarendszerek folyamatos közös tervezése várható, amelyek célja a nagyon hosszú kontextusok olcsó és nagy áteresztőképességű kiszolgálása.
Valós megvalósítás
A chatbot válaszainak felgyorsítása a beszélgetési előzmények gyorsítótárazott kulcsainak/értékeinek újrafelhasználásával ahelyett, hogy minden körben újra feldolgoznák.
Előtag gyorsítótárazás, amely megosztja a gyorsítótárat egy hosszú rendszerparancs érdekében sok felhasználó között, csökkentve a költségeket és a késleltetést.
A vLLM PagedAttention, amely blokkokban kezeli a KV gyorsítótárat, hogy sok egyidejű kérést hatékonyan kiszolgáljon egyetlen GPU-n.
A KV gyorsítótár kvantálása a kisebb pontosság érdekében, hogy hosszabb kontextusokat illesszen be a korlátozott GPU-memóriába.
Kockázatok és védőkorlátok
A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.
Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.
Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.
Végrehajtási ütemterv
A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.
Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.
Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.
Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the KV Cache quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
KV gyorsítótár optimalizálása
Gyakran ismételt kérdések
What is KV Cache?
A KV gyorsítótár tárolja azokat a kulcs- és értékvektorokat, amelyeket a transzformátor már kiszámolt a korábbi tokenekhez, így nem kell újraszámítania azokat minden új szóhoz, amelyet generál. Ez az egyetlen legnagyobb ok, amiért a szöveggenerálás gyors – és ez a fő dolog, ami a hosszú beszélgetések során felemészti a GPU memóriáját.
Mit tárol a KV gyorsítótár?
A KV gyorsítótár tárolja a korábbi tokenek kulcs- és értékvektorait, így a figyelem újrafelhasználhatja őket az újraszámítás helyett.
Milyen problémát old meg elsősorban a KV gyorsítótár?
Gyorsítótárazás nélkül minden új tokenhez minden korábbi tokenhez újra kellene számítani a K/V-t, ami pazarló; a gyorsítótár a tokenenkénti költséget nagyjából állandóvá teszi.
Mi a KV gyorsítótár fő hátránya?
A gyorsítótár a sorozathosszúsággal, a rétegekkel és a fejekkel növekszik, és gyakran a GPU-memória domináns fogyasztójává válik a hosszú kontextusú kiszolgálásban.
Melyik technika csökkenti a KV gyorsítótár méretét a kulcsok és értékek megosztásával a figyelemfejek között?
A csoportosított lekérdezés és a többlekérdezés figyelem lehetővé teszi, hogy több lekérdezőfej kevesebb kulcs-/értékkészleten osztozzon, ami jelentősen csökkenti a gyorsítótárat.
Mi a transzformátor következtetésének két fázisa a KV gyorsítótárhoz képest?
Az előtöltés kitölti a gyorsítótárat a prompt K/V értékével; A decode lépésenként egy új token K/V értékét fűzi hozzá, és újra felügyeli a gyorsítótárat.