MWONGOZO wa Kiufundi

PagedAttention na vLLM

PagedAttention ni mbinu ya udhibiti wa kumbukumbu ambayo huhifadhi akiba ya modeli ya lugha katika vizuizi vidogo vinavyoweza kutumika tena badala ya fungu moja kubwa linaloambatana.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

Dive ya kina

Kielelezo cha lugha kinapozalisha maandishi, huweka 'kache ya KV' (vidhibiti vya ufunguo na thamani) kwa kila tokeni ambayo imeona ili tokeni inayofuata iweze kuzingatia muktadha kamili. Kijadi, kila ombi lilihifadhi bamba moja kubwa la kumbukumbu ya GPU iliyo na ukubwa kwa urefu wake wa juu iwezekanavyo, na kupoteza kiasi kikubwa wakati mfuatano ulikuwa mfupi au tofauti kwa urefu. PagedAttention, iliyoletwa katika karatasi ya vLLM ya 2023 kutoka UC Berkeley, hukopa wazo la kurasa za kumbukumbu pepe kutoka kwa mifumo ya uendeshaji: inagawanya kashe ya KV katika vizuizi vya ukubwa usiobadilika ambavyo vinaweza kuishi popote kwenye kumbukumbu na kugawiwa kwa mahitaji. Jedwali la utafutaji linaonyesha misimamo ya tokeni ya kimantiki kwa vizuizi halisi. Hili karibu liondoe mgawanyiko wa kumbukumbu na kuruhusu vizuizi vishirikiwe, kwa mfano katika matokeo mengi kutoka kwa dodoso sawa.

Ufahamu wa Kiufundi

Akiba ya KV imegawanywa katika kurasa za ukubwa usiobadilika, kila moja ikiwa na funguo na thamani kwa idadi fulani ya tokeni. Jedwali la zuio la kila mlolongo linaonyesha misimamo ya kimantiki kwa maeneo halisi ya ukurasa, kwa hivyo akiba ya mfuatano haifai kuwa mbana. Kwa sababu viambishi awali vinavyofanana (amri ya mfumo ulioshirikiwa, au matawi ya utafutaji-boriti) yanaweza kuelekeza kwenye kurasa halisi kupitia nakala-kwa-kuandika, kumbukumbu hutumiwa tena badala ya kunakiliwa, ikifyeka taka kutoka zaidi ya 60% hadi asilimia chache.

Athari za kimkakati

Cost and budget

Maamuzi ya usanifu huendesha utendaji na gharama ya uendeshaji kwa miaka.

Maamuzi ya wazi zaidi

Elimu ya kiufundi husaidia timu kuchagua safu sahihi, sio tu mpya zaidi.

Quality control

Chaguo bora za uhandisi hupunguza matukio ya kuaminika katika uzalishaji.

Mustakabali wa PagedAttention na vLLM

vLLM imekuwa uti wa mgongo wa uelekezaji wa chanzo huria, na mawazo ya PagedAttention sasa yanaonekana kwenye rafu nyingi zinazotolewa. Tarajia uakibishaji wa kiambishi awali (kutumia tena vidokezo vya mfumo ulioakibishwa kwa watumiaji), ujazo awali uliogawanywa na kusimbua kwenye mashine tofauti, sera mahiri za uondoaji, na ujumuishaji thabiti na ujanibishaji na utatuzi wa kubahatisha. Madirisha ya muktadha yanapokua na kuwa mamilioni ya tokeni, usimamizi bora wa KV kwenye ukurasa unakuwa muhimu zaidi katika kudumisha huduma kwa bei nafuu.

Utekelezaji wa Ulimwengu Halisi

Kupangisha API ya chanzo huria ya LLM ambapo vLLM hutumikia watumiaji wengi wa gumzo kwa wakati mmoja kutoka kwa GPU moja kwa utoaji wa juu.

Kushiriki kidokezo cha mfumo mrefu katika maelfu ya maombi kupitia uakibishaji wa kiambishi awali ili kuchakatwa mara moja, sio kurudia.

Utafutaji wa boriti au ukamilishaji wa sampuli nyingi zinazoshiriki vizuizi vya KV kwa arifa ya kawaida kupitia nakala-kwa-kuandika.

Kukata taka za kumbukumbu ya GPU kutoka kwa kugawanyika ili mtoaji aweze kupakia vipindi zaidi vya wakati mmoja kwenye maunzi sawa.

Hatari & Walinzi

Kuboresha kiwango kimoja kunaweza kuficha udhaifu mkubwa wa mfumo.

Gharama za miundombinu na matengenezo mara nyingi hupunguzwa.

Mapengo ya usalama na uonekanaji yanaweza kukua kadiri mifumo inavyozidi kuwa ngumu.

Ramani ya Utekelezaji

1

Bainisha muda, ubora na malengo ya gharama kabla ya utekelezaji.

2

Benchmark chini ya mzigo halisi na hali ya data.

3

Ufuatiliaji wa ala kwa makosa, kuteleza, na athari za mtumiaji.

4

Tayarisha njia za urejeshaji na majibu ya matukio kabla ya kuongeza ukubwa.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Faragha ya Tofauti

Maswali yanayoulizwa mara kwa mara

What is PagedAttention and vLLM?

PagedAttention ni mbinu ya udhibiti wa kumbukumbu ambayo huhifadhi akiba ya modeli ya lugha katika vizuizi vidogo vinavyoweza kutumika tena badala ya fungu moja kubwa linaloambatana. Inawezesha vLLM, injini ya kutoa huduma huria ambayo huongeza kwa kiasi kikubwa idadi ya maombi ambayo GPU moja inaweza kushughulikia.

Je, 'Kache ya KV' huhifadhi nini wakati wa kutengeneza maandishi?

Akiba ya KV inashikilia vidhibiti vya ufunguo na thamani kwa kila tokeni iliyotangulia, ikiruhusu kielelezo kuhudhuria muktadha kamili bila kuirejesha kila hatua.

Ni dhana gani ya mfumo-endeshaji iliongoza PagedAttention?

PagedAttention hukopa paging ya kumbukumbu pepe: kashe ya KV imegawanywa katika kurasa za ukubwa usiobadilika ambazo zinaweza kuishi popote, zikiwa zimechorwa na jedwali la kuzuia.

Je, ni tatizo gani la mgao wa kashe wa KV wa kitamaduni ambao PagedAttention hutatua?

Kuhifadhi bamba kubwa moja kubwa kwa kila ombi, lililo na ukubwa wa urefu wa juu zaidi, kulipoteza kiasi kikubwa cha kumbukumbu ya GPU. Paging hutenga vitalu vidogo kwa mahitaji, kufyeka taka.

Je, PagedAttention huruhusu matokeo mengi kushiriki kumbukumbu kwa haraka ya kawaida?

Viambishi awali vinavyofanana (vidokezo vilivyoshirikiwa au matawi ya utafutaji-boriti) hurejelea kurasa halisi za KV, vikinakili tu wakati tawi linatofautiana.

VLLM na PagedAttention zilitengenezwa wapi hapo awali?

vLLM na algoriti ya PagedAttention ilitoka kwa UC Berkeley katika karatasi ya 2023 na kwa haraka ikawa injini ya huduma huria inayotumika sana.