PANDUAN Teknikal

PagedAttention dan vLLM

PagedAttention ialah teknik pengurusan ingatan yang menyimpan cache perhatian model bahasa dalam blok kecil boleh guna semula dan bukannya satu bongkah besar yang berdekatan.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.

Menyelam dalam

Apabila model bahasa menjana teks, ia menyimpan 'cache KV' (kunci dan vektor nilai) untuk setiap token yang telah dilihatnya supaya token seterusnya dapat memenuhi konteks penuh. Secara tradisinya, setiap permintaan menyimpan satu papak bersebelahan besar memori GPU bersaiz untuk panjang maksimum yang mungkin, membazirkan jumlah yang besar apabila jujukan lebih pendek atau panjang berbeza. PagedAttention, yang diperkenalkan dalam kertas vLLM 2023 daripada UC Berkeley, meminjam idea paging memori maya daripada sistem pengendalian: ia membahagikan cache KV kepada blok bersaiz tetap yang boleh hidup di mana-mana dalam memori dan diperuntukkan atas permintaan. Jadual carian memetakan kedudukan token logik kepada blok fizikal. Ini hampir menghapuskan pemecahan memori dan membolehkan blok dikongsi, contohnya merentas berbilang output daripada gesaan yang sama.

Wawasan Teknikal

Cache KV dibahagikan kepada halaman bersaiz tetap, masing-masing memegang kunci dan nilai untuk bilangan token yang ditetapkan. Jadual blok setiap jujukan memetakan kedudukan logik ke lokasi halaman fizikal, jadi cache jujukan tidak perlu bersebelahan. Oleh kerana awalan yang sama (gesaan sistem yang dikongsi, atau cawangan carian pancaran) boleh menghala ke halaman fizikal yang sama melalui salin atas tulis, memori digunakan semula dan bukannya pendua, mengurangkan sisa daripada lebih 60% kepada beberapa peratus.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan PagedAttention dan vLLM

vLLM telah menjadi tulang belakang inferens sumber terbuka lalai, dan idea PagedAttention kini muncul merentasi kebanyakan susunan penyajian. Jangkakan caching awalan yang lebih mendalam (menggunakan semula gesaan sistem cache merentas pengguna), praisi dan penyahkod yang diagregatkan pada mesin yang berasingan, dasar pengusiran yang lebih bijak dan penyepaduan yang ketat dengan pengkuantitian dan penyahkodan spekulatif. Apabila tetingkap konteks berkembang menjadi berjuta-juta token, pengurusan KV halaman yang cekap menjadi lebih penting untuk memastikan perkhidmatan mampu milik.

Pelaksanaan Dunia Sebenar

Mengehos API LLM sumber terbuka di mana vLLM menyediakan banyak pengguna sembang serentak daripada satu GPU pada daya pemprosesan yang tinggi

Berkongsi gesaan sistem yang panjang merentas beribu-ribu permintaan melalui cache awalan supaya ia diproses sekali, bukan berulang kali

Menjalankan carian pancaran atau berbilang penyiapan sampel yang berkongsi blok KV untuk gesaan biasa melalui salin atas tulis

Memotong sisa memori GPU daripada pemecahan supaya pembekal boleh membungkus lebih banyak sesi serentak ke perkakasan yang sama

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PagedAttention and vLLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Privasi Berbeza

Soalan lazim

What is PagedAttention and vLLM?

PagedAttention ialah teknik pengurusan ingatan yang menyimpan cache perhatian model bahasa dalam blok kecil boleh guna semula dan bukannya satu bongkah besar yang berdekatan. Ia menguatkan vLLM, enjin penyajian sumber terbuka yang secara mendadak meningkatkan bilangan permintaan yang boleh dikendalikan oleh satu GPU.

Apakah yang disimpan oleh 'KV cache' semasa penjanaan teks?

Cache KV memegang vektor kunci dan nilai untuk setiap token sebelumnya, membenarkan model melihat konteks penuh tanpa mengiranya semula setiap langkah.

Apakah konsep sistem pengendalian yang mengilhamkan PagedAttention?

PagedAttention meminjam paging memori maya: cache KV dibahagikan kepada halaman bersaiz tetap yang boleh hidup di mana-mana sahaja, dipetakan oleh jadual blok.

Apakah masalah dengan peruntukan cache KV tradisional yang diselesaikan oleh PagedAttention?

Menempah satu papak bersebelahan besar bagi setiap permintaan, bersaiz untuk panjang maksimum, membazirkan sejumlah besar memori GPU. Paging memperuntukkan blok kecil atas permintaan, memotong sisa.

Bagaimanakah PagedAttention membenarkan berbilang output berkongsi memori untuk gesaan biasa?

Awalan yang sama (gesaan dikongsi atau cawangan carian pancaran) merujuk halaman KV fizikal yang sama, hanya menyalin apabila cawangan menyimpang.

Di manakah vLLM dan PagedAttention pada asalnya dibangunkan?

vLLM dan algoritma PagedAttention keluar dari UC Berkeley dalam kertas 2023 dan dengan cepat menjadi enjin penyajian sumber terbuka yang digunakan secara meluas.