PagedAttention dan vLLM
PagedAttention adalah teknik manajemen memori yang menyimpan cache perhatian model bahasa dalam blok kecil yang dapat digunakan kembali, bukan dalam satu blok besar yang bersebelahan.
Ikhtisar
It powers vLLM, an open-source serving engine that dramatically boosts how many requests a single GPU can handle.
Menyelam Lebih Dalam
Ketika model bahasa menghasilkan teks, ia menyimpan 'cache KV' (vektor kunci dan nilai) untuk setiap token yang dilihatnya sehingga token berikutnya dapat menangani konteks penuh. Secara tradisional, setiap permintaan mencadangkan satu lempengan besar memori GPU yang bersebelahan dengan ukuran panjang maksimum yang mungkin, sehingga membuang-buang jumlah besar ketika urutannya lebih pendek atau panjangnya bervariasi. PagedAttention, yang diperkenalkan dalam makalah vLLM tahun 2023 dari UC Berkeley, meminjam ide paging memori virtual dari sistem operasi: ini membagi cache KV menjadi blok berukuran tetap yang dapat berada di mana saja dalam memori dan dialokasikan sesuai permintaan. Tabel pencarian memetakan posisi token logis ke blok fisik. Hal ini hampir menghilangkan fragmentasi memori dan memungkinkan blok dibagikan, misalnya ke beberapa keluaran dari prompt yang sama.
Wawasan Teknis
Cache KV dibagi menjadi halaman berukuran tetap, masing-masing berisi kunci dan nilai untuk sejumlah token tertentu. Tabel blok per urutan memetakan posisi logis ke lokasi halaman fisik, sehingga cache urutan tidak perlu berdekatan. Karena prefiks yang identik (prompt sistem bersama, atau cabang beam-search) dapat mengarah ke halaman fisik yang sama melalui copy-on-write, memori digunakan kembali, bukan diduplikasi, sehingga mengurangi limbah dari lebih dari 60% menjadi beberapa persen.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan PagedAttention dan vLLM
vLLM telah menjadi tulang punggung inferensi sumber terbuka default, dan ide PagedAttention kini muncul di sebagian besar tumpukan penyajian. Harapkan cache awalan yang lebih dalam (menggunakan kembali perintah sistem cache di seluruh pengguna), pengisian awal dan dekode terpilah pada mesin terpisah, kebijakan penggusuran yang lebih cerdas, dan integrasi yang erat dengan kuantisasi dan dekode spekulatif. Ketika jendela konteks berkembang menjadi jutaan token, pengelolaan KV yang efisien menjadi lebih penting untuk menjaga layanan tetap terjangkau.
Implementasi Dunia Nyata
Menghosting API LLM sumber terbuka tempat vLLM melayani banyak pengguna obrolan secara bersamaan dari satu GPU dengan throughput tinggi
Berbagi prompt sistem yang panjang ke ribuan permintaan melalui cache awalan sehingga diproses satu kali, bukan berulang kali
Menjalankan pencarian berkas atau beberapa penyelesaian sampel yang berbagi blok KV untuk perintah umum melalui copy-on-write
Memotong pemborosan memori GPU akibat fragmentasi sehingga penyedia dapat mengemas lebih banyak sesi simultan ke perangkat keras yang sama
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PagedAttention and vLLM quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Privasi Diferensial
Pertanyaan yang sering diajukan
What is PagedAttention and vLLM?
PagedAttention adalah teknik manajemen memori yang menyimpan cache perhatian model bahasa dalam blok kecil yang dapat digunakan kembali, bukan dalam satu blok besar yang bersebelahan. Ini mendukung vLLM, mesin penyajian sumber terbuka yang secara dramatis meningkatkan jumlah permintaan yang dapat ditangani oleh satu GPU.
Apa yang disimpan 'cache KV' selama pembuatan teks?
Cache KV menyimpan vektor kunci dan nilai untuk setiap token sebelumnya, membiarkan model menangani konteks penuh tanpa menghitung ulang setiap langkah.
Konsep sistem operasi apa yang menginspirasi PagedAttention?
PagedAttention meminjam paging memori virtual: cache KV dibagi menjadi halaman berukuran tetap yang dapat berada di mana saja, dipetakan oleh tabel blok.
Masalah apa dengan alokasi cache KV tradisional yang dipecahkan oleh PagedAttention?
Memesan satu lempengan besar yang bersebelahan per permintaan, dengan ukuran panjang maksimal, akan membuang banyak memori GPU. Paging mengalokasikan blok-blok kecil sesuai permintaan, sehingga mengurangi limbah.
Bagaimana PagedAttention membiarkan banyak output berbagi memori untuk prompt umum?
Awalan yang identik (prompt bersama atau cabang pencarian sinar) merujuk pada halaman KV fisik yang sama, hanya menyalin ketika cabang menyimpang.
Di mana vLLM dan PagedAttention awalnya dikembangkan?
vLLM dan algoritma PagedAttention keluar dari UC Berkeley pada makalah tahun 2023 dan dengan cepat menjadi mesin penyajian sumber terbuka yang banyak digunakan.