Batching Berterusan
Pengumpulan berterusan ialah teknik penyajian yang menambah dan mengalih keluar permintaan daripada token-demi-token kelompok yang sedang berjalan, dan bukannya menunggu sehingga keseluruhan kumpulan tetap selesai.
Gambaran keseluruhan
Ia memastikan GPU sentiasa sibuk dan meningkatkan dengan ketara berapa ramai pengguna yang boleh dilayani oleh model AI pada satu masa.
Menyelam dalam
GPU adalah paling pantas apabila mereka memproses banyak permintaan bersama-sama dalam satu kelompok. Pendekatan naif, kumpulan statik, mengumpulkan set permintaan tetap, menjalankan semuanya sehingga selesai, kemudian memulakan kumpulan seterusnya. Masalahnya: output model bahasa berbeza-beza panjangnya, jadi permintaan singkat selesai lebih awal dan slotnya terbiar sementara kumpulan menunggu yang paling lama, membazirkan kitaran GPU dan melambatkan ketibaan baharu. Batching berterusan (juga dikenali sebagai batching dalam penerbangan atau peringkat lelaran, dipopularkan oleh kertas Orca dan digunakan dalam vLLM, TensorRT-LLM dan TGI) beroperasi pada kebutiran langkah penyahkodan tunggal. Selepas setiap token dijana, urutan siap keluar dari kumpulan dan permintaan yang baru tiba dimasukkan serta-merta. Ini memastikan kumpulan penuh dan GPU tepu, selalunya meningkatkan daya pemprosesan beberapa kali ganda dengan kependaman yang lebih rendah untuk pengguna yang menunggu.
Wawasan Teknikal
Peralihan utama ialah daripada menggabungkan keseluruhan permintaan kepada membancuh lelaran individu. Pada setiap langkah penyahkod, penjadual membina set aktif: ia menjalankan satu hantaran ke hadapan ke atas semua jujukan dalam penerbangan, mengeluarkan satu token setiap satu, mengusir mana-mana yang mencapai token akhir jujukan atau had panjang, dan menerima permintaan beratur untuk mengisi slot yang dibebaskan. Memadankan ini dengan memori KV fleksibel PagedAttention menjadikan memasukkan dan mengalih keluar jujukan pertengahan penerbangan murah, kerana setiap cache jujukan tinggal dalam blok bebas.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan Batching Berterusan
Batching berterusan kini menjadi standard dalam penyajian LLM pengeluaran. Kerja masa hadapan memperhalusi penjadual: mengasingkan fasa praisi berat pengiraan daripada fasa penyahkodan yang lebih ringan (penyahgregatan), praisi terpotong untuk mengelakkan penyahkodan terhenti, dasar keutamaan dan keadilan untuk beban kerja bercampur, dan gandingan yang lebih ketat dengan penyahkodan spekulatif supaya berbilang token draf disahkan setiap langkah. Matlamatnya ialah memerah token-sesaat maksimum setiap GPU sambil mengekalkan kependaman respons individu rendah dan boleh diramal.
Pelaksanaan Dunia Sebenar
API sembang yang mengakui mesej pengguna yang baru tiba ke dalam kumpulan yang sedang berjalan serta-merta dan bukannya beratur untuk kumpulan seterusnya
Mengusir jawapan pertengahan kumpulan pendek yang lengkap dan mengisi semula slotnya supaya GPU tidak pernah melahu menunggu generasi yang lama
Menggabungkan batching berterusan dengan vLLM's PagedAttention untuk memasukkan dan mengalih keluar urutan dengan murah pada setiap langkah penyahkod
Perkhidmatan penyiapan kod yang mengekalkan token-sesaat yang tinggi di bawah trafik yang penuh dan panjang berubah-ubah dengan memastikan kumpulan penuh
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Continuous Batching quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Kubernetes untuk Beban Kerja ML
Soalan lazim
Apakah itu Continuous Batching?
Pengumpulan berterusan ialah teknik penyajian yang menambah dan mengalih keluar permintaan daripada token-demi-token kelompok yang sedang berjalan, dan bukannya menunggu sehingga keseluruhan kumpulan tetap selesai. Ia menjadikan GPU sentiasa sibuk dan secara mendadak meningkatkan bilangan pengguna model AI boleh berkhidmat sekali gus.
Apakah kelemahan utama batching statik (tetap) untuk sajian LLM?
Oleh kerana panjang output berbeza-beza, jujukan siap terdiam sehingga yang paling perlahan selesai, membazirkan kitaran GPU dan melambatkan permintaan baharu.
Pada butiran apakah pengumpulan berterusan menambah dan mengalih keluar permintaan?
Batching berterusan (peringkat lelaran) mengemas kini set aktif selepas setiap langkah penyahkod tunggal, jadi ia mengendalikan token demi token dan bukannya setiap permintaan keseluruhan.
Apabila jujukan tamat pertengahan kelompok di bawah kelompok berterusan, apakah yang berlaku kepada slotnya?
Urutan yang telah selesai diusir dan permintaan menunggu dimasukkan serta-merta, memastikan kumpulan penuh dan GPU sibuk.
Teknik yang manakah berpasangan secara semula jadi dengan batching berterusan untuk menjadikan urutan memasukkan/mengalih keluar murah?
PagedAttention menyimpan setiap cache KV jujukan dalam blok bebas, jadi menambah atau mengalih keluar jujukan pertengahan penerbangan tidak mengganggu ingatan orang lain.
Apakah kertas penyelidikan yang lazimnya dikreditkan dengan mempopularkan batching peringkat lelaran (berterusan)?
Kertas Orca memperkenalkan penjadualan peringkat lelaran, dan idea itu diterima pakai oleh sistem penyajian seperti vLLM, TGI dan TensorRT-LLM.