Kembali ke Berita
InovasiAI Understanding taklimat

Kajian mendapati model bahasa resapan bertopeng memerlukan strategi penyajian yang berbeza

Kajian arXiv baharu menggunakan GPU NVIDIA H200 mendapati bahawa model bahasa resapan bertopeng menghabiskan kebanyakan masa permintaan tunggal dalam penghantaran CPU, dan batching yang disegerakkan boleh meningkatkan daya pemprosesan dengan ketara.

5 min readRead the primary source
Source-page capture accompanying Study finds masked-diffusion language models need different serving strategies
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.23807
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

LoRA (Penyesuaian Peringkat Rendah)
Kaedah penalaan halus yang cekap parameter yang menambah matriks penyesuai peringkat rendah.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Model Penyebaran
Seni bina generatif yang belajar membalikkan hingar untuk mensintesis imej, audio atau kandungan lain.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Penyelidik mencirikan cara model bahasa resapan bertopeng berkelakuan di bawah beban penyajian serentak pada perkakasan sebenar, mendapati keperluan kependaman dan pengumpulannya berbeza daripada model bahasa autoregresif konvensional.

Kertas kerja itu, yang diserahkan kepada arXiv pada 24 Ogos, meneliti model bahasa resapan bertopeng atau dLLM. Tidak seperti sistem autoregresif yang menjana teks secara berurutan, dLLM boleh menafikan berbilang token sekaligus. Penulis berpendapat bahawa perbezaan ini menjadikan ia berisiko untuk mereka bentuk sistem penyajian dLLM dengan hanya membawa lebih andaian daripada penyajian model autoregresif. Sumbangan utama mereka adalah pencirian empirikal di bawah beban serentak dan bukannya perbincangan teori semata-mata. Oleh itu, kertas itu membingkaikan soalan penyajian di sekitar akibat operasi mekanisme penjanaan itu. Perbandingannya adalah mengenai gelagat sistem di bawah beban, dengan model menghasilkan berbilang token melalui denoising berulang dan bukannya mengikut laluan berjujukan tunggal.

Para penyelidik menggunakan LLaDA-8B-Instruct dengan penyesuai LoRA Memaksa Resapan Diskret pada satu GPU NVIDIA H200. Mereka menilai persediaan pada GSM8K dan HumanEval. Makalah melaporkan bahawa kesukaran meminta adalah diskret: permintaan jatuh ke dalam 11 tahap denoising-step tetap. Pengarang menguji sama ada sebarang isyarat boleh meramalkan tahap permintaan sebelum penjanaan bermula, tetapi nilai R2 terbaik yang dilaporkan ialah 0.150, menunjukkan prestasi ramalan yang lemah dalam percubaan mereka. Pilihan ini menentukan skop pengukuran. Pemerhatian yang dilaporkan menerangkan gabungan model, penyesuai, GPU dan penanda aras yang diuji, dan ujian ramalan dibentangkan sebagai sebahagian daripada pencirian yang sama.

Kajian itu juga melaporkan bahawa belanjawan generasi pendek boleh menyembunyikan kebolehubahan penyajian. Menurut kertas itu, belanjawan di bawah 320 token mungkin memotong permintaan sebelum penyebaran dalam kependaman dapat dilihat. Pada skala permintaan tunggal, hanya 24% masa jam dinding adalah pengiraan GPU, manakala selebihnya adalah overhed penghantaran sebelah CPU. Apabila permintaan dikumpulkan supaya satu hantaran ke hadapan dikongsi setiap langkah denoising, daya pemprosesan adalah 16.0 kali lebih tinggi pada saiz kelompok 16 berbanding dengan garis dasar setiap permintaan-penghantaran. Makalah selanjutnya memperoleh peraturan tamat masa kelompok untuk batch segerak isi tetap di bawah ketibaan Poisson. Bersama-sama, ukuran ini menghubungkan tingkah laku peringkat permintaan dengan penjadualan peringkat sistem. Mereka menerangkan kedua-dua masa dibelanjakan dan cara perkongsian berfungsi merentas permintaan mengubah hasil yang dilaporkan, sambil memastikan analisis tamat masa kelompok terikat dengan model ketibaan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Penemuan ini boleh membantu jurutera mereka bentuk infrastruktur yang lebih cekap untuk model bahasa berasaskan resapan, sambil juga menunjukkan bahawa penanda aras pendek dan andaian yang diwarisi daripada servis autoregresif boleh menyembunyikan kos operasi yang penting.

Kepentingan praktikal ialah sajian dLLM mungkin memerlukan keselarian pada tahap yang berbeza daripada sajian autoregresif. Dalam akaun kertas kerja, unit utama untuk berkongsi kerja ialah setiap langkah menolak, bukan sekadar permintaan keseluruhan. Itu mengubah cara sistem penyajian harus memikirkan tentang kemasukan, kelompok dan pengusiran apabila beberapa permintaan sedang berjalan melalui pengiraan dikongsi. Hasilnya ialah pelajaran sistem tentang memadankan infrastruktur dengan proses penjanaan model. Perbezaan itu mempengaruhi cara komponen hidangan dinilai. Kemasukan, kumpulan dan pengusiran bukan hanya butiran pelaksanaan dalam pembingkaian ini; mereka adalah sebahagian daripada menyesuaikan sistem kepada proses denoising model.

Penemuan CPU-overhed amat relevan dengan ekonomi penggunaan dan kejuruteraan prestasi. Jika hanya minoriti masa jam dinding permintaan tunggal dibelanjakan untuk pengiraan GPU dalam konfigurasi yang diuji ini, menambah lebih banyak kapasiti pemecut mungkin tidak menangani kesesakan yang dominan dengan sendirinya. Hasil kumpulan yang dilaporkan menunjukkan bahawa permintaan penyelarasan boleh melunaskan kos penghantaran, walaupun keputusan kertas itu terikat pada model, penyesuai, perkakasan, beban kerja dan garis dasar tertentu. Implikasinya ialah keperluan untuk memeriksa laluan penuh dari ketibaan permintaan kepada kerja pemecut. Pengukuran kertas membuat laluan itu kelihatan dalam persediaan yang diuji, dan hasil kelompok menggambarkan sebab lokasi overhed penting apabila prestasi dinilai.

Kertas kerja ini juga mencabar bagaimana dLLM boleh ditanda aras. Belanjawan penjanaan yang pendek boleh menjadikan kependaman kelihatan lebih konsisten daripada yang sepatutnya kerana permintaan tamat sebelum variasi penuh dalam langkah penolakan muncul. Itu penting bagi sesiapa sahaja yang membandingkan sistem penyajian atau menganggarkan masa respons yang boleh dilihat oleh pengguna. Penulis berhujah secara berstruktur bahawa kualiti keluaran tidak seharusnya merosot apabila saiz kelompok meningkat di bawah tiga andaian yang dinyatakan, tetapi laporan sumber mengukur ketepatan GSM8K hanya pada skala permintaan tunggal, di mana ia adalah 74% hingga 76%. Ini tidak mewujudkan kualiti yang tidak berubah di bawah setiap keadaan batching. Inilah sebabnya mengapa kertas itu memisahkan penaakulan struktur daripada bukti yang diukur. Andaian menyokong hujah yang dinyatakan oleh pengarang, manakala pengukuran ketepatan yang dilaporkan kekal terhad kepada keputusan permintaan tunggal yang dinyatakan dan tidak menjawab soalan kumpulan yang lebih luas.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Kajian ini adalah pencirian awal berdasarkan satu konfigurasi model, satu GPU dan dua penanda aras. Ujian bebas merentas model, perkakasan, beban kerja dan tetapan pengeluaran akan diperlukan untuk menentukan sejauh mana hasil boleh digunakan.

Yang paling tidak diketahui ialah kebolehgeneralisasian. Percubaan menggunakan satu konfigurasi model resapan bertopeng, LLaDA-8B-Instruct dengan penyesuai D2F LoRA dan satu GPU NVIDIA H200. Sumber tidak menentukan sama ada 11 tahap kiraan langkah yang sama, kebolehramalan pra-generasi yang lemah, baki pemasaan CPU-ke-GPU, atau keuntungan kelompok 16.0x akan muncul dengan dLLM lain, penyesuai, pemecut, tindanan perisian atau campuran permintaan. Sempadan tersebut penting apabila mentafsir keputusan. Penemuan adalah bukti tentang persediaan yang diuji, bukan peta lengkap gelagat penyajian resapan bertopeng merentas semua konfigurasi yang mungkin.

Kerja selanjutnya harus menguji trafik seperti pengeluaran dan output yang lebih panjang atau lebih pelbagai. Kertas itu secara khusus memberi amaran bahawa belanjawan di bawah 320 token boleh menyembunyikan sebaran kependaman, jadi penilaian harus merangkumi beban kerja yang cukup lama untuk mendedahkan tingkah laku penolakan sepenuhnya. Ia juga akan menjadi penting untuk mengukur kependaman ekor, daya pemprosesan, penggunaan memori dan kualiti secara bersama daripada menganggap satu angka pemprosesan sebagai bukti yang mencukupi untuk kelebihan penggunaan. Pengukuran sedemikian akan memudahkan untuk membezakan peningkatan dalam daya pemprosesan purata daripada peningkatan yang kekal berguna di bawah trafik sebenar. Mereka juga akan menunjukkan sama ada tingkah laku penjadualan yang diperhatikan berterusan apabila beban kerja dan panjang output berubah.

Tuntutan kualiti kekal bersyarat. Pengarang menyatakan bahawa kualiti tidak seharusnya merosot dengan saiz kelompok di bawah tiga andaian, tetapi sumber tidak mengenal pasti set luas hasil ketepatan saiz kelompok, dan ia juga tidak melaporkan ketersediaan pengeluaran atau penggunaan yang dihadapi pengguna. Replikasi bebas merentas GSM8K, HumanEval dan tugasan lain akan membantu menentukan sama ada batching disegerakkan ialah prinsip reka bentuk yang berguna secara meluas atau terutamanya pengoptimuman untuk persediaan percubaan ini. Sehingga ujian tersebut tersedia, bacaan yang paling boleh dipertahankan adalah bersyarat: batching disegerakkan ialah prinsip reka bentuk yang menjanjikan dalam persediaan yang dilaporkan, manakala nilai penggunaannya yang lebih luas masih perlu diwujudkan.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerLatihan AIChatGPT & LLMUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?