Apa yang berlaku
Pracetak arXiv mempersembahkan kajian empirikal yang sistematik tentang penggunaan tenaga semasa fasa penyahkodan inferens model bahasa besar. Para penyelidik menilai empat model sumber terbuka menggunakan perhatian berbilang kepala, perhatian pertanyaan terkumpul dan perhatian pertanyaan terkumpul dengan perhatian tetingkap gelongsor merentas panjang konteks, saiz kelompok dan beban kerja penjanaan yang berbeza.
Makalah ini mengkaji penggunaan tenaga semasa fasa nyahkod inferens model bahasa besar, peringkat di mana model menjana token output selepas memproses konteks inputnya. Penulis menerangkan kerja itu sebagai kajian empirikal yang sistematik yang didorong oleh kebimbangan mengenai tenaga dan kesan alam sekitar akibat penggunaan LLM yang semakin meningkat. Mereka membandingkan empat model sumber terbuka wakil yang menggunakan reka bentuk perhatian yang berbeza: perhatian berbilang kepala standard, perhatian pertanyaan berkumpulan dan perhatian pertanyaan berkumpulan digabungkan dengan perhatian tetingkap gelongsor. Perbandingan tertumpu pada cara reka bentuk ini berkelakuan semasa token dijana, dengan konteks dan keadaan beban kerja berubah supaya corak tenaga mereka boleh diperhatikan.
Penyelidik mengubah beberapa keadaan operasi yang mempengaruhi inferens: panjang konteks, saiz kelompok dan beban kerja penjanaan. Mereka mengukur tenaga GPU menggunakan kaunter perkakasan NVIDIA dan secara berasingan memeriksa kesan mekanisme perhatian, saiz model, pertumbuhan cache Nilai Kunci dan kumpulan. Sumber tidak mengenal pasti empat model, kiraan parameternya, konfigurasi perkakasan yang tepat, saiz beban kerja atau protokol pengukuran di luar perihalan peringkat abstrak ini. Pengukuran ini dibentangkan sebagai perbandingan merentas keadaan yang diuji, dan huraian yang tersedia menekankan faktor yang dilaporkan dan bukannya akaun lengkap sistem penyajian di sekeliling.
Makalah itu melaporkan bahawa mekanisme perhatian adalah faktor utama yang mengawal bagaimana tenaga menyahkod berubah apabila panjang konteks meningkat. Dalam perbandingannya, model yang menggunakan perhatian berbilang kepala menunjukkan pertumbuhan tenaga yang jauh lebih curam daripada model yang menggunakan perhatian pertanyaan berkumpulan. Perhatian pertanyaan berkumpulan yang dipasangkan dengan perhatian tetingkap gelongsor mengekalkan penggunaan tenaga yang hampir berterusan dalam eksperimen yang dilaporkan. Penulis juga melaporkan bahawa saiz model terutamanya menentukan penggunaan tenaga mutlak, manakala batching merendahkan kedua-dua tenaga bagi setiap token yang dijana dan kependaman permintaan sebanyak 87 peratus. Oleh itu, keputusan membezakan antara jumlah tenaga yang digunakan dalam istilah mutlak dan cara jumlah itu berubah mengikut panjang konteks.
Mengapa ia penting
Kajian itu mencadangkan bahawa reka bentuk mekanisme perhatian model AI boleh mempengaruhi secara material tenaga yang diperlukan untuk menjana token, terutamanya apabila tetingkap konteks berkembang. Hasilnya boleh membantu pembangun model dan pengendali menimbang pilihan seni bina dan penyajian terhadap penggunaan tenaga, kependaman dan skala.
Implikasi utama ialah kecekapan tenaga tidak hanya ditentukan oleh seberapa besar model bahasa. Dua model yang menyajikan konteks yang lebih panjang mungkin mempunyai gelagat penskalaan tenaga yang berbeza kerana mekanisme perhatian mereka berinteraksi secara berbeza dengan cache Nilai-Kekunci yang semakin meningkat. Itu menjadikan seni bina sebagai pertimbangan praktikal untuk organisasi yang mengendalikan perkhidmatan inferens volum tinggi atau mereka bentuk model yang bertujuan untuk mengendalikan input yang panjang. Perbezaan ini penting untuk perancangan kerana tetingkap konteks yang meningkat tidak diterjemahkan ke dalam satu trajektori tenaga tetap merentas seni bina dalam perbandingan.
Hasil yang dilaporkan tentang perhatian pertanyaan berkumpulan dengan perhatian tetingkap gelongsor berpotensi berguna kerana ia menunjukkan cara mengehadkan pertumbuhan tenaga yang dikaitkan dengan konteks yang lebih panjang. Sumber itu tidak mendakwa bahawa gabungan ini lebih unggul secara universal: ia melaporkan corak empirikal dalam empat model sumber terbuka di bawah keadaan yang diuji. Sebarang keputusan penempatan juga perlu mengambil kira ketepatan, pengekalan konteks, kualiti pada dokumen panjang, kekangan pelaksanaan dan kos lain yang tidak diukur dalam sumber yang dibekalkan. Kelayakan tersebut adalah penting apabila mentafsir keputusan sebagai bukti daripada kes yang diuji dan bukannya sebagai pengesyoran bebas daripada tingkah laku model atau keperluan perkhidmatan.
Hasil batching menghubungkan penggunaan tenaga dengan perancangan operasi. Menurut kertas itu, memproses permintaan dalam kelompok mengurangkan tenaga setiap token yang dijana dan kependaman permintaan sehingga 87 peratus. Jika diterbitkan semula dalam tetapan pengeluaran, itu boleh menjadikan penjadualan dan penyatuan beban kerja berkaitan dengan pengurusan kos dan alam sekitar. Sumber itu tidak menyatakan sama ada pengurangan terbesar berlaku di bawah setiap beban kerja, sama ada batching mengubah kualiti output, atau apakah pertukaran responsif yang mungkin timbul untuk pengguna individu. Itu menjadikan peratusan yang dilaporkan berkaitan dengan reka bentuk sistem sambil membiarkan kebolehgunaannya bergantung pada syarat.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Penemuan perlu diuji merentas lebih banyak model, platform perkakasan, beban kerja dan saluran paip inferens penuh. Kertas kerja mengukur tenaga GPU semasa penyahkodan, jadi hasilnya tidak dengan sendirinya membentuk jumlah tenaga sistem, kesan alam sekitar yang lebih luas atau prestasi merentas setiap seni bina model.
Soalan pertama ialah kebolehulangan. Sumber itu mengenal pasti kertas itu sebagai pracetak arXiv yang diserahkan pada 25 Ogos 2026 dan membekalkan status abstrak tetapi tiada semakan rakan sebaya. Pemeriksaan susulan harus meneliti senarai model penuh, saiz parameter, panjang konteks, konfigurasi kelompok, panjang penjanaan, penentukuran pembilang tenaga dan variasi statistik merentas larian. Butiran tersebut akan membantu menentukan sejauh mana perbandingan yang dilaporkan boleh diterbitkan semula dan berapa banyak ketidakpastian yang menyelubungi perbezaan yang diperhatikan.
Skop pengukuran perkakasan juga penting. Kajian ini mengukur tenaga GPU dengan kaunter perkakasan NVIDIA, tetapi abstrak tidak melaporkan tenaga daripada CPU, memori, rangkaian, penyejukan, storan atau infrastruktur lain. Oleh itu, ia menyokong kesimpulan tentang tenaga penyahkod GPU yang diukur, bukan perakaunan lengkap tenaga atau pelepasan yang berkaitan dengan pengendalian perkhidmatan AI. Kaunter GPU menyediakan sempadan pengukuran yang dinyatakan oleh kajian, jadi kesimpulan harus kekal terikat pada sempadan itu sehingga komponen lain diukur.
Kerja selanjutnya harus menguji sama ada corak penskalaan yang dilaporkan berlaku pada model yang lebih baharu dan direka bentuk berbeza, vendor pemecut tambahan, konteks yang lebih panjang dan beban kerja interaktif. Ia juga harus membandingkan tenaga dengan kualiti model dan daya pemprosesan. Mekanisme yang menggunakan kurang tenaga di bawah satu konfigurasi mungkin mengenakan pertukaran keupayaan atau kependaman di tempat lain, dan sumber yang dibekalkan tidak mengukur pertukaran tersebut. Perbandingan sedemikian akan menjelaskan sama ada tenaga yang diukur lebih rendah disertai dengan perubahan dalam hasil lain yang penting bagi pengendali.
Pengurangan maksimum 87 peratus yang dilaporkan memerlukan tafsiran yang teliti. Abstrak mengaitkannya kepada kumpulan dan mengatakan ia digunakan untuk kedua-dua tenaga bagi setiap token yang dijana dan kependaman permintaan, tetapi ia tidak menyatakan garis dasar, beban kerja atau sama ada peratusan yang sama digunakan untuk kedua-dua ukuran. Pembaca harus menganggapnya sebagai hasil laporan atas kajian dan bukannya jangkaan umum untuk semua penggunaan LLM. Tanpa butiran tersebut, peratusan tidak boleh dipindahkan terus daripada pracetak kepada penggunaan sewenang-wenangnya.