Kembali ke Berita
InovasiAI Understanding taklimat

Kajian mendapati seni bina perhatian mendorong kos tenaga inferens LLM

Kajian empirikal baharu melaporkan bahawa seni bina perhatian sangat mempengaruhi cara besar tenaga inferens model bahasa berkembang dengan panjang konteks. Ia mendapati pertumbuhan yang lebih curam untuk perhatian berbilang kepala, pertumbuhan yang lebih rata untuk perhatian pertanyaan berkumpulan, dan tenaga hampir berterusan untuk perhatian pertanyaan berkumpulan digabungkan dengan…

5 min readRead the primary source
Primary-source image accompanying Study finds attention architecture drives the energy cost of LLM inference
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.25096
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Memori (Memori Agen)
Konteks tersimpan yang digunakan ejen AI merentas langkah atau sesi untuk meningkatkan kesinambungan.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Pracetak arXiv mempersembahkan kajian empirikal yang sistematik tentang penggunaan tenaga semasa fasa penyahkodan inferens model bahasa besar. Para penyelidik menilai empat model sumber terbuka menggunakan perhatian berbilang kepala, perhatian pertanyaan terkumpul dan perhatian pertanyaan terkumpul dengan perhatian tetingkap gelongsor merentas panjang konteks, saiz kelompok dan beban kerja penjanaan yang berbeza.

Makalah ini mengkaji penggunaan tenaga semasa fasa nyahkod inferens model bahasa besar, peringkat di mana model menjana token output selepas memproses konteks inputnya. Penulis menerangkan kerja itu sebagai kajian empirikal yang sistematik yang didorong oleh kebimbangan mengenai tenaga dan kesan alam sekitar akibat penggunaan LLM yang semakin meningkat. Mereka membandingkan empat model sumber terbuka wakil yang menggunakan reka bentuk perhatian yang berbeza: perhatian berbilang kepala standard, perhatian pertanyaan berkumpulan dan perhatian pertanyaan berkumpulan digabungkan dengan perhatian tetingkap gelongsor. Perbandingan tertumpu pada cara reka bentuk ini berkelakuan semasa token dijana, dengan konteks dan keadaan beban kerja berubah supaya corak tenaga mereka boleh diperhatikan.

Penyelidik mengubah beberapa keadaan operasi yang mempengaruhi inferens: panjang konteks, saiz kelompok dan beban kerja penjanaan. Mereka mengukur tenaga GPU menggunakan kaunter perkakasan NVIDIA dan secara berasingan memeriksa kesan mekanisme perhatian, saiz model, pertumbuhan cache Nilai Kunci dan kumpulan. Sumber tidak mengenal pasti empat model, kiraan parameternya, konfigurasi perkakasan yang tepat, saiz beban kerja atau protokol pengukuran di luar perihalan peringkat abstrak ini. Pengukuran ini dibentangkan sebagai perbandingan merentas keadaan yang diuji, dan huraian yang tersedia menekankan faktor yang dilaporkan dan bukannya akaun lengkap sistem penyajian di sekeliling.

Makalah itu melaporkan bahawa mekanisme perhatian adalah faktor utama yang mengawal bagaimana tenaga menyahkod berubah apabila panjang konteks meningkat. Dalam perbandingannya, model yang menggunakan perhatian berbilang kepala menunjukkan pertumbuhan tenaga yang jauh lebih curam daripada model yang menggunakan perhatian pertanyaan berkumpulan. Perhatian pertanyaan berkumpulan yang dipasangkan dengan perhatian tetingkap gelongsor mengekalkan penggunaan tenaga yang hampir berterusan dalam eksperimen yang dilaporkan. Penulis juga melaporkan bahawa saiz model terutamanya menentukan penggunaan tenaga mutlak, manakala batching merendahkan kedua-dua tenaga bagi setiap token yang dijana dan kependaman permintaan sebanyak 87 peratus. Oleh itu, keputusan membezakan antara jumlah tenaga yang digunakan dalam istilah mutlak dan cara jumlah itu berubah mengikut panjang konteks.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Kajian itu mencadangkan bahawa reka bentuk mekanisme perhatian model AI boleh mempengaruhi secara material tenaga yang diperlukan untuk menjana token, terutamanya apabila tetingkap konteks berkembang. Hasilnya boleh membantu pembangun model dan pengendali menimbang pilihan seni bina dan penyajian terhadap penggunaan tenaga, kependaman dan skala.

Implikasi utama ialah kecekapan tenaga tidak hanya ditentukan oleh seberapa besar model bahasa. Dua model yang menyajikan konteks yang lebih panjang mungkin mempunyai gelagat penskalaan tenaga yang berbeza kerana mekanisme perhatian mereka berinteraksi secara berbeza dengan cache Nilai-Kekunci yang semakin meningkat. Itu menjadikan seni bina sebagai pertimbangan praktikal untuk organisasi yang mengendalikan perkhidmatan inferens volum tinggi atau mereka bentuk model yang bertujuan untuk mengendalikan input yang panjang. Perbezaan ini penting untuk perancangan kerana tetingkap konteks yang meningkat tidak diterjemahkan ke dalam satu trajektori tenaga tetap merentas seni bina dalam perbandingan.

Hasil yang dilaporkan tentang perhatian pertanyaan berkumpulan dengan perhatian tetingkap gelongsor berpotensi berguna kerana ia menunjukkan cara mengehadkan pertumbuhan tenaga yang dikaitkan dengan konteks yang lebih panjang. Sumber itu tidak mendakwa bahawa gabungan ini lebih unggul secara universal: ia melaporkan corak empirikal dalam empat model sumber terbuka di bawah keadaan yang diuji. Sebarang keputusan penempatan juga perlu mengambil kira ketepatan, pengekalan konteks, kualiti pada dokumen panjang, kekangan pelaksanaan dan kos lain yang tidak diukur dalam sumber yang dibekalkan. Kelayakan tersebut adalah penting apabila mentafsir keputusan sebagai bukti daripada kes yang diuji dan bukannya sebagai pengesyoran bebas daripada tingkah laku model atau keperluan perkhidmatan.

Hasil batching menghubungkan penggunaan tenaga dengan perancangan operasi. Menurut kertas itu, memproses permintaan dalam kelompok mengurangkan tenaga setiap token yang dijana dan kependaman permintaan sehingga 87 peratus. Jika diterbitkan semula dalam tetapan pengeluaran, itu boleh menjadikan penjadualan dan penyatuan beban kerja berkaitan dengan pengurusan kos dan alam sekitar. Sumber itu tidak menyatakan sama ada pengurangan terbesar berlaku di bawah setiap beban kerja, sama ada batching mengubah kualiti output, atau apakah pertukaran responsif yang mungkin timbul untuk pengguna individu. Itu menjadikan peratusan yang dilaporkan berkaitan dengan reka bentuk sistem sambil membiarkan kebolehgunaannya bergantung pada syarat.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Penemuan perlu diuji merentas lebih banyak model, platform perkakasan, beban kerja dan saluran paip inferens penuh. Kertas kerja mengukur tenaga GPU semasa penyahkodan, jadi hasilnya tidak dengan sendirinya membentuk jumlah tenaga sistem, kesan alam sekitar yang lebih luas atau prestasi merentas setiap seni bina model.

Soalan pertama ialah kebolehulangan. Sumber itu mengenal pasti kertas itu sebagai pracetak arXiv yang diserahkan pada 25 Ogos 2026 dan membekalkan status abstrak tetapi tiada semakan rakan sebaya. Pemeriksaan susulan harus meneliti senarai model penuh, saiz parameter, panjang konteks, konfigurasi kelompok, panjang penjanaan, penentukuran pembilang tenaga dan variasi statistik merentas larian. Butiran tersebut akan membantu menentukan sejauh mana perbandingan yang dilaporkan boleh diterbitkan semula dan berapa banyak ketidakpastian yang menyelubungi perbezaan yang diperhatikan.

Skop pengukuran perkakasan juga penting. Kajian ini mengukur tenaga GPU dengan kaunter perkakasan NVIDIA, tetapi abstrak tidak melaporkan tenaga daripada CPU, memori, rangkaian, penyejukan, storan atau infrastruktur lain. Oleh itu, ia menyokong kesimpulan tentang tenaga penyahkod GPU yang diukur, bukan perakaunan lengkap tenaga atau pelepasan yang berkaitan dengan pengendalian perkhidmatan AI. Kaunter GPU menyediakan sempadan pengukuran yang dinyatakan oleh kajian, jadi kesimpulan harus kekal terikat pada sempadan itu sehingga komponen lain diukur.

Kerja selanjutnya harus menguji sama ada corak penskalaan yang dilaporkan berlaku pada model yang lebih baharu dan direka bentuk berbeza, vendor pemecut tambahan, konteks yang lebih panjang dan beban kerja interaktif. Ia juga harus membandingkan tenaga dengan kualiti model dan daya pemprosesan. Mekanisme yang menggunakan kurang tenaga di bawah satu konfigurasi mungkin mengenakan pertukaran keupayaan atau kependaman di tempat lain, dan sumber yang dibekalkan tidak mengukur pertukaran tersebut. Perbandingan sedemikian akan menjelaskan sama ada tenaga yang diukur lebih rendah disertai dengan perubahan dalam hasil lain yang penting bagi pengendali.

Pengurangan maksimum 87 peratus yang dilaporkan memerlukan tafsiran yang teliti. Abstrak mengaitkannya kepada kumpulan dan mengatakan ia digunakan untuk kedua-dua tenaga bagi setiap token yang dijana dan kependaman permintaan, tetapi ia tidak menyatakan garis dasar, beban kerja atau sama ada peratusan yang sama digunakan untuk kedua-dua ukuran. Pembaca harus menganggapnya sebagai hasil laporan atas kajian dan bukannya jangkaan umum untuk semua penggunaan LLM. Tanpa butiran tersebut, peratusan tidak boleh dipindahkan terus daripada pracetak kepada penggunaan sewenang-wenangnya.

Panduan & kuiz berkaitan

Model AI DiterangkanTransformerLatihan AIMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?