Perhatian Berbilang Pertanyaan
Perhatian Berbilang Pertanyaan (MQA) ialah sentuhan penjimatan memori pada perhatian pengubah yang berkongsi satu set kunci dan nilai merentasi semua kepala perhatian.
Gambaran keseluruhan
It dramatically speeds up text generation by shrinking the memory the model must shuffle around.
Menyelam dalam
Perhatian berbilang kepala standard memberikan setiap kepala pertanyaan, kunci dan unjuran nilainya sendiri. Semasa penjanaan, kunci dan nilai untuk semua token lalu mesti dicache dan dimuat semula pada setiap langkah — cache KV ini menjadi kesesakan utama, kerana membacanya dari ingatan adalah lebih perlahan daripada matematik itu sendiri. Perhatian Berbilang Pertanyaan, yang dicadangkan oleh Noam Shazeer pada 2019, menyimpan unjuran pertanyaan yang berasingan bagi setiap kepala tetapi meruntuhkan kunci dan nilai kepada satu kepala dikongsi. Ini mengecilkan cache KV dengan faktor yang sama dengan bilangan kepala, kadangkala 8x hingga 64x lebih kecil. Hasilnya ialah penyahkodan autoregresif yang lebih pantas dan jejak memori yang lebih ringan, dengan hanya penurunan kualiti yang sederhana. Jalan tengah, Perhatian Pertanyaan Berkumpulan, mengimbangi pertukaran.
Wawasan Teknikal
Dalam MQA, pemberat pertanyaan masih menghasilkan vektor pertanyaan berasingan H, tetapi unjuran kunci tunggal dan unjuran nilai tunggal dikongsi merentas semua kepala. Setiap kepala mengira perhatian menggunakan pertanyaannya sendiri terhadap kunci dan nilai yang sama. Oleh kerana tensor K dan V yang dicache tidak lagi berskala dengan bilangan kepala, lebar jalur memori semasa penyahkodan menurun dengan mendadak — dan lebar jalur, bukan pengiraan, adalah yang mengawal kelajuan penjanaan pada pemecut moden.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Perhatian Pelbagai Pertanyaan
MQA menetapkan bahawa anda boleh memangkas kepala kunci/nilai berlebihan dengan sedikit bahaya, dan cerapan itu kini membentuk hampir setiap LLM inferens pantas. Medan ini sebahagian besarnya telah tertumpu pada Perhatian Pertanyaan Berkumpulan (GQA), digunakan dalam Llama 2/3 dan banyak lagi, yang menggunakan beberapa kumpulan KV dan bukannya satu untuk memulihkan kualiti sambil mengekalkan kebanyakan kelajuan. Kerja masa depan menggabungkan idea ini dengan pemampatan cache KV, pengkuantitian dan perhatian berbilang pendam untuk mendorong konteks yang lebih panjang dan penyajian yang lebih murah.
Pelaksanaan Dunia Sebenar
Mempercepatkan penjanaan token demi token dalam pembantu sembang di mana cache KV, bukan pengiraan mentah, mengehadkan pemprosesan.
PaLM Google, yang menggunakan Perhatian Berbilang Pertanyaan untuk mendayakan inferens berskala besar yang cekap.
Melayan ramai pengguna serentak pada satu GPU dengan mengecilkan memori cache KV setiap permintaan.
Perhatian Pertanyaan Berkumpulan dalam Llama 2 70B dan Llama 3, keturunan langsung yang mengimbangi kelajuan MQA dengan kualiti perhatian penuh.
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Perhatian Pertanyaan Berkumpulan
Soalan lazim
What is Multi-Query Attention?
Perhatian Berbilang Pertanyaan (MQA) ialah sentuhan penjimatan memori pada perhatian pengubah yang berkongsi satu set kunci dan nilai merentasi semua kepala perhatian. Ia mempercepatkan penjanaan teks secara mendadak dengan mengecilkan memori yang mesti dikocok oleh model.
Apakah yang dikongsikan Perhatian Berbilang Pertanyaan di semua ketua perhatian?
MQA menyimpan pertanyaan berasingan bagi setiap kepala tetapi berkongsi satu unjuran utama dan satu unjuran nilai merentas semua kepala.
Apakah kesesakan utama yang ditangani MQA semasa penjanaan autoregresif?
Memuat semula cache KV yang besar setiap langkah adalah terikat lebar jalur; MQA mengecilkan cache itu untuk mempercepatkan penyahkodan.
Dengan kira-kira faktor apakah MQA mengecilkan cache KV?
Memandangkan kunci dan nilai runtuh daripada H kepala kepada satu, cache mengecut kira-kira kiraan kepala.
Apakah pertukaran utama penggunaan MQA?
Berkongsi kunci dan nilai mengurangkan sedikit kapasiti perwakilan, menyebabkan penurunan kualiti kecil sebagai pertukaran untuk keuntungan kelajuan besar.
Varian yang manakah terletak di antara perhatian berbilang kepala standard dan MQA?
Perhatian Pertanyaan Berkumpulan (GQA) menggunakan beberapa kumpulan KV dan bukannya satu, mengimbangi kualiti dan kelajuan.