PANDUAN AI Bahasa

Perhatian Berbilang Pertanyaan

Perhatian Berbilang Pertanyaan (MQA) ialah sentuhan penjimatan memori pada perhatian pengubah yang berkongsi satu set kunci dan nilai merentasi semua kepala perhatian.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Menyelam dalam

Perhatian berbilang kepala standard memberikan setiap kepala pertanyaan, kunci dan unjuran nilainya sendiri. Semasa penjanaan, kunci dan nilai untuk semua token lalu mesti dicache dan dimuat semula pada setiap langkah — cache KV ini menjadi kesesakan utama, kerana membacanya dari ingatan adalah lebih perlahan daripada matematik itu sendiri. Perhatian Berbilang Pertanyaan, yang dicadangkan oleh Noam Shazeer pada 2019, menyimpan unjuran pertanyaan yang berasingan bagi setiap kepala tetapi meruntuhkan kunci dan nilai kepada satu kepala dikongsi. Ini mengecilkan cache KV dengan faktor yang sama dengan bilangan kepala, kadangkala 8x hingga 64x lebih kecil. Hasilnya ialah penyahkodan autoregresif yang lebih pantas dan jejak memori yang lebih ringan, dengan hanya penurunan kualiti yang sederhana. Jalan tengah, Perhatian Pertanyaan Berkumpulan, mengimbangi pertukaran.

Wawasan Teknikal

Dalam MQA, pemberat pertanyaan masih menghasilkan vektor pertanyaan berasingan H, tetapi unjuran kunci tunggal dan unjuran nilai tunggal dikongsi merentas semua kepala. Setiap kepala mengira perhatian menggunakan pertanyaannya sendiri terhadap kunci dan nilai yang sama. Oleh kerana tensor K dan V yang dicache tidak lagi berskala dengan bilangan kepala, lebar jalur memori semasa penyahkodan menurun dengan mendadak — dan lebar jalur, bukan pengiraan, adalah yang mengawal kelajuan penjanaan pada pemecut moden.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Perhatian Pelbagai Pertanyaan

MQA menetapkan bahawa anda boleh memangkas kepala kunci/nilai berlebihan dengan sedikit bahaya, dan cerapan itu kini membentuk hampir setiap LLM inferens pantas. Medan ini sebahagian besarnya telah tertumpu pada Perhatian Pertanyaan Berkumpulan (GQA), digunakan dalam Llama 2/3 dan banyak lagi, yang menggunakan beberapa kumpulan KV dan bukannya satu untuk memulihkan kualiti sambil mengekalkan kebanyakan kelajuan. Kerja masa depan menggabungkan idea ini dengan pemampatan cache KV, pengkuantitian dan perhatian berbilang pendam untuk mendorong konteks yang lebih panjang dan penyajian yang lebih murah.

Pelaksanaan Dunia Sebenar

Mempercepatkan penjanaan token demi token dalam pembantu sembang di mana cache KV, bukan pengiraan mentah, mengehadkan pemprosesan.

PaLM Google, yang menggunakan Perhatian Berbilang Pertanyaan untuk mendayakan inferens berskala besar yang cekap.

Melayan ramai pengguna serentak pada satu GPU dengan mengecilkan memori cache KV setiap permintaan.

Perhatian Pertanyaan Berkumpulan dalam Llama 2 70B dan Llama 3, keturunan langsung yang mengimbangi kelajuan MQA dengan kualiti perhatian penuh.

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Perhatian Pertanyaan Berkumpulan

Soalan lazim

What is Multi-Query Attention?

Perhatian Berbilang Pertanyaan (MQA) ialah sentuhan penjimatan memori pada perhatian pengubah yang berkongsi satu set kunci dan nilai merentasi semua kepala perhatian. Ia mempercepatkan penjanaan teks secara mendadak dengan mengecilkan memori yang mesti dikocok oleh model.

Apakah yang dikongsikan Perhatian Berbilang Pertanyaan di semua ketua perhatian?

MQA menyimpan pertanyaan berasingan bagi setiap kepala tetapi berkongsi satu unjuran utama dan satu unjuran nilai merentas semua kepala.

Apakah kesesakan utama yang ditangani MQA semasa penjanaan autoregresif?

Memuat semula cache KV yang besar setiap langkah adalah terikat lebar jalur; MQA mengecilkan cache itu untuk mempercepatkan penyahkodan.

Dengan kira-kira faktor apakah MQA mengecilkan cache KV?

Memandangkan kunci dan nilai runtuh daripada H kepala kepada satu, cache mengecut kira-kira kiraan kepala.

Apakah pertukaran utama penggunaan MQA?

Berkongsi kunci dan nilai mengurangkan sedikit kapasiti perwakilan, menyebabkan penurunan kualiti kecil sebagai pertukaran untuk keuntungan kelajuan besar.

Varian yang manakah terletak di antara perhatian berbilang kepala standard dan MQA?

Perhatian Pertanyaan Berkumpulan (GQA) menggunakan beberapa kumpulan KV dan bukannya satu, mengimbangi kualiti dan kelajuan.