Perhatian Multi-Kueri
Multi-Query Attention (MQA) adalah perubahan hemat memori pada perhatian transformator yang berbagi satu set kunci dan nilai di semua kepala perhatian.
Ikhtisar
It dramatically speeds up text generation by shrinking the memory the model must shuffle around.
Menyelam Lebih Dalam
Perhatian multi-kepala standar memberikan proyeksi kueri, kunci, dan nilai kepada setiap kepala. Selama pembuatan, kunci dan nilai untuk semua token sebelumnya harus di-cache dan dimuat ulang di setiap langkah — cache KV ini menjadi penghambat utama, karena membacanya dari memori lebih lambat dibandingkan perhitungan matematika itu sendiri. Perhatian Multi-Kueri, yang diusulkan oleh Noam Shazeer pada tahun 2019, menyimpan proyeksi kueri terpisah per kepala tetapi menciutkan kunci dan nilai ke satu kepala bersama. Hal ini mengecilkan cache KV dengan faktor yang sama dengan jumlah head, terkadang 8x hingga 64x lebih kecil. Hasilnya adalah decoding autoregresif yang jauh lebih cepat dan jejak memori yang lebih ringan, dengan sedikit penurunan kualitas. Jalan tengah, Perhatian Kueri yang Dikelompokkan, menyeimbangkan trade-off.
Wawasan Teknis
Dalam MQA, bobot kueri masih menghasilkan H vektor kueri terpisah, namun proyeksi kunci tunggal dan proyeksi nilai tunggal dibagikan ke semua kepala. Setiap kepala menghitung perhatian menggunakan kuerinya sendiri terhadap kunci dan nilai yang sama. Karena tensor K dan V yang di-cache tidak lagi disesuaikan dengan jumlah head, bandwidth memori selama decoding turun tajam — dan bandwidth, bukan komputasi, yang menentukan kecepatan pembangkitan pada akselerator modern.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Perhatian Multi-Kueri
MQA menetapkan bahwa Anda dapat memangkas kepala kunci/nilai yang berlebihan dengan sedikit kerugian, dan wawasan tersebut kini membentuk hampir setiap LLM inferensi cepat. Bidang ini sebagian besar telah menyatu pada Grouped-Query Attention (GQA), yang digunakan di Llama 2/3 dan banyak lainnya, yang menggunakan beberapa grup KV, bukan satu, untuk memulihkan kualitas sekaligus mempertahankan sebagian besar percepatan. Pekerjaan di masa depan memadukan ide-ide ini dengan kompresi cache KV, kuantisasi, dan perhatian multi-laten untuk mendorong konteks yang lebih panjang dan penyajian yang lebih murah.
Implementasi Dunia Nyata
Mempercepat pembuatan token demi token di asisten obrolan di mana cache KV, bukan komputasi mentah, membatasi throughput.
PaLM Google, yang menggunakan Multi-Query Attention untuk memungkinkan inferensi skala besar yang efisien.
Melayani banyak pengguna secara bersamaan pada satu GPU dengan mengecilkan memori cache KV per permintaan.
Perhatian Kueri yang Dikelompokkan di Llama 2 70B dan Llama 3, turunan langsung yang menyeimbangkan kecepatan MQA dengan kualitas perhatian penuh.
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Perhatian Kueri yang Dikelompokkan
Pertanyaan yang sering diajukan
What is Multi-Query Attention?
Multi-Query Attention (MQA) adalah perubahan hemat memori pada perhatian transformator yang berbagi satu set kunci dan nilai di semua kepala perhatian. Ini secara dramatis mempercepat pembuatan teks dengan memperkecil memori yang harus diacak oleh model.
Apa yang dibagikan oleh Perhatian Multi-Kueri di semua kepala perhatian?
MQA menyimpan kueri terpisah per kepala tetapi membagikan satu proyeksi kunci dan satu proyeksi nilai di semua kepala.
Apa hambatan utama yang diatasi MQA selama pembuatan autoregresif?
Memuat ulang cache KV yang besar, setiap langkah terikat bandwidth; MQA mengecilkan cache tersebut untuk mempercepat decoding.
Kira-kira dengan faktor apa MQA mengecilkan cache KV?
Karena kunci dan nilai diciutkan dari H head menjadi satu, cache menyusut kira-kira sebanyak jumlah head.
Apa keuntungan utama menggunakan MQA?
Berbagi kunci dan nilai sedikit mengurangi kapasitas representasi, menyebabkan sedikit penurunan kualitas sebagai imbalan atas peningkatan kecepatan yang besar.
Varian manakah yang berada di antara perhatian multi-head standar dan MQA?
Grouped-Query Attention (GQA) menggunakan beberapa grup KV, bukan satu, sehingga menyeimbangkan kualitas dan kecepatan.