PANDUAN AI Bahasa

Perhatian Multi-Kueri

Multi-Query Attention (MQA) adalah perubahan hemat memori pada perhatian transformator yang berbagi satu set kunci dan nilai di semua kepala perhatian.

2 min readTerakhir diperbarui

Ikhtisar

It dramatically speeds up text generation by shrinking the memory the model must shuffle around.

Menyelam Lebih Dalam

Perhatian multi-kepala standar memberikan proyeksi kueri, kunci, dan nilai kepada setiap kepala. Selama pembuatan, kunci dan nilai untuk semua token sebelumnya harus di-cache dan dimuat ulang di setiap langkah — cache KV ini menjadi penghambat utama, karena membacanya dari memori lebih lambat dibandingkan perhitungan matematika itu sendiri. Perhatian Multi-Kueri, yang diusulkan oleh Noam Shazeer pada tahun 2019, menyimpan proyeksi kueri terpisah per kepala tetapi menciutkan kunci dan nilai ke satu kepala bersama. Hal ini mengecilkan cache KV dengan faktor yang sama dengan jumlah head, terkadang 8x hingga 64x lebih kecil. Hasilnya adalah decoding autoregresif yang jauh lebih cepat dan jejak memori yang lebih ringan, dengan sedikit penurunan kualitas. Jalan tengah, Perhatian Kueri yang Dikelompokkan, menyeimbangkan trade-off.

Wawasan Teknis

Dalam MQA, bobot kueri masih menghasilkan H vektor kueri terpisah, namun proyeksi kunci tunggal dan proyeksi nilai tunggal dibagikan ke semua kepala. Setiap kepala menghitung perhatian menggunakan kuerinya sendiri terhadap kunci dan nilai yang sama. Karena tensor K dan V yang di-cache tidak lagi disesuaikan dengan jumlah head, bandwidth memori selama decoding turun tajam — dan bandwidth, bukan komputasi, yang menentukan kecepatan pembangkitan pada akselerator modern.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Perhatian Multi-Kueri

MQA menetapkan bahwa Anda dapat memangkas kepala kunci/nilai yang berlebihan dengan sedikit kerugian, dan wawasan tersebut kini membentuk hampir setiap LLM inferensi cepat. Bidang ini sebagian besar telah menyatu pada Grouped-Query Attention (GQA), yang digunakan di Llama 2/3 dan banyak lainnya, yang menggunakan beberapa grup KV, bukan satu, untuk memulihkan kualitas sekaligus mempertahankan sebagian besar percepatan. Pekerjaan di masa depan memadukan ide-ide ini dengan kompresi cache KV, kuantisasi, dan perhatian multi-laten untuk mendorong konteks yang lebih panjang dan penyajian yang lebih murah.

Implementasi Dunia Nyata

Mempercepat pembuatan token demi token di asisten obrolan di mana cache KV, bukan komputasi mentah, membatasi throughput.

PaLM Google, yang menggunakan Multi-Query Attention untuk memungkinkan inferensi skala besar yang efisien.

Melayani banyak pengguna secara bersamaan pada satu GPU dengan mengecilkan memori cache KV per permintaan.

Perhatian Kueri yang Dikelompokkan di Llama 2 70B dan Llama 3, turunan langsung yang menyeimbangkan kecepatan MQA dengan kualitas perhatian penuh.

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Perhatian Kueri yang Dikelompokkan

Pertanyaan yang sering diajukan

What is Multi-Query Attention?

Multi-Query Attention (MQA) adalah perubahan hemat memori pada perhatian transformator yang berbagi satu set kunci dan nilai di semua kepala perhatian. Ini secara dramatis mempercepat pembuatan teks dengan memperkecil memori yang harus diacak oleh model.

Apa yang dibagikan oleh Perhatian Multi-Kueri di semua kepala perhatian?

MQA menyimpan kueri terpisah per kepala tetapi membagikan satu proyeksi kunci dan satu proyeksi nilai di semua kepala.

Apa hambatan utama yang diatasi MQA selama pembuatan autoregresif?

Memuat ulang cache KV yang besar, setiap langkah terikat bandwidth; MQA mengecilkan cache tersebut untuk mempercepat decoding.

Kira-kira dengan faktor apa MQA mengecilkan cache KV?

Karena kunci dan nilai diciutkan dari H head menjadi satu, cache menyusut kira-kira sebanyak jumlah head.

Apa keuntungan utama menggunakan MQA?

Berbagi kunci dan nilai sedikit mengurangi kapasitas representasi, menyebabkan sedikit penurunan kualitas sebagai imbalan atas peningkatan kecepatan yang besar.

Varian manakah yang berada di antara perhatian multi-head standar dan MQA?

Grouped-Query Attention (GQA) menggunakan beberapa grup KV, bukan satu, sehingga menyeimbangkan kualitas dan kecepatan.