Perhatian Kueri yang Dikelompokkan
Grouped-Query Attention (GQA) adalah cara untuk memperkecil memori yang dibutuhkan selama pembuatan teks dengan membiarkan beberapa kepala kueri berbagi kepala kunci dan nilai yang sama.
Ikhtisar
It makes large models much faster to serve with almost no quality loss.
Menyelam Lebih Dalam
Dalam lapisan perhatian multi-kepala standar, setiap kepala memiliki kueri, kunci, dan nilainya sendiri. Selama pembuatan, kunci dan nilai untuk semua token sebelumnya disimpan dalam cache (“cache KV”) sehingga model tidak menghitung ulangnya. Dengan banyak head dan konteks yang panjang, cache ini menjadi sangat besar dan mendominasi bandwidth memori pada waktu inferensi. GQA, yang diperkenalkan oleh peneliti Google pada tahun 2023, mengelompokkan kepala kueri dan memberikan setiap kelompok satu set kepala kunci dan nilai bersama. Jika Anda memiliki 32 kepala kueri tetapi hanya 8 grup KV, cache KV akan menyusut sekitar empat kali lipat. Ini berada di antara perhatian multi-kepala penuh (setiap kepala terpisah) dan perhatian multi-kueri (satu KV bersama untuk semua kepala), menangkap sebagian besar kecepatan MQA sekaligus menjaga kualitas mendekati perhatian penuh. Llama 2 70B dan banyak model selanjutnya mengadopsinya.
Wawasan Teknis
Kualitas perhatian sangat bergantung pada banyaknya arah kueri yang berbeda, namun mentoleransi pembagian kunci dan nilai. GQA mengeksploitasi asimetri ini: GQA menyimpan semua kepala kueri tetapi mereplikasi setiap kepala KV yang dibagikan di seluruh kueri dalam grupnya. Penghematan terjadi pada kesimpulan, di mana cache KV adalah konsumen utama bandwidth memori; lebih sedikit kepala KV berarti lebih sedikit data untuk dibaca per token yang dihasilkan. Model sering kali 'dilatih' sebentar untuk mengubah pos pemeriksaan multi-kepala yang ada menjadi pos pemeriksaan GQA.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Perhatian Kueri yang Dikelompokkan
GQA kini menjadi default standar dalam model bobot terbuka karena GQA dengan mudah menukar biaya kualitas yang kecil dengan kemenangan porsi yang besar. Harapkan ini untuk semakin digabungkan dengan trik efisiensi lainnya seperti FlashAttention, kuantisasi cache KV, dan skema yang lebih baru seperti perhatian laten multi-head yang semakin memampatkan cache. Seiring berkembangnya jendela konteks, pengendalian ukuran cache KV akan tetap menjadi masalah desain utama, dan head sharing gaya GQA akan tetap menjadi faktor utama.
Implementasi Dunia Nyata
Llama 2 70B dan Llama 3 menggunakan GQA untuk melayani konteks panjang dengan cache KV yang lebih kecil
Mengurangi memori GPU sehingga model obrolan besar dapat digunakan pada akselerator yang lebih sedikit atau lebih murah
Mempercepat pembuatan token demi token di API produksi di mana bandwidth cache KV menjadi hambatannya
Memungkinkan ukuran batch yang lebih besar untuk melayani banyak pengguna secara bersamaan tanpa menghabiskan memori
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped-Query Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Perhatian Multi-Kueri
Pertanyaan yang sering diajukan
What is Grouped-Query Attention?
Grouped-Query Attention (GQA) adalah cara untuk memperkecil memori yang dibutuhkan selama pembuatan teks dengan membiarkan beberapa kepala kueri berbagi kepala kunci dan nilai yang sama. Hal ini membuat model besar lebih cepat disajikan tanpa kehilangan kualitas.
Dalam Perhatian Kueri yang Dikelompokkan, apa yang dibagikan di antara sekelompok kepala kueri?
GQA menyimpan kepala kueri yang terpisah tetapi memungkinkan setiap grup berbagi satu set kepala kunci dan nilai, sehingga memperkecil cache KV.
GQA paling tepat digambarkan sebagai jalan tengah antara dua ekstrem yang mana?
Multi-head memberi setiap kepala KVnya sendiri; multi-kueri membagikan satu KV untuk semua kepala; GQA berada di antara beberapa grup KV.
Bagian inferensi manakah yang terutama dibuat lebih murah oleh GQA?
Penghematan muncul pada waktu pembangkitan, dimana pembacaan cache KV merupakan biaya bandwidth memori yang dominan.
Jika suatu model memiliki 32 kepala kueri dan 8 grup KV, cache KV dikurangi kira-kira dengan faktor apa?
32 kepala kueri yang dibagi dengan 8 grup KV bersama memberikan pengurangan sekitar empat kali lipat pada kunci dan nilai yang di-cache.
Mengapa GQA dapat mempertahankan sebagian besar kualitas model meskipun berbagi kepala KV?
Attention menoleransi pembagian kunci dan nilai jauh lebih baik daripada menoleransi kehilangan arah kueri yang berbeda, sehingga GQA menjaga kualitas tetap tinggi.