PANDUAN AI Bahasa

Perhatian Kueri yang Dikelompokkan

Grouped-Query Attention (GQA) adalah cara untuk memperkecil memori yang dibutuhkan selama pembuatan teks dengan membiarkan beberapa kepala kueri berbagi kepala kunci dan nilai yang sama.

2 min readTerakhir diperbarui

Ikhtisar

It makes large models much faster to serve with almost no quality loss.

Menyelam Lebih Dalam

Dalam lapisan perhatian multi-kepala standar, setiap kepala memiliki kueri, kunci, dan nilainya sendiri. Selama pembuatan, kunci dan nilai untuk semua token sebelumnya disimpan dalam cache (“cache KV”) sehingga model tidak menghitung ulangnya. Dengan banyak head dan konteks yang panjang, cache ini menjadi sangat besar dan mendominasi bandwidth memori pada waktu inferensi. GQA, yang diperkenalkan oleh peneliti Google pada tahun 2023, mengelompokkan kepala kueri dan memberikan setiap kelompok satu set kepala kunci dan nilai bersama. Jika Anda memiliki 32 kepala kueri tetapi hanya 8 grup KV, cache KV akan menyusut sekitar empat kali lipat. Ini berada di antara perhatian multi-kepala penuh (setiap kepala terpisah) dan perhatian multi-kueri (satu KV bersama untuk semua kepala), menangkap sebagian besar kecepatan MQA sekaligus menjaga kualitas mendekati perhatian penuh. Llama 2 70B dan banyak model selanjutnya mengadopsinya.

Wawasan Teknis

Kualitas perhatian sangat bergantung pada banyaknya arah kueri yang berbeda, namun mentoleransi pembagian kunci dan nilai. GQA mengeksploitasi asimetri ini: GQA menyimpan semua kepala kueri tetapi mereplikasi setiap kepala KV yang dibagikan di seluruh kueri dalam grupnya. Penghematan terjadi pada kesimpulan, di mana cache KV adalah konsumen utama bandwidth memori; lebih sedikit kepala KV berarti lebih sedikit data untuk dibaca per token yang dihasilkan. Model sering kali 'dilatih' sebentar untuk mengubah pos pemeriksaan multi-kepala yang ada menjadi pos pemeriksaan GQA.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Perhatian Kueri yang Dikelompokkan

GQA kini menjadi default standar dalam model bobot terbuka karena GQA dengan mudah menukar biaya kualitas yang kecil dengan kemenangan porsi yang besar. Harapkan ini untuk semakin digabungkan dengan trik efisiensi lainnya seperti FlashAttention, kuantisasi cache KV, dan skema yang lebih baru seperti perhatian laten multi-head yang semakin memampatkan cache. Seiring berkembangnya jendela konteks, pengendalian ukuran cache KV akan tetap menjadi masalah desain utama, dan head sharing gaya GQA akan tetap menjadi faktor utama.

Implementasi Dunia Nyata

Llama 2 70B dan Llama 3 menggunakan GQA untuk melayani konteks panjang dengan cache KV yang lebih kecil

Mengurangi memori GPU sehingga model obrolan besar dapat digunakan pada akselerator yang lebih sedikit atau lebih murah

Mempercepat pembuatan token demi token di API produksi di mana bandwidth cache KV menjadi hambatannya

Memungkinkan ukuran batch yang lebih besar untuk melayani banyak pengguna secara bersamaan tanpa menghabiskan memori

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Grouped-Query Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Perhatian Multi-Kueri

Pertanyaan yang sering diajukan

What is Grouped-Query Attention?

Grouped-Query Attention (GQA) adalah cara untuk memperkecil memori yang dibutuhkan selama pembuatan teks dengan membiarkan beberapa kepala kueri berbagi kepala kunci dan nilai yang sama. Hal ini membuat model besar lebih cepat disajikan tanpa kehilangan kualitas.

Dalam Perhatian Kueri yang Dikelompokkan, apa yang dibagikan di antara sekelompok kepala kueri?

GQA menyimpan kepala kueri yang terpisah tetapi memungkinkan setiap grup berbagi satu set kepala kunci dan nilai, sehingga memperkecil cache KV.

GQA paling tepat digambarkan sebagai jalan tengah antara dua ekstrem yang mana?

Multi-head memberi setiap kepala KVnya sendiri; multi-kueri membagikan satu KV untuk semua kepala; GQA berada di antara beberapa grup KV.

Bagian inferensi manakah yang terutama dibuat lebih murah oleh GQA?

Penghematan muncul pada waktu pembangkitan, dimana pembacaan cache KV merupakan biaya bandwidth memori yang dominan.

Jika suatu model memiliki 32 kepala kueri dan 8 grup KV, cache KV dikurangi kira-kira dengan faktor apa?

32 kepala kueri yang dibagi dengan 8 grup KV bersama memberikan pengurangan sekitar empat kali lipat pada kunci dan nilai yang di-cache.

Mengapa GQA dapat mempertahankan sebagian besar kualitas model meskipun berbagi kepala KV?

Attention menoleransi pembagian kunci dan nilai jauh lebih baik daripada menoleransi kehilangan arah kueri yang berbeda, sehingga GQA menjaga kualitas tetap tinggi.