Perhatian Terpendam Berbilang Kepala
Perhatian Terpendam Berbilang Kepala (MLA) ialah mekanisme perhatian, yang diperkenalkan dalam DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori ke dalam vektor terpendam kecil dikongsi.
Gambaran keseluruhan
Ia membolehkan model bahasa besar berjalan dengan memori GPU yang jauh lebih sedikit sambil mengekalkan kualiti hampir kepada perhatian standard.
Menyelam dalam
Apabila pengubah menjana teks, ia menyimpan vektor kunci dan nilai untuk setiap token lalu dalam 'cache KV.' Cache itu berkembang dengan panjang konteks dan mendominasi penggunaan memori semasa inferens. MLA menggantikan banyak vektor kunci/nilai bersaiz penuh dengan satu vektor terpendam peringkat rendah bagi setiap token, kemudian memproyeksikan yang terpendam itu kembali ke dalam kunci dan nilai setiap kepala dengan cepat. Kerana hanya pendam padat dicache, DeepSeek-V2 melaporkan pemotongan memori cache KV lebih 90% berbanding perhatian berbilang kepala standard, membolehkan konteks yang lebih panjang dan saiz kelompok yang lebih besar. Yang penting, matriks unjuran atas boleh dilipat ke dalam pemberat lain, jadi MLA mencapai pemampatan ini dengan sedikit atau tiada kehilangan yang boleh diukur dalam kualiti pemodelan.
Wawasan Teknikal
MLA melakukan pemampatan sendi peringkat rendah: setiap keadaan tersembunyi token diunjurkan ke vektor terpendam kecil, dan matriks unjuran atas yang berasingan membina semula kunci dan nilai setiap kepala. Helah bijak ialah 'menyerap' pemberat unjuran atas ke dalam pertanyaan dan unjuran output, jadi model tidak pernah menjadi kunci/nilai penuh semasa inferens. Benam kedudukan berputar dikendalikan dengan laluan kunci yang dipisahkan, kerana putaran tidak boleh diserap dengan cara yang sama, mengekalkan maklumat kedudukan.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Perhatian Terpendam Pelbagai Kepala
MLA membantu menjadikan DeepSeek-V2 dan V3 menjimatkan untuk berkhidmat secara berskala, dan teknik ini semakin meluas apabila pasukan mengejar inferens konteks panjang yang lebih murah. Jangkakan pemampatan pendam gaya MLA untuk digabungkan dengan lapisan Mixture-of-Experts yang jarang, cache terkuantisasi dan penyahkodan spekulatif dalam model terbuka masa hadapan. Penyelidik juga sedang meneroka sejauh mana dimensi terpendam boleh mengecut sebelum kualiti menurun, dan sama ada idea peringkat rendah yang sama boleh memampatkan perhatian semasa latihan, bukan hanya inferens.
Pelaksanaan Dunia Sebenar
Menyediakan model sembang DeepSeek-V2/V3 dengan jejak memori GPU yang lebih kecil secara dramatik bagi setiap permintaan
Menjalankan soalan dokumen panjang yang menjawab di mana cache KV yang besar akan menghabiskan VRAM
Meningkatkan saiz kelompok inferens pada GPU tetap kerana setiap jujukan hanya menyimpan vektor terpendam kecil
Mendayakan tetingkap konteks yang lebih panjang pada perkakasan komoditi untuk pembantu ditambah perolehan
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Perhatian Berbilang Pertanyaan
Soalan lazim
Apakah Perhatian Laten Multi-Kepala?
Perhatian Terpendam Berbilang Kepala (MLA) ialah mekanisme perhatian, yang diperkenalkan dalam DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori ke dalam vektor terpendam kecil dikongsi. Ia membolehkan model bahasa besar berjalan dengan memori GPU yang jauh lebih sedikit sambil mengekalkan kualiti dekat dengan perhatian standard.
Apakah masalah utama Multi-Head Latent Attention direka untuk mengurangkan?
MLA menyasarkan cache KV, yang berkembang dengan panjang konteks dan menguasai memori semasa penjanaan teks.
Bagaimanakah MLA mengecilkan cache KV?
MLA menyimpan satu vektor terpendam padat setiap token dan membina semula kunci dan nilai daripadanya melalui unjuran atas.
Model manakah yang pertama kali memperkenalkan Multi-Head Latent Attention?
MLA telah diperkenalkan oleh DeepSeek dalam model DeepSeek-V2 dan dibawa ke DeepSeek-V3.
Mengapakah MLA memerlukan laluan 'decoupled' yang berasingan untuk benam kedudukan berputar?
Penjelmaan putar tidak boleh diserap ke dalam matriks berat lain, jadi MLA menyimpan komponen utama yang dipisahkan untuk membawa maklumat kedudukan.
Secara kasar berapa banyak pengurangan memori cache KV yang dilaporkan DeepSeek-V2 daripada MLA berbanding perhatian berbilang kepala standard?
DeepSeek-V2 melaporkan pemotongan memori cache KV lebih daripada 90%, membolehkan konteks yang lebih panjang dan kelompok yang lebih besar.