Perhatian Laten Multi-Kepala
Multi-Head Latent Attention (MLA) adalah mekanisme perhatian, yang diperkenalkan di DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori menjadi vektor laten bersama yang kecil.
Ikhtisar
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Menyelam Lebih Dalam
Saat transformator menghasilkan teks, ia menyimpan vektor kunci dan nilai untuk setiap token masa lalu dalam 'cache KV'. Cache tersebut bertambah seiring dengan panjang konteks dan mendominasi penggunaan memori selama inferensi. MLA menggantikan banyak vektor kunci/nilai ukuran penuh dengan satu vektor laten peringkat rendah per token, lalu memproyeksikan cadangan laten tersebut ke dalam kunci dan nilai per kepala dengan cepat. Karena hanya kompak laten yang di-cache, DeepSeek-V2 melaporkan pemotongan memori cache KV lebih dari 90% dibandingkan perhatian multi-head standar, memungkinkan konteks yang lebih panjang dan ukuran batch yang lebih besar. Yang terpenting, matriks proyeksi ke atas dapat dilipat menjadi bobot lain, sehingga MLA mencapai kompresi ini dengan sedikit atau tanpa kehilangan kualitas pemodelan yang dapat diukur.
Wawasan Teknis
MLA melakukan kompresi gabungan tingkat rendah: setiap keadaan tersembunyi token diproyeksikan ke vektor laten kecil, dan matriks proyeksi atas yang terpisah merekonstruksi kunci dan nilai per kepala. Trik cerdasnya adalah 'menyerap' bobot proyeksi ke atas ke dalam kueri dan proyeksi keluaran, sehingga model tidak pernah mewujudkan kunci/nilai penuh selama inferensi. Penyematan posisi putar ditangani dengan jalur kunci yang dipisahkan, karena rotasi tidak dapat diserap dengan cara yang sama, sehingga menjaga informasi posisi.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Perhatian Laten Multi-Kepala
MLA membantu membuat DeepSeek-V2 dan V3 ekonomis untuk melayani dalam skala besar, dan teknik ini menyebar seiring tim mengejar inferensi konteks panjang yang lebih murah. Harapkan kompresi laten gaya MLA untuk digabungkan dengan lapisan Mixture-of-Experts yang jarang, cache terkuantisasi, dan decoding spekulatif dalam model terbuka di masa depan. Para peneliti juga mengeksplorasi seberapa jauh dimensi laten dapat menyusut sebelum kualitas turun, dan apakah ide tingkat rendah yang sama dapat mengurangi perhatian selama pelatihan, bukan hanya inferensi.
Implementasi Dunia Nyata
Melayani model obrolan DeepSeek-V2/V3 dengan jejak memori GPU yang jauh lebih kecil per permintaan
Menjalankan pertanyaan dokumen panjang yang menjawab di mana cache KV yang besar akan menghabiskan VRAM
Meningkatkan ukuran kumpulan inferensi pada GPU tetap karena setiap urutan hanya menyimpan vektor laten kecil
Mengaktifkan jendela konteks yang lebih panjang pada perangkat keras komoditas untuk asisten yang ditambah pengambilan
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Perhatian Multi-Kueri
Pertanyaan yang sering diajukan
What is Multi-Head Latent Attention?
Multi-Head Latent Attention (MLA) adalah mekanisme perhatian, yang diperkenalkan di DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori menjadi vektor laten bersama yang kecil. Hal ini memungkinkan model bahasa besar berjalan dengan memori GPU yang jauh lebih sedikit sambil menjaga kualitas mendekati perhatian standar.
Apa masalah utama yang dirancang untuk dikurangi Perhatian Laten Multi-Kepala?
MLA menargetkan cache KV, yang bertambah seiring panjang konteks dan mendominasi memori selama pembuatan teks.
Bagaimana cara MLA mengecilkan cache KV?
MLA menyimpan satu vektor laten kompak per token dan merekonstruksi kunci dan nilai darinya melalui proyeksi ke atas.
Model mana yang pertama kali memperkenalkan Multi-Head Latent Attention?
MLA diperkenalkan oleh DeepSeek dalam model DeepSeek-V2 dan dibawa ke DeepSeek-V3.
Mengapa MLA memerlukan jalur 'terpisah' terpisah untuk penyematan posisi putar?
Transformasi putar tidak dapat diserap ke dalam matriks bobot lainnya, sehingga MLA menyimpan komponen kunci kecil yang dipisahkan untuk membawa informasi posisi.
Kira-kira berapa banyak pengurangan memori cache KV yang dilaporkan DeepSeek-V2 dari MLA dibandingkan perhatian multi-head standar?
DeepSeek-V2 melaporkan pemotongan memori cache KV lebih dari 90%, memungkinkan konteks yang lebih panjang dan batch yang lebih besar.