PANDUAN AI Bahasa

Perhatian Laten Multi-Kepala

Multi-Head Latent Attention (MLA) adalah mekanisme perhatian, yang diperkenalkan di DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori menjadi vektor laten bersama yang kecil.

2 min readTerakhir diperbarui

Ikhtisar

It lets large language models run with far less GPU memory while keeping quality close to standard attention.

Menyelam Lebih Dalam

Saat transformator menghasilkan teks, ia menyimpan vektor kunci dan nilai untuk setiap token masa lalu dalam 'cache KV'. Cache tersebut bertambah seiring dengan panjang konteks dan mendominasi penggunaan memori selama inferensi. MLA menggantikan banyak vektor kunci/nilai ukuran penuh dengan satu vektor laten peringkat rendah per token, lalu memproyeksikan cadangan laten tersebut ke dalam kunci dan nilai per kepala dengan cepat. Karena hanya kompak laten yang di-cache, DeepSeek-V2 melaporkan pemotongan memori cache KV lebih dari 90% dibandingkan perhatian multi-head standar, memungkinkan konteks yang lebih panjang dan ukuran batch yang lebih besar. Yang terpenting, matriks proyeksi ke atas dapat dilipat menjadi bobot lain, sehingga MLA mencapai kompresi ini dengan sedikit atau tanpa kehilangan kualitas pemodelan yang dapat diukur.

Wawasan Teknis

MLA melakukan kompresi gabungan tingkat rendah: setiap keadaan tersembunyi token diproyeksikan ke vektor laten kecil, dan matriks proyeksi atas yang terpisah merekonstruksi kunci dan nilai per kepala. Trik cerdasnya adalah 'menyerap' bobot proyeksi ke atas ke dalam kueri dan proyeksi keluaran, sehingga model tidak pernah mewujudkan kunci/nilai penuh selama inferensi. Penyematan posisi putar ditangani dengan jalur kunci yang dipisahkan, karena rotasi tidak dapat diserap dengan cara yang sama, sehingga menjaga informasi posisi.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Perhatian Laten Multi-Kepala

MLA membantu membuat DeepSeek-V2 dan V3 ekonomis untuk melayani dalam skala besar, dan teknik ini menyebar seiring tim mengejar inferensi konteks panjang yang lebih murah. Harapkan kompresi laten gaya MLA untuk digabungkan dengan lapisan Mixture-of-Experts yang jarang, cache terkuantisasi, dan decoding spekulatif dalam model terbuka di masa depan. Para peneliti juga mengeksplorasi seberapa jauh dimensi laten dapat menyusut sebelum kualitas turun, dan apakah ide tingkat rendah yang sama dapat mengurangi perhatian selama pelatihan, bukan hanya inferensi.

Implementasi Dunia Nyata

Melayani model obrolan DeepSeek-V2/V3 dengan jejak memori GPU yang jauh lebih kecil per permintaan

Menjalankan pertanyaan dokumen panjang yang menjawab di mana cache KV yang besar akan menghabiskan VRAM

Meningkatkan ukuran kumpulan inferensi pada GPU tetap karena setiap urutan hanya menyimpan vektor laten kecil

Mengaktifkan jendela konteks yang lebih panjang pada perangkat keras komoditas untuk asisten yang ditambah pengambilan

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Head Latent Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Perhatian Multi-Kueri

Pertanyaan yang sering diajukan

What is Multi-Head Latent Attention?

Multi-Head Latent Attention (MLA) adalah mekanisme perhatian, yang diperkenalkan di DeepSeek-V2, yang memampatkan cache nilai kunci yang haus memori menjadi vektor laten bersama yang kecil. Hal ini memungkinkan model bahasa besar berjalan dengan memori GPU yang jauh lebih sedikit sambil menjaga kualitas mendekati perhatian standar.

Apa masalah utama yang dirancang untuk dikurangi Perhatian Laten Multi-Kepala?

MLA menargetkan cache KV, yang bertambah seiring panjang konteks dan mendominasi memori selama pembuatan teks.

Bagaimana cara MLA mengecilkan cache KV?

MLA menyimpan satu vektor laten kompak per token dan merekonstruksi kunci dan nilai darinya melalui proyeksi ke atas.

Model mana yang pertama kali memperkenalkan Multi-Head Latent Attention?

MLA diperkenalkan oleh DeepSeek dalam model DeepSeek-V2 dan dibawa ke DeepSeek-V3.

Mengapa MLA memerlukan jalur 'terpisah' terpisah untuk penyematan posisi putar?

Transformasi putar tidak dapat diserap ke dalam matriks bobot lainnya, sehingga MLA menyimpan komponen kunci kecil yang dipisahkan untuk membawa informasi posisi.

Kira-kira berapa banyak pengurangan memori cache KV yang dilaporkan DeepSeek-V2 dari MLA dibandingkan perhatian multi-head standar?

DeepSeek-V2 melaporkan pemotongan memori cache KV lebih dari 90%, memungkinkan konteks yang lebih panjang dan batch yang lebih besar.