Pelatihan Prediksi Multi-Token
Daripada hanya memprediksi token berikutnya, model ini dilatih untuk memprediksi beberapa token di masa depan sekaligus.
Ikhtisar
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Menyelam Lebih Dalam
Model bahasa standar dilatih dengan prediksi token berikutnya: berdasarkan konteks, prediksi token berikutnya. Prediksi multi-token (MTP), yang dipopulerkan oleh makalah Meta tahun 2024 dan diadopsi di DeepSeek-V3, menambahkan kepala keluaran ekstra ringan sehingga model secara bersamaan memprediksi token berikutnya ditambah token ke-2, ke-3, dan ke-4 di depan dari keadaan tersembunyi yang sama. Hal ini memaksa jaringan untuk membuat rencana lebih jauh ke depan dan memadatkan sinyal pelatihan — setiap posisi kini menyumbang beberapa istilah kerugian. Meta melaporkan peningkatan yang sangat besar pada pengkodean dan penalaran generatif, dengan model yang lebih besar mendapatkan manfaat yang lebih besar. Yang terpenting, head tambahan dapat dibuang setelah pelatihan, sehingga ukuran model saat penerapan tidak perlu bertambah.
Wawasan Teknis
MTP melampirkan n kepala prediksi independen di atas batang transformator bersama; head k memprediksi token pada posisi t+k dari representasi pada posisi t. Kerugian dijumlahkan selama pelatihan. Pada inferensi, kepala tambahan mengaktifkan decoding spekulatif mandiri: model mengusulkan beberapa token dalam satu proses, lalu memverifikasinya, sehingga menghasilkan pembuatan hingga sekitar 3x lebih cepat tanpa mengubah distribusi output.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Pelatihan Prediksi Multi-Token
MTP menjadi bahan baku dalam resep pelatihan frontier karena meningkatkan kualitas dan kecepatan inferensi dengan sedikit biaya. Harapkan integrasi yang lebih erat dengan decoding spekulatif, cakrawala prediksi yang lebih dalam, dan penggunaan sebagai tujuan tambahan yang meningkatkan perencanaan jangka panjang. Dikombinasikan dengan model penalaran, memprediksi beberapa langkah ke depan dapat membantu model mensimulasikan konsekuensi secara internal sebelum berkomitmen pada suatu jawaban.
Implementasi Dunia Nyata
DeepSeek-V3 menggunakan tujuan MTP selama pra-pelatihan untuk meningkatkan efisiensi data dan memungkinkan decoding spekulatif
Model pembuatan kode Meta menunjukkan peningkatan akurasi pada HumanEval dan MBPP dari memprediksi banyak token
Penguraian kode spekulatif mandiri: menyusun 3-4 token per penerusan lalu memverifikasi keluaran yang lebih cepat dan menjaga distribusi
Pelengkapan otomatis yang lebih cepat dalam asisten pengkodean di mana beberapa token yang masuk akal diusulkan dan diperiksa dalam satu langkah
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Streaming Spekulatif dan Prediksi Multi-Token
Pertanyaan yang sering diajukan
What is Multi-Token Prediction Training?
Daripada hanya memprediksi token berikutnya, model ini dilatih untuk memprediksi beberapa token di masa depan sekaligus. Hal ini mempertajam sinyal pembelajaran dan membuka inferensi yang lebih cepat melalui penguraian kode spekulatif diri.
Apa yang ditambahkan oleh prediksi multi-token dibandingkan dengan pelatihan standar token berikutnya?
MTP menambahkan kepala keluaran tambahan sehingga model memprediksi token berikutnya ditambah beberapa token lebih jauh ke depan dari satu keadaan tersembunyi.
Model mana yang secara khusus menggunakan tujuan prediksi multi-token dalam pra-pelatihan?
DeepSeek-V3 mengadopsi tujuan pelatihan MTP untuk meningkatkan efisiensi data dan memungkinkan decoding spekulatif.
Mengapa MTP memadatkan sinyal pelatihan?
Memprediksi beberapa token masa depan berarti setiap posisi token menghasilkan beberapa kerugian prediksi, memberikan lebih banyak sinyal pembelajaran per token.
Manfaat inferensi apa yang dimungkinkan oleh kepala prediksi tambahan?
Kepala tambahan dapat menyusun beberapa token per pass yang kemudian diverifikasi, mempercepat pembuatan tanpa mengubah distribusi keluaran.
Apa yang terjadi pada kepala tambahan setelah latihan jika Anda tidak memerlukan percepatan?
Head tambahan bersifat opsional saat penerapan; membuangnya akan membuat model tetap berukuran sama dengan model token berikutnya standar.