PANDUAN AI Bahasa

Pelatihan Prediksi Multi-Token

Daripada hanya memprediksi token berikutnya, model ini dilatih untuk memprediksi beberapa token di masa depan sekaligus.

2 min readTerakhir diperbarui

Ikhtisar

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

Menyelam Lebih Dalam

Model bahasa standar dilatih dengan prediksi token berikutnya: berdasarkan konteks, prediksi token berikutnya. Prediksi multi-token (MTP), yang dipopulerkan oleh makalah Meta tahun 2024 dan diadopsi di DeepSeek-V3, menambahkan kepala keluaran ekstra ringan sehingga model secara bersamaan memprediksi token berikutnya ditambah token ke-2, ke-3, dan ke-4 di depan dari keadaan tersembunyi yang sama. Hal ini memaksa jaringan untuk membuat rencana lebih jauh ke depan dan memadatkan sinyal pelatihan — setiap posisi kini menyumbang beberapa istilah kerugian. Meta melaporkan peningkatan yang sangat besar pada pengkodean dan penalaran generatif, dengan model yang lebih besar mendapatkan manfaat yang lebih besar. Yang terpenting, head tambahan dapat dibuang setelah pelatihan, sehingga ukuran model saat penerapan tidak perlu bertambah.

Wawasan Teknis

MTP melampirkan n kepala prediksi independen di atas batang transformator bersama; head k memprediksi token pada posisi t+k dari representasi pada posisi t. Kerugian dijumlahkan selama pelatihan. Pada inferensi, kepala tambahan mengaktifkan decoding spekulatif mandiri: model mengusulkan beberapa token dalam satu proses, lalu memverifikasinya, sehingga menghasilkan pembuatan hingga sekitar 3x lebih cepat tanpa mengubah distribusi output.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Pelatihan Prediksi Multi-Token

MTP menjadi bahan baku dalam resep pelatihan frontier karena meningkatkan kualitas dan kecepatan inferensi dengan sedikit biaya. Harapkan integrasi yang lebih erat dengan decoding spekulatif, cakrawala prediksi yang lebih dalam, dan penggunaan sebagai tujuan tambahan yang meningkatkan perencanaan jangka panjang. Dikombinasikan dengan model penalaran, memprediksi beberapa langkah ke depan dapat membantu model mensimulasikan konsekuensi secara internal sebelum berkomitmen pada suatu jawaban.

Implementasi Dunia Nyata

DeepSeek-V3 menggunakan tujuan MTP selama pra-pelatihan untuk meningkatkan efisiensi data dan memungkinkan decoding spekulatif

Model pembuatan kode Meta menunjukkan peningkatan akurasi pada HumanEval dan MBPP dari memprediksi banyak token

Penguraian kode spekulatif mandiri: menyusun 3-4 token per penerusan lalu memverifikasi keluaran yang lebih cepat dan menjaga distribusi

Pelengkapan otomatis yang lebih cepat dalam asisten pengkodean di mana beberapa token yang masuk akal diusulkan dan diperiksa dalam satu langkah

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Streaming Spekulatif dan Prediksi Multi-Token

Pertanyaan yang sering diajukan

What is Multi-Token Prediction Training?

Daripada hanya memprediksi token berikutnya, model ini dilatih untuk memprediksi beberapa token di masa depan sekaligus. Hal ini mempertajam sinyal pembelajaran dan membuka inferensi yang lebih cepat melalui penguraian kode spekulatif diri.

Apa yang ditambahkan oleh prediksi multi-token dibandingkan dengan pelatihan standar token berikutnya?

MTP menambahkan kepala keluaran tambahan sehingga model memprediksi token berikutnya ditambah beberapa token lebih jauh ke depan dari satu keadaan tersembunyi.

Model mana yang secara khusus menggunakan tujuan prediksi multi-token dalam pra-pelatihan?

DeepSeek-V3 mengadopsi tujuan pelatihan MTP untuk meningkatkan efisiensi data dan memungkinkan decoding spekulatif.

Mengapa MTP memadatkan sinyal pelatihan?

Memprediksi beberapa token masa depan berarti setiap posisi token menghasilkan beberapa kerugian prediksi, memberikan lebih banyak sinyal pembelajaran per token.

Manfaat inferensi apa yang dimungkinkan oleh kepala prediksi tambahan?

Kepala tambahan dapat menyusun beberapa token per pass yang kemudian diverifikasi, mempercepat pembuatan tanpa mengubah distribusi keluaran.

Apa yang terjadi pada kepala tambahan setelah latihan jika Anda tidak memerlukan percepatan?

Head tambahan bersifat opsional saat penerapan; membuangnya akan membuat model tetap berukuran sama dengan model token berikutnya standar.