Latihan Ramalan Pelbagai Token
Daripada meramalkan hanya token seterusnya, model ini dilatih untuk meramalkan beberapa token masa hadapan sekaligus.
Gambaran keseluruhan
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Menyelam dalam
Model bahasa standard dilatih dengan ramalan token seterusnya: berdasarkan konteks, ramalkan satu token seterusnya. Ramalan berbilang token (MTP), yang dipopularkan oleh kertas Meta 2024 dan diterima pakai dalam DeepSeek-V3, menambah kepala keluaran lebih ringan supaya model meramalkan token seterusnya secara serentak ditambah token ke-2, ke-3 dan ke-4 di hadapan daripada keadaan tersembunyi yang sama. Ini memaksa rangkaian untuk merancang lebih jauh ke masa hadapan dan mengetatkan isyarat latihan — setiap kedudukan kini menyumbang berbilang istilah kerugian. Meta melaporkan keuntungan besar terutamanya pada pengekodan dan penaakulan generatif, dengan model yang lebih besar memberi manfaat lebih banyak. Yang penting, kepala tambahan boleh dibuang selepas latihan, jadi saiz model pada penggunaan tidak perlu berkembang.
Wawasan Teknikal
MTP melekatkan n kepala ramalan bebas di atas batang transformer yang dikongsi; kepala k meramalkan token pada kedudukan t+k daripada perwakilan pada kedudukan t. Kerugian dijumlahkan semasa latihan. Pada inferens, kepala tambahan membolehkan penyahkodan spekulatif kendiri: model mencadangkan beberapa token dalam satu laluan, kemudian mengesahkannya, mencapai penjanaan sehingga kira-kira 3x lebih pantas tanpa mengubah pengedaran output.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Latihan Ramalan Pelbagai Token
MTP menjadi bahan lalai dalam resipi latihan sempadan kerana ia meningkatkan kualiti dan kelajuan inferens pada kos yang rendah. Jangkakan penyepaduan yang lebih ketat dengan penyahkodan spekulatif, ufuk ramalan yang lebih mendalam dan gunakan sebagai objektif tambahan yang meningkatkan perancangan ufuk panjang. Digabungkan dengan model penaakulan, meramalkan beberapa langkah ke hadapan boleh membantu model mensimulasikan akibat secara dalaman sebelum memberikan jawapan.
Pelaksanaan Dunia Sebenar
DeepSeek-V3 menggunakan objektif MTP semasa pralatihan untuk meningkatkan kecekapan data dan membolehkan penyahkodan spekulatif
Model penjanaan kod Meta menunjukkan keuntungan ketepatan pada HumanEval dan MBPP daripada meramalkan berbilang token
Penyahkodan spekulatif kendiri: mendraf 3-4 token setiap pas ke hadapan kemudian mengesahkan untuk keluaran yang lebih pantas dan mengekalkan pengedaran
Autolengkap lebih pantas dalam pembantu pengekodan yang berbilang token yang munasabah dicadangkan dan disemak dalam satu langkah
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Penstriman Spekulatif dan Ramalan Berbilang Token
Soalan lazim
What is Multi-Token Prediction Training?
Daripada meramalkan hanya token seterusnya, model ini dilatih untuk meramalkan beberapa token masa hadapan sekaligus. Ini menajamkan isyarat pembelajaran dan membuka kunci inferens yang lebih cepat melalui penyahkodan spekulatif kendiri.
Apakah yang ditambah dengan ramalan berbilang token berbanding latihan standard token seterusnya?
MTP menambah kepala output tambahan supaya model meramalkan token seterusnya ditambah beberapa token lebih jauh ke hadapan daripada satu keadaan tersembunyi.
Model manakah yang menggunakan objektif ramalan berbilang token dalam pralatihan?
DeepSeek-V3 menggunakan objektif latihan MTP untuk meningkatkan kecekapan data dan membolehkan penyahkodan spekulatif.
Mengapakah MTP memadatkan isyarat latihan?
Meramalkan beberapa token masa hadapan bermakna setiap kedudukan token menghasilkan beberapa kerugian ramalan, memberikan lebih banyak isyarat pembelajaran bagi setiap token.
Apakah faedah inferens yang didayakan oleh kepala ramalan tambahan?
Ketua tambahan boleh mendraf berbilang token setiap pas yang kemudiannya disahkan, mempercepatkan penjanaan tanpa mengubah pengedaran output.
Apa yang berlaku kepada ketua bantuan selepas latihan jika anda tidak memerlukan peningkatan kelajuan?
Kepala tambahan adalah pilihan semasa penggunaan; membuangnya mengekalkan saiz model yang sama dengan model token seterusnya standard.