Çoklu Token Tahmin Eğitimi
Model, yalnızca bir sonraki jetonu tahmin etmek yerine, aynı anda birden fazla gelecekteki jetonu tahmin edecek şekilde eğitilir.
Genel Bakış
This sharpens learning signals and unlocks faster inference through self-speculative decoding.
Derin Dalış
Standart dil modelleri bir sonraki belirteç tahminiyle eğitilir: bir bağlam verildiğinde, sonraki tek belirteci tahmin edin. 2024 tarihli bir Meta makalesi tarafından popüler hale getirilen ve DeepSeek-V3'te benimsenen çoklu jeton tahmini (MTP), ekstra hafif çıktı kafaları ekler, böylece model aynı gizli durumdan bir sonraki jetonu artı 2., 3. ve 4. jetonları eş zamanlı olarak tahmin eder. Bu, ağı geleceğe yönelik planlama yapmaya zorlar ve eğitim sinyalini yoğunlaştırır; artık her konum birden fazla kayıp terimine katkıda bulunur. Meta özellikle kodlama ve üretken akıl yürütmede büyük kazanımlar elde edildiğini ve daha büyük modellerin daha fazla fayda sağladığını bildirdi. Daha da önemlisi, fazladan kafalar eğitimden sonra atılabilir, böylece dağıtım sırasında model boyutunun büyümesine gerek kalmaz.
Teknik Bilgi
MTP, paylaşılan transformatör hattının üstüne n adet bağımsız tahmin başlığı ekler; k kafası, t konumundaki temsilden t+k konumundaki jetonu tahmin eder. Kayıplar eğitim sırasında toplanır. Çıkarımda, yardımcı kafalar kendi kendine spekülatif kod çözmeyi mümkün kılar: model, tek geçişte birkaç jeton önerir, ardından bunları doğrular ve çıktı dağıtımını değiştirmeden yaklaşık 3 kata kadar daha hızlı üretim elde eder.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Çoklu Token Tahmin Eğitiminin Geleceği
MTP, düşük maliyetle hem kaliteyi hem de çıkarım hızını arttırdığı için öncü eğitim tariflerinde varsayılan bir bileşen haline geliyor. Spekülatif kod çözme, daha derin tahmin ufukları ve uzun ufuklu planlamayı geliştiren yardımcı bir hedef olarak kullanma ile daha sıkı entegrasyon bekleyebilirsiniz. Akıl yürütme modelleriyle birleştirildiğinde, ilerideki birden fazla adımı tahmin etmek, modellerin bir cevaba karar vermeden önce sonuçları dahili olarak simüle etmesine yardımcı olabilir.
Gerçek Dünya Uygulaması
Veri verimliliğini artırmak ve spekülatif kod çözmeyi etkinleştirmek için ön eğitim sırasında bir MTP hedefi kullanan DeepSeek-V3
Meta'nin kod oluşturma modelleri, HumanEval ve MBPP'de birden fazla tokenin tahmin edilmesiyle elde edilen doğruluk kazanımlarını gösteriyor
Kendinden spekülatif kod çözme: ileri geçiş başına 3-4 jeton taslağı hazırlamak ve ardından daha hızlı, dağıtımı koruyan çıktı için doğrulamak
Birden fazla makul belirtecin önerildiği ve tek adımda kontrol edildiği kodlama asistanlarında daha hızlı otomatik tamamlama
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Token Prediction Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Spekülatif Yayın ve Çoklu Token Tahmini
Sık sorulan sorular
What is Multi-Token Prediction Training?
Model, yalnızca bir sonraki jetonu tahmin etmek yerine, aynı anda birden fazla gelecekteki jetonu tahmin edecek şekilde eğitilir. Bu, öğrenme sinyallerini keskinleştirir ve kendi kendine spekülatif kod çözme yoluyla daha hızlı çıkarımın kilidini açar.
Çoklu jeton tahmini, standart sonraki jeton eğitimine kıyasla ne katıyor?
MTP ek çıktı kafaları ekler, böylece model bir sonraki jetonu ve bir gizli durumdan daha ilerideki birkaç jetonu tahmin eder.
Hangi model özellikle ön eğitimde çok belirteçli tahmin hedefini kullandı?
DeepSeek-V3, veri verimliliğini artırmak ve spekülatif kod çözmeyi mümkün kılmak için bir MTP eğitim hedefini benimsedi.
MTP neden eğitim sinyalini yoğunlaştırıyor?
Gelecekteki birden fazla tokenı tahmin etmek, her bir token pozisyonunun birden fazla tahmin kaybı üretmesi ve token başına daha fazla öğrenme sinyali vermesi anlamına gelir.
Ekstra tahmin kafaları hangi çıkarım faydasını sağlar?
Yardımcı kafalar, geçiş başına birden fazla jeton taslağı hazırlayabilir ve bunlar daha sonra doğrulanır, böylece çıktı dağıtımını değiştirmeden üretim hızlandırılır.
Hızlandırmaya ihtiyacınız yoksa antrenmandan sonra yardımcı kafalara ne olur?
Ekstra kafalar dağıtım sırasında isteğe bağlıdır; bunların atılması, modeli standart bir sonraki jeton modeliyle aynı boyutta tutar.