Dil AI KILAVUZU

Çoklu Token Tahmin Eğitimi

Model, yalnızca bir sonraki jetonu tahmin etmek yerine, aynı anda birden fazla gelecekteki jetonu tahmin edecek şekilde eğitilir.

2 min readSon güncelleme

Genel Bakış

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

Derin Dalış

Standart dil modelleri bir sonraki belirteç tahminiyle eğitilir: bir bağlam verildiğinde, sonraki tek belirteci tahmin edin. 2024 tarihli bir Meta makalesi tarafından popüler hale getirilen ve DeepSeek-V3'te benimsenen çoklu jeton tahmini (MTP), ekstra hafif çıktı kafaları ekler, böylece model aynı gizli durumdan bir sonraki jetonu artı 2., 3. ve 4. jetonları eş zamanlı olarak tahmin eder. Bu, ağı geleceğe yönelik planlama yapmaya zorlar ve eğitim sinyalini yoğunlaştırır; artık her konum birden fazla kayıp terimine katkıda bulunur. Meta özellikle kodlama ve üretken akıl yürütmede büyük kazanımlar elde edildiğini ve daha büyük modellerin daha fazla fayda sağladığını bildirdi. Daha da önemlisi, fazladan kafalar eğitimden sonra atılabilir, böylece dağıtım sırasında model boyutunun büyümesine gerek kalmaz.

Teknik Bilgi

MTP, paylaşılan transformatör hattının üstüne n adet bağımsız tahmin başlığı ekler; k kafası, t konumundaki temsilden t+k konumundaki jetonu tahmin eder. Kayıplar eğitim sırasında toplanır. Çıkarımda, yardımcı kafalar kendi kendine spekülatif kod çözmeyi mümkün kılar: model, tek geçişte birkaç jeton önerir, ardından bunları doğrular ve çıktı dağıtımını değiştirmeden yaklaşık 3 kata kadar daha hızlı üretim elde eder.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Çoklu Token Tahmin Eğitiminin Geleceği

MTP, düşük maliyetle hem kaliteyi hem de çıkarım hızını arttırdığı için öncü eğitim tariflerinde varsayılan bir bileşen haline geliyor. Spekülatif kod çözme, daha derin tahmin ufukları ve uzun ufuklu planlamayı geliştiren yardımcı bir hedef olarak kullanma ile daha sıkı entegrasyon bekleyebilirsiniz. Akıl yürütme modelleriyle birleştirildiğinde, ilerideki birden fazla adımı tahmin etmek, modellerin bir cevaba karar vermeden önce sonuçları dahili olarak simüle etmesine yardımcı olabilir.

Gerçek Dünya Uygulaması

Veri verimliliğini artırmak ve spekülatif kod çözmeyi etkinleştirmek için ön eğitim sırasında bir MTP hedefi kullanan DeepSeek-V3

Meta'nin kod oluşturma modelleri, HumanEval ve MBPP'de birden fazla tokenin tahmin edilmesiyle elde edilen doğruluk kazanımlarını gösteriyor

Kendinden spekülatif kod çözme: ileri geçiş başına 3-4 jeton taslağı hazırlamak ve ardından daha hızlı, dağıtımı koruyan çıktı için doğrulamak

Birden fazla makul belirtecin önerildiği ve tek adımda kontrol edildiği kodlama asistanlarında daha hızlı otomatik tamamlama

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Spekülatif Yayın ve Çoklu Token Tahmini

Sık sorulan sorular

What is Multi-Token Prediction Training?

Model, yalnızca bir sonraki jetonu tahmin etmek yerine, aynı anda birden fazla gelecekteki jetonu tahmin edecek şekilde eğitilir. Bu, öğrenme sinyallerini keskinleştirir ve kendi kendine spekülatif kod çözme yoluyla daha hızlı çıkarımın kilidini açar.

Çoklu jeton tahmini, standart sonraki jeton eğitimine kıyasla ne katıyor?

MTP ek çıktı kafaları ekler, böylece model bir sonraki jetonu ve bir gizli durumdan daha ilerideki birkaç jetonu tahmin eder.

Hangi model özellikle ön eğitimde çok belirteçli tahmin hedefini kullandı?

DeepSeek-V3, veri verimliliğini artırmak ve spekülatif kod çözmeyi mümkün kılmak için bir MTP eğitim hedefini benimsedi.

MTP neden eğitim sinyalini yoğunlaştırıyor?

Gelecekteki birden fazla tokenı tahmin etmek, her bir token pozisyonunun birden fazla tahmin kaybı üretmesi ve token başına daha fazla öğrenme sinyali vermesi anlamına gelir.

Ekstra tahmin kafaları hangi çıkarım faydasını sağlar?

Yardımcı kafalar, geçiş başına birden fazla jeton taslağı hazırlayabilir ve bunlar daha sonra doğrulanır, böylece çıktı dağıtımını değiştirmeden üretim hızlandırılır.

Hızlandırmaya ihtiyacınız yoksa antrenmandan sonra yardımcı kafalara ne olur?

Ekstra kafalar dağıtım sırasında isteğe bağlıdır; bunların atılması, modeli standart bir sonraki jeton modeliyle aynı boyutta tutar.