Sonraki Jeton Tahmini
Sonraki belirteç tahmini, GPT tarzı modellerin ardındaki aldatıcı derecede basit hedeftir: Şu ana kadar her şeyi göz önünde bulundurarak, bir sonraki metin parçasını tahmin edin.
Genel Bakış
Repeated billions of times, this single task produces models that write, reason, and converse.
Derin Dalış
Sonraki jeton tahmini, önceki tüm jetonlar göz önüne alındığında bir sonraki jetona olasılıkları atamak için bir modeli eğitir. Metin ilk önce bayt çifti kodlaması gibi bir belirteç tarafından belirteçlere (alt kelime parçalarına) bölünür. Yalnızca kod çözücüden oluşan bir Transformer, diziyi soldan sağa okur ve bir sonraki konum için tüm sözcük dağarcığı üzerinde bir olasılık dağılımı üretir. Eğitim sırasında modele büyük metin topluluğu gösterilir ve gerçek bir sonraki simgeye düşük olasılık atadığında cezalandırılır. Oluşturma zamanında, model bir jetonu örnekler veya açgözlülükle seçer, ekler ve bu döngüyü otoregresif olarak tekrarlar. Bu tek hedef dikkat çekici bir şekilde ölçekleniyor: GPT-2, GPT-3 ve ardıllarının tümü dilbilgisini, gerçekleri, çeviriyi ve akıl yürütmeyi yalnızca bir sonraki jetonu tahmin etmede çok iyi hale gelerek öğrendi.
Teknik Bilgi
Anahtar mekanizma nedensel (maskeli) öz-dikkattir: N konumunu tahmin ederken, model yalnızca 1'den N-1'e kadar olan konumlara ilgi gösterebilir, geleceğe asla ilgi göstermez. Çıkış katmanı, son gizli durumu sözlüğe yansıtır ve olasılıkları elde etmek için softmax'ı uygular. Eğitim, çapraz entropiyi en aza indirir, bu da gözlemlenen metnin olasılığını en üst düzeye çıkarmaya eşdeğerdir. Sıcaklık ve üst düzey p gibi örnekleme kontrolleri, yaratıcılığı güvenilirliğe karşı dengelemek için bu dağıtımı çıkarımda yeniden şekillendirir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Sonraki Token Tahmininin Geleceği
Sonraki belirteç tahmini, esas olarak tüm modern büyük dil modellerinin temelini oluşturur ve üretken yapay zekanın omurgası olmaya devam edecektir. Araştırma, bunu daha uzun bağlam pencereleri, hız için spekülatif ve paralel kod çözme ve aynı anda birden fazla gelecekteki tokenı tahmin eden çoklu token tahmin hedefleriyle genişletiyor. Çıktıları hizalamak için üstte insan geri bildirimi katmanlarından pekiştirmeli öğrenme. Sınır, aynı basit hedefi daha ucuz, daha hızlı ve daha büyük ölçekte daha kontrol edilebilir hale getiriyor.
Gerçek Dünya Uygulaması
ChatGPT ve benzeri yardımcıların, her seferinde bir jetonla konuşma yanıtları oluşturmasını sağlamak.
Siz yazarken GitHub Copilot gibi araçlarda otomatik tamamlama ve kod önerileri.
Kısa bir istemle e-posta, makale ve pazarlama metni taslağı hazırlamak.
Cümlelerinizi tamamlayan yazma yardımcılarında gerçek zamanlı metin oluşturma.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Çoklu Token Tahmin Eğitimi
Sık sorulan sorular
What is Next-Token Prediction?
Sonraki belirteç tahmini, GPT tarzı modellerin ardındaki aldatıcı derecede basit hedeftir: Şu ana kadar her şeyi göz önünde bulundurarak, bir sonraki metin parçasını tahmin edin. Milyarlarca kez tekrarlanan bu tek görev, yazan, akıl yürüten ve sohbet eden modeller üretir.
Bir sonraki jeton tahmin modeli her adımda ne çıktı verir?
Model, olası her bir sonraki jeton için bir olasılık üretir, ardından örnekleme veya açgözlü seçim yoluyla bir tanesi seçilir.
GPT tarzı bir kod çözücü hangi tür dikkati kullanır?
Nedensel maskeleme, N konumunun yalnızca kendisinden önceki konumları görebilmesini sağlayarak soldan sağa tahmin kurulumunu korur.
'Otoregresif' nesil burada ne anlama geliyor?
Otoregresif oluşturma bir belirteç üretir, onu bağlama ekler ve döngüyü tekrarlar.
Eğitim sırasında tipik olarak hangi kayıp fonksiyonu en aza indirilir?
Çapraz entropi, olasılığı en üst düzeye çıkarmaya eşdeğer olan gerçek bir sonraki jetona düşük olasılık ataması nedeniyle modeli cezalandırır.
Numune alma sırasında sıcaklığın yükseltilmesi ne işe yarar?
Daha yüksek sıcaklık olasılık dağılımını düzleştirerek rastgeleliği artırır; Daha düşük sıcaklık, seçimleri daha muhafazakar hale getirir.