Dil AI KILAVUZU

Sonraki Jeton Tahmini

Sonraki belirteç tahmini, GPT tarzı modellerin ardındaki aldatıcı derecede basit hedeftir: Şu ana kadar her şeyi göz önünde bulundurarak, bir sonraki metin parçasını tahmin edin.

2 min readSon güncelleme

Genel Bakış

Repeated billions of times, this single task produces models that write, reason, and converse.

Derin Dalış

Sonraki jeton tahmini, önceki tüm jetonlar göz önüne alındığında bir sonraki jetona olasılıkları atamak için bir modeli eğitir. Metin ilk önce bayt çifti kodlaması gibi bir belirteç tarafından belirteçlere (alt kelime parçalarına) bölünür. Yalnızca kod çözücüden oluşan bir Transformer, diziyi soldan sağa okur ve bir sonraki konum için tüm sözcük dağarcığı üzerinde bir olasılık dağılımı üretir. Eğitim sırasında modele büyük metin topluluğu gösterilir ve gerçek bir sonraki simgeye düşük olasılık atadığında cezalandırılır. Oluşturma zamanında, model bir jetonu örnekler veya açgözlülükle seçer, ekler ve bu döngüyü otoregresif olarak tekrarlar. Bu tek hedef dikkat çekici bir şekilde ölçekleniyor: GPT-2, GPT-3 ve ardıllarının tümü dilbilgisini, gerçekleri, çeviriyi ve akıl yürütmeyi yalnızca bir sonraki jetonu tahmin etmede çok iyi hale gelerek öğrendi.

Teknik Bilgi

Anahtar mekanizma nedensel (maskeli) öz-dikkattir: N konumunu tahmin ederken, model yalnızca 1'den N-1'e kadar olan konumlara ilgi gösterebilir, geleceğe asla ilgi göstermez. Çıkış katmanı, son gizli durumu sözlüğe yansıtır ve olasılıkları elde etmek için softmax'ı uygular. Eğitim, çapraz entropiyi en aza indirir, bu da gözlemlenen metnin olasılığını en üst düzeye çıkarmaya eşdeğerdir. Sıcaklık ve üst düzey p gibi örnekleme kontrolleri, yaratıcılığı güvenilirliğe karşı dengelemek için bu dağıtımı çıkarımda yeniden şekillendirir.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Sonraki Token Tahmininin Geleceği

Sonraki belirteç tahmini, esas olarak tüm modern büyük dil modellerinin temelini oluşturur ve üretken yapay zekanın omurgası olmaya devam edecektir. Araştırma, bunu daha uzun bağlam pencereleri, hız için spekülatif ve paralel kod çözme ve aynı anda birden fazla gelecekteki tokenı tahmin eden çoklu token tahmin hedefleriyle genişletiyor. Çıktıları hizalamak için üstte insan geri bildirimi katmanlarından pekiştirmeli öğrenme. Sınır, aynı basit hedefi daha ucuz, daha hızlı ve daha büyük ölçekte daha kontrol edilebilir hale getiriyor.

Gerçek Dünya Uygulaması

ChatGPT ve benzeri yardımcıların, her seferinde bir jetonla konuşma yanıtları oluşturmasını sağlamak.

Siz yazarken GitHub Copilot gibi araçlarda otomatik tamamlama ve kod önerileri.

Kısa bir istemle e-posta, makale ve pazarlama metni taslağı hazırlamak.

Cümlelerinizi tamamlayan yazma yardımcılarında gerçek zamanlı metin oluşturma.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Next-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Çoklu Token Tahmin Eğitimi

Sık sorulan sorular

What is Next-Token Prediction?

Sonraki belirteç tahmini, GPT tarzı modellerin ardındaki aldatıcı derecede basit hedeftir: Şu ana kadar her şeyi göz önünde bulundurarak, bir sonraki metin parçasını tahmin edin. Milyarlarca kez tekrarlanan bu tek görev, yazan, akıl yürüten ve sohbet eden modeller üretir.

Bir sonraki jeton tahmin modeli her adımda ne çıktı verir?

Model, olası her bir sonraki jeton için bir olasılık üretir, ardından örnekleme veya açgözlü seçim yoluyla bir tanesi seçilir.

GPT tarzı bir kod çözücü hangi tür dikkati kullanır?

Nedensel maskeleme, N konumunun yalnızca kendisinden önceki konumları görebilmesini sağlayarak soldan sağa tahmin kurulumunu korur.

'Otoregresif' nesil burada ne anlama geliyor?

Otoregresif oluşturma bir belirteç üretir, onu bağlama ekler ve döngüyü tekrarlar.

Eğitim sırasında tipik olarak hangi kayıp fonksiyonu en aza indirilir?

Çapraz entropi, olasılığı en üst düzeye çıkarmaya eşdeğer olan gerçek bir sonraki jetona düşük olasılık ataması nedeniyle modeli cezalandırır.

Numune alma sırasında sıcaklığın yükseltilmesi ne işe yarar?

Daha yüksek sıcaklık olasılık dağılımını düzleştirerek rastgeleliği artırır; Daha düşük sıcaklık, seçimleri daha muhafazakar hale getirir.