Dil Modelleme
Dil modelleme, metne o ana kadar bakıldığında hangi kelimenin veya belirtecin geleceğini tahmin etme gibi aldatıcı derecede basit bir görevdir.
Genel Bakış
This single objective, scaled up massively, is what produces today's powerful chatbots and writing assistants.
Derin Dalış
Bir dil modeli özünde metin dizilerine olasılıklar atar. 'Fransa'nın başkenti' istemi göz önüne alındığında, bir sonraki olası tokenin ne kadar muhtemel olduğunu ve 'Paris'in yüksek puan alması gerektiğini tahmin ediyor. İlk dil modelleri, kelime dizilerinin ne sıklıkta göründüğünü sayan istatistiksel n-gramlardı, ancak uzun bağlam ve görünmeyen ifadelerle mücadele ediyorlardı. Nöral dil modelleri, saymanın yerini öğrenilmiş temsillerle değiştirdi ve 2017'deki transformatör mimarisi, modellerin uzun metinlerle verimli bir şekilde ilgilenmesine olanak tanıdı. GPT ailesi gibi modern büyük dil modelleri, tek bir amaç için devasa metin bütünleri üzerinde eğitilir: bir sonraki jetonu tahmin etmek. Dikkat çekici bir şekilde, bunu iyi bir şekilde yapmak modeli dilbilgisini, gerçekleri, akıl yürütme kalıplarını ve stili özümsemeye zorlar çünkü metni doğru bir şekilde tahmin etmek onu anlamayı gerektirir. Üretim, bir sonraki jetonu tekrar tekrar tahmin ederek ve onu geri besleyerek çalışır.
Teknik Bilgi
Modern dil modellerinin çoğu otoregresiftir: Bir cümlenin olasılığını sonraki belirteç olasılıklarının bir çarpımı olarak hesaba katarlar ve her seferinde bir belirteci soldan sağa tahmin ederler. Eğitim, çapraz entropi kaybını en aza indirir, bu da eğitim metnindeki gerçek bir sonraki jetona yüksek olasılık atamayı ödüllendirir. Bu kendi kendine denetlenir, etiketler metnin kendisinden bağımsız olarak gelir, dolayısıyla hiçbir insan açıklamasına gerek yoktur. Üretim zamanında sıcaklık, üst-k ve üst-p (çekirdek) gibi örnekleme stratejileri, öngörülebilir ve yaratıcı çıktılar arasındaki dengeyi kontrol eder.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Dil Modellemenin Geleceği
Sonraki token tahmininin şaşırtıcı derecede güçlü olduğu kanıtlandı ve ölçeklendirme yasaları, kazanımlar yavaşlasa ve yüksek kaliteli veriler azalsa da, daha büyük modellerin ve daha fazla verinin kapasiteyi geliştirmeye devam ettiğini gösteriyor. Sınır, akıl yürütmeye, daha uzun bağlam pencerelerine ve temel model oluşturulduktan sonra davranışı şekillendiren insan geri bildirimlerinden takviyeli öğrenme gibi eğitim sonrası yöntemlere doğru kayıyor. Temel bir sonraki jetonu tahmin etme hedefi diğer her şeyin üzerine inşa edildiği temel olmaya devam ederken, dil modellemenin araçlar, erişim ve çok modlu girdilerle harmanlanmaya devam etmesini bekliyoruz.
Gerçek Dünya Uygulaması
Telefonunuzun klavyesinde veya e-postanızda, siz yazarken bir sonraki kelimeyi öneren otomatik tamamlama
ChatGPT gibi bir sohbet robotu, bir sonraki jetonu tekrar tekrar tahmin ederek akıcı bir yanıt üretiyor
GitHub Copilot gibi kod editörleri, çevredeki bağlamdan sonraki kod satırını tahmin ediyor
Benzer ses seçenekleri arasından en makul transkripsiyonu seçmek için bir dil modeli kullanan konuşma tanıma sistemleri
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Maskeli Dil Modelleme
Sık sorulan sorular
What is Language Modeling?
Dil modelleme, metne o ana kadar bakıldığında hangi kelimenin veya belirtecin geleceğini tahmin etme gibi aldatıcı derecede basit bir görevdir. Büyük ölçüde büyütülmüş bu tek hedef, günümüzün güçlü sohbet robotlarını ve yazma asistanlarını üreten şeydir.
Bir dil modelinin gerçekleştirdiği temel görev nedir?
Bir dil modeli, bir dizide bir sonraki şeyin olasılığını tahmin eder ve nesil, bir sonraki belirteci tekrar tekrar tahmin ederek ve ekleyerek çalışır.
İlk n-gram dil modellerinin temel sınırlaması neydi?
N-gram modelleri kısa kelime dizilerini saymaya dayanıyordu, bu nedenle uzun vadeli bağlamı zayıf bir şekilde ele aldılar ve daha önce hiç görmedikleri ifadelerde başarısız oldular.
Dil modeli eğitimine neden 'kendi kendini denetleyen' deniyor?
Doğru sonraki belirteç metinde zaten mevcut olduğundan model, manuel açıklama gerekmeden kendi hedeflerini oluşturur.
Bir dil modeli için 'otoregresif' ne anlama gelir?
Otoregresif modeller, her yeni tahmini o ana kadar oluşturulan her şeye göre koşullandırarak, simge bazında metin belirteci üretir.
Bir dil modelini eğitmek için genellikle hangi kayıp işlevi kullanılır?
Eğitim, çapraz entropiyi en aza indirir ve modeli, eğitim metninde gözlemlenen gerçek bir sonraki jetona yüksek olasılık atadığı için ödüllendirir.