Maskeli Dil Modelleme
Maskeli dil modelleme, yapay zekaya kasıtlı olarak gizlenmiş kelimeleri, hem sol hem de sağ çevredeki tüm bağlamı kullanarak doldurmayı öğretir.
Genel Bakış
It's the training trick behind BERT and the reason models can deeply understand sentence meaning rather than just predict what comes next.
Derin Dalış
Maskeli dil modellemede (MLM), bir cümle alırsınız, jetonlarının yaklaşık %15'ini özel bir [MASK] sembolüyle rastgele gizlersiniz ve modeli orijinalleri tahmin edecek şekilde eğitirsiniz. Model, her bir boşluğun her iki tarafında da sözcükleri gördüğünden, iki yönlü bir bağlam anlayışı oluşturur. Google tarafından 2018'de tanıtılan BERT bunu popüler hale getirdi. Akıllıca bir ayrıntı: maskelenen konumların kabaca %80'i [MASK] olur, %10'u rastgele bir kelimeyle değiştirilir ve %10'u değişmeden kalır. Bu, modelin yalnızca tahmin zamanında bir [MASK] belirteci beklemesini önler ve sağlamlığı zorlar. Bu ön eğitimin ardından modelde sınıflandırma, soru yanıtlama ve adlandırılmış varlık tanıma gibi görevler için ince ayar yapılır.
Teknik Bilgi
MLM, çift yönlü öz-dikkatli bir Transformer kodlayıcı kullanır, böylece her jeton diğerleriyle aynı anda ilgilenir. Kayıp, yalnızca gerçek belirteç kimliklerine karşı çapraz entropi kullanılarak maskelenmiş konumlarda hesaplanır. Dikkat nedensel olmadığından (gelecekteki maskeleme olmadığından), her kelimenin temsili sol ve sağ bağlamı tek bir yoğun vektörde birleştirir. Bu çift yönlülük, tam olarak sonraki token modellerinin üretme yeteneğinden vazgeçtiği şeydir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Maskeli Dil Modellemesinin Geleceği
Saf MLM, sohbet robotlarına yönelik üretken kod çözücü modelleri tarafından kısmen gölgede bırakıldı, ancak anlamanın oluşturmayı geride bıraktığı yerleştirme, erişim ve sınıflandırma konularında baskın olmaya devam ediyor. ELECTRA'nın değiştirilmiş jeton tespiti RoBERTa ve DeBERTa gibi varyantlar doğruluk ve verimliliği artırmaya devam ediyor. MLM tarzı kodlayıcıların arama, anlamsal benzerlik ve hızlı, derin anlamanın serbest biçimli metinden daha önemli olduğu, daha büyük erişimle zenginleştirilmiş ve çok modlu sistemlerde hafif bileşenler olarak merkezi kalmasını bekleyin.
Gerçek Dünya Uygulaması
Daha alakalı sayfalar döndürmek için Google Arama'nın konuşma sorgularına ilişkin BERT tabanlı anlayışını güçlendiriyoruz.
Anlamsal arama ve belge erişim sistemleri için cümle yerleştirmeleri oluşturma.
Ürün incelemeleri veya destek bildirimlerinde duyarlılık analizi için BERT'de ince ayar yapılması.
Yasal veya tıbbi metinlerden kişileri, kuruluşları ve tarihleri ayıklayan adlandırılmış varlık tanıma.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Masked Language Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Dil Modelleme
Sık sorulan sorular
What is Masked Language Modeling?
Maskeli dil modelleme, yapay zekaya kasıtlı olarak gizlenmiş kelimeleri, hem sol hem de sağ çevredeki tüm bağlamı kullanarak doldurmayı öğretir. Bu, BERT'in arkasındaki eğitim hilesidir ve modellerin, bir sonraki adımı tahmin etmek yerine cümlenin anlamını derinlemesine anlayabilmesinin nedenidir.
Maskeli dil modellemede temel eğitim görevi nedir?
MLM, jetonların bir kısmını gizler ve modeli hem sol hem de sağ bağlamı kullanarak bunları kurtaracak şekilde eğitir.
BERT genellikle ön eğitim sırasında jetonların yaklaşık yüzde kaçını maskeliyor?
BERT, yeterli sinyal verme ile yeterli bağlamı bırakma arasındaki dengeyi sağlayarak giriş tokenlarının yaklaşık %15'ini maskeler.
MLM neden bir modele çift yönlü anlayış sağlıyor?
Transformer kodlayıcı nedensel olmayan öz-dikkati kullanır, böylece her jeton her iki taraftaki diğerlerini görebilir.
BERT'in maskeleme planında, [MASK] olmak yerine seçilen konumların yaklaşık %10'una ne olur?
Sağlamlığı artırmak için maskelenmiş konumların %10'u rastgele bir jetonla değiştirilir ve %10'u değişmeden kalır.
MLM kaybı hangi pozisyonlarda hesaplanır?
Çapraz entropi kaybı, tahminleri orijinal token kimlikleriyle karşılaştırarak yalnızca maskelenmiş konumlara uygulanır.