Alt Kelime Belirleme
Alt kelime tokenizasyonu, metni kelimelerden daha küçük ancak karakterlerden daha büyük birimlere ('token' artı 'ization' gibi) böler.
Genel Bakış
It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.
Derin Dalış
Kelimeler sayılamayacak kadar çoktur (kelime dağarcığı çok büyük olur ve nadir kelimeleri kaçırır), tek tek karakterler ise çok az anlam taşır ve dizileri çok uzun hale getirir. Alt kelime tokenizasyonu bir uzlaşmadır: sık kullanılan kelimeleri bütün olarak tutar ancak nadir veya karmaşık kelimeleri anlamlı parçalara ayırır. 'Mutsuzluk', 'un', 'mutluluk', 'ness' haline gelebilir. Başlıca algoritmalar arasında Bayt Çifti Kodlama (GPT tarafından kullanılır), WordPiece (BERT tarafından kullanılır) ve Unigram/SentencePiece (T5 ve birçok çok dilli model tarafından kullanılır) bulunur. Bu yaklaşım, görünmeyen sözcükleri zarif bir şekilde ele alır, ilgili sözcükler ('oynamak', 'oynamak', 'oynatıldı') arasında parçalar paylaşır ve her dili destekler. Her parça bir tamsayı kimliğine eşlenir ve bu kimlikler, modelin yerleştirme katmanının vektörlere dönüştürdüğü şeydir.
Teknik Bilgi
Farklı algoritmalar alt kelimeleri farklı şekilde seçer: BPE sık görülen çiftleri aşağıdan yukarıya doğru birleştirir, WordPiece derlem olasılığını en çok artıran birleştirmeleri seçer ve Unigram geniş bir kelime dağarcığıyla başlar ve olasılığa en az zarar veren belirteçleri eritir. WordPiece, sözcük içindeki parçaları '##' önekiyle işaretlerken, SentencePiece boşlukları özel bir sembol olarak ele alır, böylece boşlukları önceden bölmeden doğrudan ham metin üzerinde çalışır; boşluk içermeyen diller için idealdir.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Alt Kelime Belirlemenin Geleceği
Alt kelime tokenizasyonu hızlı ve kompakt olduğu için baskın olmaya devam edecek, ancak zayıf yönleri, matematik, kod ve nadir komut dosyalarındaki garip bölünmeler ve ayrıca diller arasındaki eşit olmayan token maliyetleri, araştırmaları bayt düzeyinde ve token içermeyen modellere yönlendiriyor. İngilizce olmayan metinlerin cümle başına çok daha fazla belirteçle cezalandırılmaması için daha akıllı, muhtemelen öğrenilmiş veya uyarlanabilir belirteçler ve daha iyi çok dilli adalet bekleyebilirsiniz.
Gerçek Dünya Uygulaması
BERT, orijinal kelimeleri yeniden oluşturmak için '##ing' gibi devam parçalarını işaretleyerek WordPiece tokenizasyonunu kullanır.
T5 ve birçok çok dilli model, Japonca gibi boşluksuz dilleri doğrudan işleyen SentencePiece'i kullanır.
Sohbet modelleri, bilinmeyen bir kelimede başarısız olmak yerine, nadir bir teknik terimi bilinen parçalara böler.
Belirteçler 'koşmak', 'koşmak' ve 'koşucu' genelinde alt sözcükleri paylaşarak modelin morfolojiyi verimli bir şekilde genelleştirmesine olanak tanır.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Cümle Parçası Tokenizasyonu
Sık sorulan sorular
What is Subword Tokenization?
Alt kelime tokenizasyonu, metni kelimelerden daha küçük ancak karakterlerden daha büyük birimlere ('token' artı 'ization' gibi) böler. Bu, modern dil modellerinin, kelime boyutunu anlamla dengeleyerek metni gerçekte işledikleri ayrı kimliklere dönüştürmesinin standart yoludur.
Alt kelime tokenizasyonu, tam kelimelerin kullanılmasıyla karşılaştırıldığında hangi sorunu çözer?
Tam kelimeden oluşan kelime dağarcığı çok büyüktür ve yine de nadir kelimeleri kaçırır; alt kelimeler kelime dağarcığını yönetilebilir tutar ve bilinmeyen kelimeleri zarif bir şekilde böler.
Bunlardan hangisi BERT tarafından kullanılan bir alt kelime tokenizasyon algoritmasıdır?
BERT, eğitim derlem olasılığını en fazla artıran birleştirmeleri seçen WordPiece'i kullanır.
WordPiece genellikle bir kelimenin devamı olan bir parçayı nasıl işaretler?
WordPiece, kelime içi alt kelimelerin önüne '##' ekler, böylece 'oynamak', 'oynamak' artı '##ing' olur.
SentencePiece neden Japonca gibi dillere çok uygundur?
SentencePiece ham metin üzerinde çalışır ve boşlukları özel bir sembol olarak kodlar, böylece kelimeler arasında boşluk olmadan bile çalışır.
Her bir alt kelime parçası, modele ulaşmadan önce sonuçta neyle eşleşir?
Her alt kelimeye, gömme katmanının modelin işleyebileceği bir vektöre dönüştürdüğü bir tamsayı kimliği atanır.