WordPiece Tokenizasyonu
WordPiece, BERT'e ve birçok Google modeline güç veren, kelimeleri yeniden kullanılabilir parçalara bölen, böylece bir modelin sabit bir kelime dağarcığına sahip herhangi bir metni işleyebilmesini sağlayan alt kelime tokenizasyon algoritmasıdır.
Genel Bakış
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Derin Dalış
WordPiece, tam kelimeler veya tek tek karakterler yerine alt kelime birimlerinden oluşan bir kelime dağarcığı oluşturur. Bireysel karakterlerden başlayarak, eğitim külliyatının olasılığını en çok artıran sembol çiftini açgözlülükle birleştirir ve hedef kelime büyüklüğüne ulaşana kadar tekrar eder (BERT yaklaşık 30.000 jeton kullanır). Çıkarımda, soldan sağa doğru tokenizasyon yapar, kelime dağarcığındaki en uzun alt kelimeyi eşleştirir ve geri kalanıyla devam eder. Bir kelimenin içindeki devam parçaları '##' önekiyle işaretlenir, dolayısıyla 'oynamak', 'oynamak' + '##ing' olur. Bu, kelime dağarcığı sorununu çözüyor: Nadir veya görülmeyen kelimeler, gerektiğinde tek karakterlere kadar bilinen parçalara ayrılıyor, ortak kelimeler ise verimlilik için tek belirteçler olarak kalıyor.
Teknik Bilgi
WordPiece, birleştirme kriteri açısından Bayt Çifti Kodlamadan farklıdır. BPE en sık görülen bitişik çifti birleştirir; WordPiece, kabaca eklem frekansı kendi parçalarının frekanslarının çarpımını en fazla aşan çifti seçerek, eğitim verisi olasılığını en üst düzeye çıkaran çifti birleştirir. '##' işareti, kelimenin başlangıç parçalarını devamlarından ayırarak, tokenizer'ın metne geri kod çözerken kelime sınırlarını net bir şekilde yeniden yapılandırmasına olanak tanır.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
WordPiece Tokenizasyonunun Geleceği
Daha yeni büyük dil modelleri, dile özgü ön işlemeyi ortadan kaldıran ve herhangi bir Unicode girişini işleyen bayt düzeyinde BPE (GPT ailesi) veya SentencePiece unigram modellerini giderek daha fazla tercih ediyor. WordPiece, arama ve sınıflandırma için hala yaygın olarak kullanılan BERT'den türetilmiş kodlayıcılarda temel olmaya devam ediyor. Sabit alt kelime dağarcığına olan bağımlılığı tamamen azaltabilecek tokenizer içermeyen bayt ve karakter modellerine yönelik araştırmaların yanı sıra, NLP üretiminde de kullanılmaya devam edilmesini bekliyoruz.
Gerçek Dünya Uygulaması
BERT, Google Arama'daki arama sorgularını tokenleştirir, alışılmadık terimleri alt kelimelere bölerek modelin yine de ilgili sayfalarla eşleşebilmesini sağlar.
Hugging Face'in BertTokenizer'ı, ham metni duygu analizi ve adlandırılmış varlık tanıma amacıyla BERT'e beslenen belirteç kimliklerine dönüştürmek için WordPiece'i kullanıyor.
Çok dilli BERT, 100'den fazla dilde paylaşılan bir WordPiece kelime dağarcığı kullanarak parçaların ilgili komut dosyalarında yeniden kullanılmasına olanak tanır.
DistilBERT ve klinik/biyomedikal BERT varyantları, 'pnömonokonyoz' gibi nadir tıbbi terimleri bilinen parçalara bölerek ele alan WordPiece'i devralmıştır.
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Alt Kelime Belirleme
Sık sorulan sorular
What is WordPiece Tokenization?
WordPiece, BERT'e ve birçok Google modeline güç veren, kelimeleri yeniden kullanılabilir parçalara bölen, böylece bir modelin sabit bir kelime dağarcığına sahip herhangi bir metni işleyebilmesini sağlayan alt kelime tokenizasyon algoritmasıdır. Bu nedenle hiç 'mutsuzluk' görmemiş bir model, bunu 'un', '##mutlu' ve '##ness' okuyarak anlayabilir.
WordPiece çıktısında '##' öneki neyi gösterir?
WordPiece, alt kelime devamlarını '##' ile işaretler, böylece 'oynama', 'oynama' + '##ing' olur ve kod çözücünün sözcük sınırlarını yeniden yapılandırmasına olanak tanır.
Orijinal BERT tarafından kullanılan WordPiece kelime dağarcığı kabaca ne kadardır?
BERT, yaklaşık 30.000 alt kelime biriminden oluşan bir WordPiece sözlüğü kullanır ve kapsamı, yerleştirme tablosu boyutuyla dengeler.
WordPiece'in birleştirme kriterinin standart Bayt Çifti Kodlamasından farkı nedir?
BPE, en sık görülen bitişik çifti birleştirir; WordPiece ise derlem olasılığını en çok artıran çifti birleştirir ve eklem frekansı kendi parçalarının çarpımını aşan çiftleri tercih eder.
WordPiece, eğitim sırasında hiç görülmeyen bir kelimeyi nasıl ele alır?
Görünmeyen kelimeler, bilinen en uzun eşleşen alt kelimelere bölünür ve tek karakterlere geri döner, bu da kelime dağarcığı sorununu çözer.
Çıkarım anında, WordPiece bir kelimenin nasıl bölüneceğini nasıl seçer?
WordPiece açgözlülükle tokenize olur, geçerli konumdan başlayan en uzun kelime girdisini eşleştirir ve ardından geri kalanda tekrar eder.