Dil AI KILAVUZU

WordPiece Tokenizasyonu

WordPiece, BERT'e ve birçok Google modeline güç veren, kelimeleri yeniden kullanılabilir parçalara bölen, böylece bir modelin sabit bir kelime dağarcığına sahip herhangi bir metni işleyebilmesini sağlayan alt kelime tokenizasyon algoritmasıdır.

2 min readSon güncelleme

Genel Bakış

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Derin Dalış

WordPiece, tam kelimeler veya tek tek karakterler yerine alt kelime birimlerinden oluşan bir kelime dağarcığı oluşturur. Bireysel karakterlerden başlayarak, eğitim külliyatının olasılığını en çok artıran sembol çiftini açgözlülükle birleştirir ve hedef kelime büyüklüğüne ulaşana kadar tekrar eder (BERT yaklaşık 30.000 jeton kullanır). Çıkarımda, soldan sağa doğru tokenizasyon yapar, kelime dağarcığındaki en uzun alt kelimeyi eşleştirir ve geri kalanıyla devam eder. Bir kelimenin içindeki devam parçaları '##' önekiyle işaretlenir, dolayısıyla 'oynamak', 'oynamak' + '##ing' olur. Bu, kelime dağarcığı sorununu çözüyor: Nadir veya görülmeyen kelimeler, gerektiğinde tek karakterlere kadar bilinen parçalara ayrılıyor, ortak kelimeler ise verimlilik için tek belirteçler olarak kalıyor.

Teknik Bilgi

WordPiece, birleştirme kriteri açısından Bayt Çifti Kodlamadan farklıdır. BPE en sık görülen bitişik çifti birleştirir; WordPiece, kabaca eklem frekansı kendi parçalarının frekanslarının çarpımını en fazla aşan çifti seçerek, eğitim verisi olasılığını en üst düzeye çıkaran çifti birleştirir. '##' işareti, kelimenin başlangıç ​​parçalarını devamlarından ayırarak, tokenizer'ın metne geri kod çözerken kelime sınırlarını net bir şekilde yeniden yapılandırmasına olanak tanır.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

WordPiece Tokenizasyonunun Geleceği

Daha yeni büyük dil modelleri, dile özgü ön işlemeyi ortadan kaldıran ve herhangi bir Unicode girişini işleyen bayt düzeyinde BPE (GPT ailesi) veya SentencePiece unigram modellerini giderek daha fazla tercih ediyor. WordPiece, arama ve sınıflandırma için hala yaygın olarak kullanılan BERT'den türetilmiş kodlayıcılarda temel olmaya devam ediyor. Sabit alt kelime dağarcığına olan bağımlılığı tamamen azaltabilecek tokenizer içermeyen bayt ve karakter modellerine yönelik araştırmaların yanı sıra, NLP üretiminde de kullanılmaya devam edilmesini bekliyoruz.

Gerçek Dünya Uygulaması

BERT, Google Arama'daki arama sorgularını tokenleştirir, alışılmadık terimleri alt kelimelere bölerek modelin yine de ilgili sayfalarla eşleşebilmesini sağlar.

Hugging Face'in BertTokenizer'ı, ham metni duygu analizi ve adlandırılmış varlık tanıma amacıyla BERT'e beslenen belirteç kimliklerine dönüştürmek için WordPiece'i kullanıyor.

Çok dilli BERT, 100'den fazla dilde paylaşılan bir WordPiece kelime dağarcığı kullanarak parçaların ilgili komut dosyalarında yeniden kullanılmasına olanak tanır.

DistilBERT ve klinik/biyomedikal BERT varyantları, 'pnömonokonyoz' gibi nadir tıbbi terimleri bilinen parçalara bölerek ele alan WordPiece'i devralmıştır.

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Alt Kelime Belirleme

Sık sorulan sorular

What is WordPiece Tokenization?

WordPiece, BERT'e ve birçok Google modeline güç veren, kelimeleri yeniden kullanılabilir parçalara bölen, böylece bir modelin sabit bir kelime dağarcığına sahip herhangi bir metni işleyebilmesini sağlayan alt kelime tokenizasyon algoritmasıdır. Bu nedenle hiç 'mutsuzluk' görmemiş bir model, bunu 'un', '##mutlu' ve '##ness' okuyarak anlayabilir.

WordPiece çıktısında '##' öneki neyi gösterir?

WordPiece, alt kelime devamlarını '##' ile işaretler, böylece 'oynama', 'oynama' + '##ing' olur ve kod çözücünün sözcük sınırlarını yeniden yapılandırmasına olanak tanır.

Orijinal BERT tarafından kullanılan WordPiece kelime dağarcığı kabaca ne kadardır?

BERT, yaklaşık 30.000 alt kelime biriminden oluşan bir WordPiece sözlüğü kullanır ve kapsamı, yerleştirme tablosu boyutuyla dengeler.

WordPiece'in birleştirme kriterinin standart Bayt Çifti Kodlamasından farkı nedir?

BPE, en sık görülen bitişik çifti birleştirir; WordPiece ise derlem olasılığını en çok artıran çifti birleştirir ve eklem frekansı kendi parçalarının çarpımını aşan çiftleri tercih eder.

WordPiece, eğitim sırasında hiç görülmeyen bir kelimeyi nasıl ele alır?

Görünmeyen kelimeler, bilinen en uzun eşleşen alt kelimelere bölünür ve tek karakterlere geri döner, bu da kelime dağarcığı sorununu çözer.

Çıkarım anında, WordPiece bir kelimenin nasıl bölüneceğini nasıl seçer?

WordPiece açgözlülükle tokenize olur, geçerli konumdan başlayan en uzun kelime girdisini eşleştirir ve ardından geri kalanda tekrar eder.