Tokenizacja WordPiece
WordPiece to algorytm tokenizacji podsłów, który obsługuje BERT i wiele modeli Google, dzieląc słowa na fragmenty nadające się do ponownego wykorzystania, dzięki czemu model może obsłużyć dowolny tekst ze stałym słownictwem.
Przegląd
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Głębokie nurkowanie
WordPiece buduje słownictwo składające się z jednostek podsłów, a nie całych słów lub pojedynczych znaków. Zaczynając od pojedynczych znaków, zachłannie łączy parę symboli, które najbardziej zwiększają prawdopodobieństwo korpusu szkoleniowego, powtarzając, aż osiągnie docelowy rozmiar słownictwa (BERT wykorzystuje około 30 000 tokenów). Podsumowując, tokenizuje zachłannie od lewej do prawej, dopasowując najdłuższe podsłowo w słowniku, a następnie kontynuując resztę. Kontynuacje wewnątrz słowa są oznaczone przedrostkiem „##”, więc „granie” staje się „graniem” + „##ing”. Rozwiązuje to problem braku słownictwa: rzadkie lub niewidoczne słowa po prostu rozkładają się na znane fragmenty, w razie potrzeby do pojedynczych znaków, podczas gdy popularne słowa pozostają pojedynczymi znacznikami dla zwiększenia wydajności.
Wgląd techniczny
WordPiece różni się od kodowania par bajtów kryterium łączenia. BPE łączy najczęstszą sąsiadującą parę; WordPiece łączy parę, która maksymalizuje prawdopodobieństwo danych szkoleniowych, z grubsza wybierając parę, której łączna częstotliwość najbardziej przekracza iloczyn częstotliwości jej części. Znacznik „##” odróżnia początkowe fragmenty słów od kontynuacji, umożliwiając tokenizatorowi jednoznaczne zrekonstruowanie granic słów podczas dekodowania z powrotem do tekstu.
Wpływ strategiczny
Szybkość i skala
Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.
Dostęp i zasięg
Rozszerza dostęp w różnych językach i stylach komunikacji.
Jaśniejsze decyzje
Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.
Przyszłość tokenizacji WordPiece
Nowsze modele dużych języków coraz częściej faworyzują modele unigramów BPE (rodzina GPT) na poziomie bajtów lub SentencePiece, które pozwalają uniknąć przetwarzania wstępnego specyficznego dla języka i obsługują dowolne dane wejściowe Unicode. WordPiece pozostaje podstawą koderów wywodzących się z BERT, które są nadal szeroko stosowane w wyszukiwaniu i klasyfikacji. Należy spodziewać się dalszego stosowania w produkcyjnym NLP, wraz z badaniami nad modelami bajtów i znaków pozbawionymi tokenizerów, co może ostatecznie całkowicie zmniejszyć zależność od stałych słowników podsłów.
Implementacja w świecie rzeczywistym
BERT tokenizuje zapytania w wyszukiwarce Google, dzieląc nieznane terminy na słowa podrzędne, dzięki czemu model nadal może dopasowywać odpowiednie strony.
BertTokenizer firmy Hugging Face wykorzystuje WordPiece do konwersji nieprzetworzonego tekstu na identyfikatory tokenów przekazywane BERT w celu analizy nastrojów i rozpoznawania nazwanych podmiotów.
Wielojęzyczny BERT używa wspólnego słownictwa WordPiece w ponad 100 językach, umożliwiając ponowne wykorzystanie fragmentów w powiązanych skryptach.
DistilBERT i kliniczne/biomedyczne warianty BERT dziedziczą WordPiece, obsługując rzadkie terminy medyczne, takie jak „pylica płuc”, dzieląc je na znane części.
Zagrożenia i poręcze
Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.
Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.
Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.
Plan wdrożenia
Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.
Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.
Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.
Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Tokenizacja podsłowa
Często zadawane pytania
What is WordPiece Tokenization?
WordPiece to algorytm tokenizacji podsłów, który obsługuje BERT i wiele modeli Google, dzieląc słowa na fragmenty nadające się do ponownego wykorzystania, dzięki czemu model może obsłużyć dowolny tekst ze stałym słownictwem. Dlatego modelka, która nigdy nie widziała „nieszczęścia”, może je zrozumieć, czytając słowa „un”, „##happy” i „##ness”.
Co oznacza przedrostek „##” w wynikach programu WordPiece?
WordPiece oznacza kontynuacje podsłów za pomocą „##”, więc „odtwarzanie” staje się „odtwarzaniem” + „##ing”, pozwalając dekoderowi zrekonstruować granice słów.
Mniej więcej, jak duże jest słownictwo WordPiece używane przez oryginalny BERT?
BERT używa słownictwa WordPiece składającego się z około 30 000 jednostek podsłów, równoważąc pokrycie z rozmiarem tabeli do osadzania.
Czym kryterium scalania programu WordPiece różni się od standardowego kodowania par bajtów?
BPE łączy najczęstszą sąsiadującą parę, podczas gdy WordPiece łączy parę, która najbardziej zwiększa prawdopodobieństwo korpusu, faworyzując pary, których łączna częstotliwość przekracza iloczyn ich części.
Jak WordPiece radzi sobie ze słowem, którego nigdy nie widziano podczas szkolenia?
Niewidoczne słowa są dzielone na najdłuższe pasujące znane podsłowa, cofając się do pojedynczych znaków, co rozwiązuje problem braku słownika.
W jaki sposób WordPiece wybiera sposób podziału słowa w momencie wnioskowania?
WordPiece tokenizuje zachłannie, dopasowując najdłuższy wpis słownictwa, zaczynając od bieżącej pozycji, a następnie powtarzając na pozostałej części.