PRZEWODNIK Językowy AI

Tokenizacja WordPiece

WordPiece to algorytm tokenizacji podsłów, który obsługuje BERT i wiele modeli Google, dzieląc słowa na fragmenty nadające się do ponownego wykorzystania, dzięki czemu model może obsłużyć dowolny tekst ze stałym słownictwem.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Głębokie nurkowanie

WordPiece buduje słownictwo składające się z jednostek podsłów, a nie całych słów lub pojedynczych znaków. Zaczynając od pojedynczych znaków, zachłannie łączy parę symboli, które najbardziej zwiększają prawdopodobieństwo korpusu szkoleniowego, powtarzając, aż osiągnie docelowy rozmiar słownictwa (BERT wykorzystuje około 30 000 tokenów). Podsumowując, tokenizuje zachłannie od lewej do prawej, dopasowując najdłuższe podsłowo w słowniku, a następnie kontynuując resztę. Kontynuacje wewnątrz słowa są oznaczone przedrostkiem „##”, więc „granie” staje się „graniem” + „##ing”. Rozwiązuje to problem braku słownictwa: rzadkie lub niewidoczne słowa po prostu rozkładają się na znane fragmenty, w razie potrzeby do pojedynczych znaków, podczas gdy popularne słowa pozostają pojedynczymi znacznikami dla zwiększenia wydajności.

Wgląd techniczny

WordPiece różni się od kodowania par bajtów kryterium łączenia. BPE łączy najczęstszą sąsiadującą parę; WordPiece łączy parę, która maksymalizuje prawdopodobieństwo danych szkoleniowych, z grubsza wybierając parę, której łączna częstotliwość najbardziej przekracza iloczyn częstotliwości jej części. Znacznik „##” odróżnia początkowe fragmenty słów od kontynuacji, umożliwiając tokenizatorowi jednoznaczne zrekonstruowanie granic słów podczas dekodowania z powrotem do tekstu.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość tokenizacji WordPiece

Nowsze modele dużych języków coraz częściej faworyzują modele unigramów BPE (rodzina GPT) na poziomie bajtów lub SentencePiece, które pozwalają uniknąć przetwarzania wstępnego specyficznego dla języka i obsługują dowolne dane wejściowe Unicode. WordPiece pozostaje podstawą koderów wywodzących się z BERT, które są nadal szeroko stosowane w wyszukiwaniu i klasyfikacji. Należy spodziewać się dalszego stosowania w produkcyjnym NLP, wraz z badaniami nad modelami bajtów i znaków pozbawionymi tokenizerów, co może ostatecznie całkowicie zmniejszyć zależność od stałych słowników podsłów.

Implementacja w świecie rzeczywistym

BERT tokenizuje zapytania w wyszukiwarce Google, dzieląc nieznane terminy na słowa podrzędne, dzięki czemu model nadal może dopasowywać odpowiednie strony.

BertTokenizer firmy Hugging Face wykorzystuje WordPiece do konwersji nieprzetworzonego tekstu na identyfikatory tokenów przekazywane BERT w celu analizy nastrojów i rozpoznawania nazwanych podmiotów.

Wielojęzyczny BERT używa wspólnego słownictwa WordPiece w ponad 100 językach, umożliwiając ponowne wykorzystanie fragmentów w powiązanych skryptach.

DistilBERT i kliniczne/biomedyczne warianty BERT dziedziczą WordPiece, obsługując rzadkie terminy medyczne, takie jak „pylica płuc”, dzieląc je na znane części.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is WordPiece Tokenization?

WordPiece to algorytm tokenizacji podsłów, który obsługuje BERT i wiele modeli Google, dzieląc słowa na fragmenty nadające się do ponownego wykorzystania, dzięki czemu model może obsłużyć dowolny tekst ze stałym słownictwem. Dlatego modelka, która nigdy nie widziała „nieszczęścia”, może je zrozumieć, czytając słowa „un”, „##happy” i „##ness”.

Co oznacza przedrostek „##” w wynikach programu WordPiece?

WordPiece oznacza kontynuacje podsłów za pomocą „##”, więc „odtwarzanie” staje się „odtwarzaniem” + „##ing”, pozwalając dekoderowi zrekonstruować granice słów.

Mniej więcej, jak duże jest słownictwo WordPiece używane przez oryginalny BERT?

BERT używa słownictwa WordPiece składającego się z około 30 000 jednostek podsłów, równoważąc pokrycie z rozmiarem tabeli do osadzania.

Czym kryterium scalania programu WordPiece różni się od standardowego kodowania par bajtów?

BPE łączy najczęstszą sąsiadującą parę, podczas gdy WordPiece łączy parę, która najbardziej zwiększa prawdopodobieństwo korpusu, faworyzując pary, których łączna częstotliwość przekracza iloczyn ich części.

Jak WordPiece radzi sobie ze słowem, którego nigdy nie widziano podczas szkolenia?

Niewidoczne słowa są dzielone na najdłuższe pasujące znane podsłowa, cofając się do pojedynczych znaków, co rozwiązuje problem braku słownika.

W jaki sposób WordPiece wybiera sposób podziału słowa w momencie wnioskowania?

WordPiece tokenizuje zachłannie, dopasowując najdłuższy wpis słownictwa, zaczynając od bieżącej pozycji, a następnie powtarzając na pozostałej części.