WordPiece-tokenisering
WordPiece är underordstokeniseringsalgoritmen som driver BERT och många Google-modeller, och delar upp ord i återanvändbara fragment så att en modell kan hantera vilken text som helst med ett fast ordförråd.
Översikt
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Djupdykning
WordPiece bygger en vokabulär av underordsenheter snarare än hela ord eller enstaka tecken. Med utgångspunkt från individuella tecken slår den girigt ihop det symbolpar som mest ökar sannolikheten för träningskorpusen, och upprepas tills den når en målstorlek för ordförråd (BERT använder cirka 30 000 tokens). Vid slutledning tokeniserar det girigt från vänster till höger, matchar det längsta underordet i vokabulären, och fortsätter sedan på resten. Fortsättningsbitar inuti ett ord är markerade med ett '##'-prefix, så 'playing' blir 'play' + '##ing'. Detta löser problemet utanför ordförrådet: sällsynta eller osynliga ord bryts helt enkelt ned i kända fragment, ner till enstaka tecken om det behövs, medan vanliga ord förblir som enstaka symboler för effektiviteten.
Teknisk insikt
WordPiece skiljer sig från Byte-Pair Encoding i sitt sammanslagningskriterium. BPE slår samman det vanligaste intilliggande paret; WordPiece slår samman det par som maximerar sannolikheten för träningsdata, och väljer ungefär det par vars gemensamma frekvens mest överstiger produkten av dess delars frekvenser. '##'-markören skiljer ord-initialbitar från fortsättningar, och låter tokenizern rekonstruera ordgränser entydigt när den avkodar tillbaka till text.
Strategisk inverkan
Speed and scale
Språkarbetsflöden kan gå snabbare utan att offra konsekvens.
Access and reach
Det utökar åtkomsten över språk och kommunikationsstilar.
Clearer decisions
Team kan lägga mer tid på bedömning medan automatisering hanterar upprepning.
Framtiden för WordPiece-tokenisering
Nyare stora språkmodeller gynnar alltmer byte-nivå BPE (GPT family) eller SentencePiece unigram-modeller, som undviker språkspecifik förbearbetning och hanterar all Unicode-inmatning. WordPiece är fortfarande grundläggande i BERT-härledda kodare som fortfarande är allmänt distribuerade för sökning och klassificering. Förvänta dig fortsatt användning i produktion av NLP, tillsammans med forskning om tokenizer-fria byte- och karaktärsmodeller som så småningom kan minska beroendet av fasta underordsordförråd helt och hållet.
Real-World Implementation
BERT tokeniserar sökfrågor i Google Sök, delar upp okända termer i underord så att modellen fortfarande kan matcha relevanta sidor.
Hugging Faces BertTokenizer använder WordPiece för att konvertera rå text till de token-ID:n som matas till BERT för sentimentanalys och namngivna enheter.
Flerspråkig BERT använder ett delat WordPiece-ordförråd över 100+ språk, vilket gör att fragment kan återanvändas över relaterade skript.
DistilBERT och kliniska/biomedicinska BERT-varianter ärver WordPiece och hanterar sällsynta medicinska termer som "pneumonokonios" genom att dela upp dem i kända delar.
Risker & skyddsräcken
Hallucinerade fakta kan tyst lägga in rapporter, stödflöden eller forskningsresultat.
Snabb känslighet kan skapa inkonsekventa resultat över liknande förfrågningar.
Känsliga textdata kan exponeras om åtkomstkontrollerna är svaga.
Färdplan för genomförande
Definiera utdataformat, ton och kvalitetsstandarder innan lansering.
Marksvar med pålitliga källor närhelst noggrannhet är viktig.
Håll en kontrollpunkt för mänsklig granskning för höga insatser.
Spåra felmönster och träna om uppmaningar eller arbetsflöden regelbundet.
Fortsätt utforska
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Subword Tokenization
Frequently asked questions
What is WordPiece Tokenization?
WordPiece är underordstokeniseringsalgoritmen som driver BERT och många Google-modeller, och delar upp ord i återanvändbara fragment så att en modell kan hantera vilken text som helst med ett fast ordförråd. Det är därför en modell som aldrig har sett "olycka" fortfarande kan förstå det genom att läsa "un", "##happy" och "##ness".
Vad anger prefixet '##' i WordPiece-utdata?
WordPiece markerar underordsfortsättningar med '##', så 'playing' blir 'play' + '##ing', vilket låter avkodaren rekonstruera ordgränser.
Ungefär hur stort är WordPiece-ordförrådet som används av den ursprungliga BERT?
BERT använder ett WordPiece-vokabulär med ungefär 30 000 underordsenheter, vilket balanserar täckning mot storleken på inbäddningstabellen.
Hur skiljer sig WordPieces sammanslagningskriterium från standardbyteparkodning?
BPE slår samman det vanligaste intilliggande paret, medan WordPiece slår samman det par som mest ökar corpussannolikheten, och gynnar par vars gemensamma frekvens överstiger produkten av deras delar.
Hur hanterar WordPiece ett ord som aldrig setts under träning?
Osynliga ord delas upp i de längsta matchande kända underorden, och faller tillbaka till enstaka tecken, vilket löser problemet med out-of-vokabulär.
Hur väljer WordPiece hur ett ord ska delas vid slutledningstidpunkt?
WordPiece tokeniserar girigt, matchar den längsta vokabulärposten från den aktuella positionen och upprepar sedan resten.