Woordstuk-tokenisatie
WordPiece is het subwoord-tokenisatie-algoritme dat BERT en vele Google-modellen aanstuurt, waarbij woorden in herbruikbare fragmenten worden gesplitst, zodat een model elke tekst met een vaste woordenschat kan verwerken.
Overzicht
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Diepe duik
WordPiece bouwt een vocabulaire op van subwoordeenheden in plaats van hele woorden of afzonderlijke tekens. Beginnend met individuele karakters, voegt het gretig het paar symbolen samen dat de waarschijnlijkheid van het trainingscorpus het meest vergroot, en herhaalt het totdat het een beoogde woordenschatgrootte bereikt (BERT gebruikt ongeveer 30.000 tokens). Bij gevolgtrekking tokeniseert het gretig van links naar rechts, waarbij het langste subwoord in de woordenschat overeenkomt, en gaat dan verder met de rest. Vervolgstukken binnen een woord zijn gemarkeerd met een '##'-voorvoegsel, dus 'spelen' wordt 'spelen' + '##ing'. Dit lost het probleem van de woordenschat op: zeldzame of onzichtbare woorden vallen eenvoudigweg uiteen in bekende fragmenten, indien nodig tot enkele tekens, terwijl gewone woorden als afzonderlijke tekens blijven bestaan voor de efficiëntie.
Technisch inzicht
WordPiece verschilt van Byte-Pair Encoding wat betreft het samenvoegcriterium. BPE voegt het meest voorkomende aangrenzende paar samen; WordPiece voegt het paar samen dat de waarschijnlijkheid van trainingsgegevens maximaliseert, waarbij grofweg het paar wordt gekozen waarvan de gezamenlijke frequentie het product van de frequenties van de onderdelen het meest overschrijdt. De '##'-markering onderscheidt woordbeginstukken van voortzettingen, waardoor de tokenizer woordgrenzen ondubbelzinnig kan reconstrueren bij het terug decoderen naar tekst.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van WordPiece-tokenisatie
Nieuwere grote taalmodellen geven steeds meer de voorkeur aan BPE- (GPT-familie) of SentencePiece-unigrammodellen op byteniveau, die taalspecifieke voorverwerking vermijden en elke Unicode-invoer verwerken. WordPiece blijft fundamenteel in van BERT afgeleide encoders die nog steeds op grote schaal worden ingezet voor zoeken en classificatie. Verwacht een voortgezet gebruik in productie-NLP, naast onderzoek naar tokenizer-vrije byte- en karaktermodellen die uiteindelijk de afhankelijkheid van vaste subwoordvocabulaires helemaal kunnen verminderen.
Implementatie in de echte wereld
BERT tokeniseert zoekopdrachten in Google Search, waarbij onbekende termen in subwoorden worden opgedeeld, zodat het model nog steeds relevante pagina's kan matchen.
Hugging Face's BertTokenizer gebruikt WordPiece om onbewerkte tekst om te zetten in de token-ID's die aan BERT worden doorgegeven voor sentimentanalyse en herkenning van benoemde entiteiten.
Meertalig BERT maakt gebruik van een gedeeld WordPiece-vocabulaire in meer dan 100 talen, waardoor fragmenten kunnen worden hergebruikt in gerelateerde scripts.
DistilBERT en klinische/biomedische BERT-varianten nemen WordPiece over en hanteren zeldzame medische termen als 'pneumonoconiose' door ze in bekende stukken te splitsen.
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Tokenisatie van subwoorden
Frequently asked questions
What is WordPiece Tokenization?
WordPiece is het subwoord-tokenisatie-algoritme dat BERT en vele Google-modellen aanstuurt, waarbij woorden in herbruikbare fragmenten worden gesplitst, zodat een model elke tekst met een vaste woordenschat kan verwerken. Daarom kan een model dat nog nooit ‘ongelukkigheid’ heeft gezien het nog steeds begrijpen door ‘un’, ‘##happy’ en ‘##ness’ te lezen.
Wat geeft het voorvoegsel '##' aan in WordPiece-uitvoer?
WordPiece markeert voortzettingen van subwoorden met '##', zodat 'spelen' 'spelen' + '##ing' wordt, waardoor de decoder de woordgrenzen kan reconstrueren.
Hoe groot is ongeveer de WordPiece-vocabulaire die door de originele BERT wordt gebruikt?
BERT gebruikt een WordPiece-vocabulaire van ongeveer 30.000 subwoordeenheden, waarbij de dekking wordt afgewogen tegen de grootte van de insluittabel.
Hoe verschilt het samenvoegcriterium van WordPiece van standaard byte-paarcodering?
BPE voegt het meest voorkomende aangrenzende paar samen, terwijl WordPiece het paar samenvoegt dat de waarschijnlijkheid van het corpus het meest vergroot, waarbij de voorkeur wordt gegeven aan paren waarvan de gezamenlijke frequentie het product van hun delen overschrijdt.
Hoe gaat WordPiece om met een woord dat je tijdens de training nog nooit hebt gezien?
Ongeziene woorden worden opgesplitst in de langst overeenkomende bekende subwoorden, waarbij teruggevallen wordt op afzonderlijke karakters, wat het probleem van de onvolledige woordenschat oplost.
Hoe kiest WordPiece tijdens de inferentie hoe een woord wordt gesplitst?
WordPiece tokeniseert gretig, komt overeen met de langste woordenlijst, beginnend op de huidige positie, en herhaalt zich vervolgens met de rest.