Tokenisatie van subwoorden
Subwoord-tokenisatie splitst tekst op in eenheden die kleiner zijn dan woorden maar groter dan tekens, zoals 'token' plus 'ization'.
Overzicht
It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.
Diepe duik
Er zijn te veel woorden om op te sommen (de woordenschat zou enorm zijn en zeldzame woorden missen), terwijl afzonderlijke karakters weinig betekenis hebben en reeksen erg lang maken. Tokenisatie van subwoorden is het compromis: het houdt veel voorkomende woorden heel, maar verdeelt zeldzame of complexe woorden in betekenisvolle fragmenten. 'Ongeluk' kan 'on', 'geluk', 'heid' worden. Belangrijke algoritmen zijn onder meer Byte-Pair Encoding (gebruikt door GPT), WordPiece (gebruikt door BERT) en Unigram/SentencePiece (gebruikt door T5 en veel meertalige modellen). Deze aanpak gaat op een elegante manier om met onzichtbare woorden, deelt stukken over verwante woorden ('spelen', 'spelen', 'gespeeld') en ondersteunt elke taal. Elk fragment wordt toegewezen aan een geheel getal-ID, en deze ID's worden door de inbeddingslaag van het model omgezet in vectoren.
Technisch inzicht
Verschillende algoritmen kiezen subwoorden op een andere manier: BPE voegt frequente paren bottom-up samen, WordPiece kiest samenvoegingen die de waarschijnlijkheid van het corpus het meest vergroten, en Unigram begint met een grote woordenschat en snoeit tokens die de waarschijnlijkheid het minst schaden. WordPiece markeert woordinterne stukken met een '##'-voorvoegsel, terwijl SentencePiece spaties als een speciaal symbool behandelt, zodat het rechtstreeks op onbewerkte tekst werkt zonder vooraf te splitsen op witruimte, ideaal voor talen zonder spaties.
Strategische impact
Speed and scale
Taalworkflows kunnen sneller verlopen zonder dat dit ten koste gaat van de consistentie.
Access and reach
Het breidt de toegang uit naar meerdere talen en communicatiestijlen.
Clearer decisions
Teams kunnen meer tijd besteden aan beoordeling, terwijl automatisering de herhaling afhandelt.
De toekomst van tokenisatie van subwoorden
Tokenisatie van subwoorden zal dominant blijven omdat het snel en compact is, maar de zwakke punten ervan, de ongemakkelijke splitsingen in wiskunde, code en zeldzame scripts, plus ongelijke tokenkosten in verschillende talen, stimuleren onderzoek naar modellen op byteniveau en tokenvrije modellen. Verwacht slimmere, mogelijk aangeleerde of adaptieve tokenizers en een betere meertalige eerlijkheid, zodat niet-Engelse tekst niet wordt bestraft met veel meer tokens per zin.
Implementatie in de echte wereld
BERT maakt gebruik van WordPiece-tokenisatie, waarbij vervolgstukken zoals '##ing' worden gemarkeerd om originele woorden opnieuw op te bouwen.
T5 en veel meertalige modellen gebruiken SentencePiece, dat ruimteloze talen zoals Japans rechtstreeks verwerkt.
Chatmodellen splitsen een zeldzame technische term op in bekende fragmenten in plaats van te falen op een onbekend woord.
Tokenizers delen subwoorden over 'run', 'running' en 'runner', waardoor het model de morfologie efficiënt kan generaliseren.
Risico's en vangrails
Gehallucineerde feiten kunnen stilletjes rapporten binnendringen, stromen ondersteunen of onderzoeksresultaten opleveren.
Gevoeligheid voor prompts kan inconsistente resultaten opleveren voor vergelijkbare verzoeken.
Gevoelige tekstgegevens kunnen openbaar worden gemaakt als de toegangscontroles zwak zijn.
Implementatie routekaart
Definieer het uitvoerformaat, de toon en de kwaliteitsnormen vóór de implementatie.
Grondreacties met vertrouwde bronnen wanneer nauwkeurigheid belangrijk is.
Houd een menselijk controlepunt bij voor resultaten met een hoge inzet.
Houd faalpatronen bij en train prompts of workflows regelmatig opnieuw.
Blijf verkennen
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Zinstuk-tokenisatie
Frequently asked questions
What is Subword Tokenization?
Subwoord-tokenisatie splitst tekst op in eenheden die kleiner zijn dan woorden maar groter dan tekens, zoals 'token' plus 'ization'. Het is de standaardmanier waarop moderne taalmodellen tekst omzetten in de afzonderlijke ID's die ze feitelijk verwerken, waarbij de omvang van de woordenschat wordt afgewogen tegen de betekenis.
Welk probleem lost tokenisatie van subwoorden op in vergelijking met het gebruik van hele woorden?
De woordenschat van hele woorden is enorm en mist nog steeds zeldzame woorden; subwoorden houden de woordenschat beheersbaar en splitsen onbekende woorden op een elegante manier.
Welke van deze is een subwoord-tokenisatie-algoritme dat door BERT wordt gebruikt?
BERT maakt gebruik van WordPiece, dat samenvoegingen selecteert die de waarschijnlijkheid van het trainingscorpus het meest vergroten.
Hoe markeert WordPiece doorgaans een stuk dat een woord voortzet?
WordPiece geeft woordinterne subwoorden het voorvoegsel '##', zodat 'spelen' 'spelen' plus '##ing' wordt.
Waarom is SentencePiece goed geschikt voor talen als Japans?
SentencePiece werkt op onbewerkte tekst en codeert spaties als een speciaal symbool, zodat het zelfs zonder spaties tussen woorden werkt.
Waar wordt elk subwoordfragment uiteindelijk op afgebeeld voordat het het model bereikt?
Aan elk subwoord wordt een geheel getal-ID toegewezen, dat door de inbeddingslaag wordt omgezet in een vector die het model kan verwerken.