Språk AI GUIDE

WordPiece-tokenisering

WordPiece er underordtokeniseringsalgoritmen som driver BERT og mange Google-modeller, og deler ord i gjenbrukbare fragmenter slik at en modell kan håndtere hvilken som helst tekst med et fast ordforråd.

2 min lesingSist oppdatert

Oversikt

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Dypdykk

WordPiece bygger et vokabular av underordenheter i stedet for hele ord eller enkelttegn. Med utgangspunkt i individuelle tegn, slår den grådig sammen symbolparet som mest øker sannsynligheten for treningskorpuset, og gjentas til det når en målvokabularstørrelse (BERT bruker omtrent 30 000 tokens). Ved slutning, tokeniserer det grådig fra venstre til høyre, matcher det lengste underordet i vokabularet, og fortsetter deretter på resten. Fortsettelsesstykker i et ord er merket med et '##'-prefiks, så 'playing' blir 'play' + '##ing'. Dette løser problemet utenfor ordforrådet: sjeldne eller usynlige ord dekomponeres ganske enkelt til kjente fragmenter, ned til enkelttegn om nødvendig, mens vanlige ord forblir som enkle symboler for effektivitet.

Teknisk innsikt

WordPiece skiller seg fra Byte-Pair Encoding i sammenslåingskriteriet. BPE slår sammen det hyppigste tilstøtende paret; WordPiece slår sammen paret som maksimerer sannsynligheten for treningsdata, og velger grovt sett det paret hvis felles frekvens mest overstiger produktet av delenes frekvenser. '##'-markøren skiller innledende deler av ord fra fortsettelser, og lar tokenizeren rekonstruere ordgrenser utvetydig når den dekoder tilbake til tekst.

Strategisk innvirkning

Speed and scale

Språkarbeidsflyter kan bevege seg raskere uten å ofre konsistens.

Access and reach

Det utvider tilgangen på tvers av språk og kommunikasjonsstiler.

Tydeligere avgjørelser

Lag kan bruke mer tid på dømmekraft mens automatisering håndterer repetisjon.

Fremtiden til WordPiece-tokenisering

Nyere store språkmodeller favoriserer i økende grad byte-nivå BPE (GPT-familie) eller SentencePiece unigram-modeller, som unngår språkspesifikk forhåndsbehandling og håndterer alle Unicode-inndata. WordPiece er fortsatt grunnleggende i BERT-avledede kodere som fortsatt er mye distribuert for søk og klassifisering. Forvent fortsatt bruk i produksjon av NLP, sammen med forskning på tokenizer-frie byte- og karaktermodeller som til slutt kan redusere avhengigheten av faste underordsvokabularer totalt.

Real-World Implementering

BERT tokeniserer søk i Google Søk, deler ukjente termer inn i underord slik at modellen fortsatt kan matche relevante sider.

Hugging Faces BertTokenizer bruker WordPiece til å konvertere rå tekst til token-ID-ene som sendes til BERT for sentimentanalyse og gjenkjennelse av navngitte enheter.

Flerspråklig BERT bruker et delt WordPiece-vokabular på tvers av 100+ språk, og lar fragmenter gjenbrukes på tvers av relaterte skript.

DistilBERT og kliniske/biomedisinske BERT-varianter arver WordPiece, og håndterer sjeldne medisinske termer som "pneumonokoniose" ved å dele dem opp i kjente deler.

Risikoer og rekkverk

Hallusinerte fakta kan stille inn rapporter, støttestrømmer eller forskningsresultater.

Umiddelbar følsomhet kan skape inkonsistente resultater på tvers av lignende forespørsler.

Sensitive tekstdata kan bli eksponert hvis tilgangskontrollene er svake.

Veikart for implementering

1

Definer utdataformat, tone og kvalitetsstandarder før utrulling.

2

Bakgrunnssvar med pålitelige kilder når nøyaktighet er viktig.

3

Hold et sjekkpunkt for menneskelig vurdering for utganger med høy innsats.

4

Spor feilmønstre og tren opp meldinger eller arbeidsflyter regelmessig.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Ofte stilte spørsmål

What is WordPiece Tokenization?

WordPiece er underordtokeniseringsalgoritmen som driver BERT og mange Google-modeller, og deler ord i gjenbrukbare fragmenter slik at en modell kan håndtere hvilken som helst tekst med et fast ordforråd. Det er grunnen til at en modell som aldri har sett «ulykke», fortsatt kan forstå det ved å lese «un», «##happy» og «##ness».

Hva indikerer '##'-prefikset i WordPiece-utdata?

WordPiece markerer fortsettelse av underord med '##', så 'playing' blir 'play' + '##ing', og lar dekoderen rekonstruere ordgrenser.

Omtrent hvor stort er WordPiece-vokabularet brukt av den originale BERT?

BERT bruker et WordPiece-vokabular på omtrent 30 000 underordsenheter, og balanserer dekning mot størrelse på innebygde tabeller.

Hvordan skiller WordPieces sammenslåingskriterium seg fra standard bytepar-koding?

BPE slår sammen det hyppigste tilstøtende paret, mens WordPiece slår sammen paret som mest øker corpus-sannsynligheten, og favoriserer par hvis felles frekvens overstiger produktet av delene deres.

Hvordan håndterer WordPiece et ord som aldri er sett under trening?

Usynlige ord er delt inn i de lengste samsvarende kjente underordene, og faller tilbake til enkelttegn, noe som løser problemet uten ordforråd.

På slutningstidspunktet, hvordan velger WordPiece hvordan man deler et ord?

WordPiece tokeniserer grådig, og matcher den lengste vokabularoppføringen som starter ved gjeldende posisjon, og gjentar deretter resten.