Tokenizare WordPiece
WordPiece este algoritmul de tokenizare a subcuvintelor care alimentează BERT și multe modele Google, împărțind cuvintele în fragmente reutilizabile, astfel încât un model să poată gestiona orice text cu un vocabular fix.
Prezentare generală
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Scufundare în profunzime
WordPiece construiește un vocabular de unități de subcuvinte, mai degrabă decât cuvinte întregi sau caractere individuale. Pornind de la caractere individuale, îmbină cu lăcomie perechea de simboluri care mărește cel mai mult probabilitatea apariției corpusului de antrenament, repetându-se până când atinge o dimensiune țintă a vocabularului (BERT folosește aproximativ 30.000 de jetoane). La deducție, simbolizează cu lăcomie de la stânga la dreapta, potrivindu-se cu cel mai lung subcuvânt din vocabular, apoi continuând cu restul. Piesele de continuare din interiorul unui cuvânt sunt marcate cu un prefix „##”, astfel încât „playing” devine „play” + „##ing”. Acest lucru rezolvă problema în afara vocabularului: cuvintele rare sau nevăzute se descompun pur și simplu în fragmente cunoscute, până la caractere unice dacă este necesar, în timp ce cuvintele obișnuite rămân ca simboluri unice pentru eficiență.
Perspectivă tehnică
WordPiece diferă de codificarea perechilor de octeți în criteriul său de îmbinare. BPE îmbină cea mai frecventă pereche adiacentă; WordPiece îmbină perechea care maximizează probabilitatea datelor de antrenament, alegând aproximativ perechea a cărei frecvență comună depășește cel mai mult produsul dintre frecvențele părților sale. Marcatorul „##” distinge bucățile inițiale ale cuvântului de continuare, permițând tokenizatorului să reconstruiască granițele cuvintelor fără ambiguitate atunci când decodează înapoi în text.
Impact strategic
Viteză și scară
Fluxurile de lucru lingvistice se pot deplasa mai rapid fără a sacrifica consistența.
Acces și acoperire
Extinde accesul în diferite limbi și stiluri de comunicare.
Decizii mai clare
Echipele pot petrece mai mult timp jucând în timp ce automatizarea se ocupă de repetiție.
Viitorul tokenizării WordPiece
Modelele de limbă mari mai noi preferă din ce în ce mai mult modelele BPE la nivel de octeți (familia GPT) sau modelele unigrame SentencePiece, care evită preprocesarea specifică limbii și gestionează orice intrare Unicode. WordPiece rămâne fundamental în codificatoarele derivate din BERT, încă utilizate pe scară largă pentru căutare și clasificare. Așteptați-vă la utilizarea continuă în NLP de producție, alături de cercetarea modelelor de octeți și caractere fără tokenizer, care ar putea reduce în cele din urmă dependența de vocabularele subcuvinte fixe.
Implementare în lumea reală
BERT tokenizează interogările de căutare în Google Căutare, împărțind termenii nefamiliari în subcuvinte, astfel încât modelul să se potrivească în continuare cu paginile relevante.
BertTokenizer de la Hugging Face folosește WordPiece pentru a converti textul brut în ID-uri de simbol furnizate către BERT pentru analiza sentimentelor și recunoașterea entităților numite.
BERT multilingv folosește un vocabular WordPiece partajat în peste 100 de limbi, permițând ca fragmentele să fie reutilizate în scripturi conexe.
DistilBERT și variantele clinice/biomedicale BERT moștenesc WordPiece, manipulând termeni medicali rari precum „pneumonoconioza” prin împărțirea lor în bucăți cunoscute.
Riscuri și balustrade
Faptele halucinate pot intra în liniște în rapoarte, fluxuri de sprijin sau rezultate ale cercetării.
Sensibilitatea promptă poate crea rezultate inconsecvente pentru solicitări similare.
Datele text sensibile pot fi expuse dacă controalele de acces sunt slabe.
Foaia de parcurs de implementare
Definiți formatul de ieșire, tonul și standardele de calitate înainte de lansare.
Răspunsurile la sol cu surse de încredere ori de câte ori acuratețea contează.
Păstrați un punct de control uman pentru rezultate cu mize mari.
Urmăriți tiparele de eșec și reantrenați în mod regulat solicitările sau fluxurile de lucru.
Continuați să explorați
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Următorul ghid
Tokenizare subcuvânt
Întrebări frecvente
What is WordPiece Tokenization?
WordPiece este algoritmul de tokenizare a subcuvintelor care alimentează BERT și multe modele Google, împărțind cuvintele în fragmente reutilizabile, astfel încât un model să poată gestiona orice text cu un vocabular fix. Acesta este motivul pentru care un model care nu a văzut niciodată „nefericirea” o poate înțelege în continuare citind „un”, „##happy” și „##ness”.
Ce indică prefixul „##” în ieșirea WordPiece?
WordPiece marchează continuările subcuvintelor cu „##”, așa că „playing” devine „play” + „##ing”, permițând decodorului să reconstruiască limitele cuvintelor.
Cât de mare este vocabularul WordPiece folosit de BERT original?
BERT folosește un vocabular WordPiece de aproximativ 30.000 de unități de subcuvinte, echilibrând acoperirea cu dimensiunea tabelului de încorporare.
Cum diferă criteriul de îmbinare al WordPiece de codificarea standard de perechi de octeți?
BPE îmbină cea mai frecventă pereche adiacentă, în timp ce WordPiece îmbină perechea care crește cel mai mult probabilitatea de corpus, favorizând perechile a căror frecvență de îmbinare depășește produsul părților lor.
Cum gestionează WordPiece un cuvânt niciodată văzut în timpul antrenamentului?
Cuvintele nevăzute sunt împărțite în cele mai lungi subcuvinte cunoscute care se potrivesc, revenind la caractere unice, ceea ce rezolvă problema în afara vocabularului.
La momentul deducerii, cum alege WordPiece cum să împartă un cuvânt?
WordPiece tokenizează cu lăcomie, potrivindu-se cu cea mai lungă intrare de vocabular începând cu poziția curentă, apoi repetându-se pe restul.