Jazyk AI GUIDE

Tokenizace WordPiece

WordPiece je algoritmus tokenizace podslov, který pohání BERT a mnoho modelů Google a rozděluje slova na opakovaně použitelné fragmenty, takže model zvládne jakýkoli text s pevnou slovní zásobou.

2 minuty čteníNaposledy aktualizováno

Přehled

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Hluboký ponor

WordPiece vytváří slovní zásobu jednotek podslov, nikoli celých slov nebo jednotlivých znaků. Počínaje jednotlivými znaky chtivě spojuje dvojice symbolů, které nejvíce zvyšují pravděpodobnost cvičného korpusu, a opakuje se, dokud nedosáhne cílové velikosti slovní zásoby (BERT používá asi 30 000 tokenů). Z toho vyplývá, že tokenizuje chtivě zleva doprava, odpovídá nejdelšímu podslovu ve slovní zásobě a pokračuje ve zbytku. Pokračovací kusy uvnitř slova jsou označeny předponou „##“, takže „hraní“ se změní na „hra“ + „##ing“. To řeší problém mimo slovní zásobu: vzácná nebo neviditelná slova se jednoduše rozloží na známé fragmenty, v případě potřeby až na jednotlivé znaky, zatímco běžná slova zůstanou pro efektivitu jako jednotlivé tokeny.

Technický přehled

WordPiece se liší od Byte-Pair Encoding v kritériu sloučení. BPE spojuje nejčastější sousední pár; WordPiece sloučí pár, který maximalizuje pravděpodobnost tréninkových dat, a zhruba vybere pár, jehož společná frekvence nejvíce převyšuje součin frekvencí jeho částí. Značka '##' odlišuje počáteční části slova od pokračování a umožňuje tokenizeru při dekódování zpět na text jednoznačně rekonstruovat hranice slov.

Strategický dopad

Rychlost a měřítko

Jazykové pracovní postupy se mohou pohybovat rychleji, aniž by byla obětována konzistentnost.

Přístup a dosah

Rozšiřuje přístup napříč jazyky a komunikačními styly.

Jasnější rozhodnutí

Týmy mohou strávit více času úsudkem, zatímco automatizace zvládne opakování.

Budoucnost tokenizace WordPiece

Novější velké jazykové modely stále více upřednostňují BPE na úrovni bajtů (rodina GPT) nebo unigramové modely SentencePiece, které se vyhýbají předzpracování specifickému pro daný jazyk a zvládají jakýkoli vstup Unicode. WordPiece zůstává základem v kodérech odvozených od BERT, které jsou stále široce nasazovány pro vyhledávání a klasifikaci. Očekávejte pokračující používání v produkčním NLP spolu s výzkumem modelů bajtů a znaků bez tokenizerů, které mohou nakonec zcela snížit spoléhání se na pevné slovníky podslov.

Real-World Implementace

BERT tokenizuje vyhledávací dotazy ve vyhledávání Google, přičemž rozděluje neznámé výrazy do podslov, takže model může stále odpovídat relevantním stránkám.

BertTokenizer společnosti Hugging Face používá WordPiece k převodu nezpracovaného textu na ID tokenů předávaná BERT pro analýzu sentimentu a rozpoznávání pojmenovaných entit.

Vícejazyčný BERT používá sdílenou slovní zásobu WordPiece ve více než 100 jazycích, což umožňuje opětovné použití fragmentů v souvisejících skriptech.

DistilBERT a klinické/biomedicínské varianty BERT dědí WordPiece a manipulují se vzácnými lékařskými termíny jako „pneumonokonióza“ jejich rozdělením na známé části.

Rizika a zábradlí

Halucinovaná fakta mohou tiše vstupovat do zpráv, podpůrných toků nebo výstupů výzkumu.

Citlivost na výzvy může způsobit nekonzistentní výsledky napříč podobnými požadavky.

Citlivá textová data mohou být vystavena, pokud je řízení přístupu slabé.

Plán implementace

1

Před zavedením definujte výstupní formát, tón a standardy kvality.

2

Pozemní reakce s důvěryhodnými zdroji, kdykoli záleží na přesnosti.

3

Udržujte kontrolní bod lidské kontroly pro vysoce důležité výstupy.

4

Sledujte vzorce selhání a pravidelně opakujte výzvy nebo pracovní postupy.

Pokračujte v objevování

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Spustit kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Často kladené otázky

What is WordPiece Tokenization?

WordPiece je algoritmus tokenizace podslov, který pohání BERT a mnoho modelů Google a rozděluje slova na opakovaně použitelné fragmenty, takže model zvládne jakýkoli text s pevnou slovní zásobou. To je důvod, proč model, který nikdy neviděl 'neštěstí', mu může stále porozumět čtením 'un', '##happy' a '##ness'.

Co označuje předpona „##“ ve výstupu WordPiece?

WordPiece označí pokračování podslov pomocí '##', takže 'playing' se změní na 'play' + '##ing', což umožňuje dekodéru rekonstruovat hranice slov.

Jak velký je zhruba slovník WordPiece používaný původním BERT?

BERT používá slovní zásobu WordPiece o zhruba 30 000 jednotkách podslov, čímž vyvažuje pokrytí a velikost tabulky vkládání.

Jak se liší kritérium sloučení WordPiece od standardního kódování Byte-Pair?

BPE sloučí nejčastější sousedící pár, zatímco WordPiece sloučí pár, který nejvíce zvyšuje pravděpodobnost korpusu, upřednostňuje páry, jejichž společná frekvence přesahuje součin jejich částí.

Jak WordPiece zachází se slovem, které jste během tréninku nikdy neviděli?

Neviditelná slova jsou rozdělena do nejdelších shodných známých podslov, spadajících zpět na jednotlivé znaky, což řeší problém mimo slovní zásobu.

Jak si v době odvození vybere WordPiece, jak rozdělit slovo?

WordPiece tokenizuje chtivě, odpovídá nejdelší slovní zásobě počínaje aktuální pozicí a poté se opakuje na zbytku.