Nyelvi AI ÚTMUTATÓ

Wordpiece Tokenization

A WordPiece az a részszó-tokenizációs algoritmus, amely a BERT-et és számos Google modellt működteti, a szavakat újrafelhasználható töredékekre bontja, így a modell bármilyen, rögzített szókinccsel rendelkező szöveget képes kezelni.

2 perc olvasásUtoljára frissítve

Áttekintés

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Mély merülés

A WordPiece szókincset egész szavak vagy egyedi karakterek helyett részszóegységekből épít fel. Az egyes karakterekből kiindulva mohón egyesíti azt a szimbólumpárt, amely a leginkább növeli a képzési korpusz valószínűségét, és addig ismétli, amíg el nem éri a cél szókincs méretét (a BERT körülbelül 30 000 tokent használ). Következtetéskor mohón balról jobbra tokenizál, egyezik a szókincs leghosszabb alszavajával, majd folytatja a maradékot. A szón belüli folytatásos darabok „##” előtaggal vannak jelölve, így a „playing” szóból „play” + „##ing” lesz. Ez megoldja a szókincsen kívüli problémát: a ritka vagy nem látott szavak egyszerűen ismert töredékekre bomlanak, szükség esetén egyetlen karakterre, míg a gyakori szavak egyetlen jelzőként maradnak a hatékonyság érdekében.

Technikai betekintés

A WordPiece az összevonási kritériumban különbözik a bájtpáros kódolástól. A BPE összevonja a leggyakoribb szomszédos párt; A WordPiece összevonja azt a párt, amely maximalizálja a képzési adatok valószínűségét, nagyjából kiválasztva azt a párt, amelynek együttes frekvenciája leginkább meghaladja a részei frekvenciáinak szorzatát. A '##' marker megkülönbözteti a szókezdő részeket a folytatásoktól, lehetővé téve, hogy a tokenizer egyértelműen rekonstruálja a szóhatárokat a szöveggé való visszakódoláskor.

Stratégiai hatás

Sebesség és méretarány

A nyelvi munkafolyamatok gyorsabban haladhatnak a következetesség feláldozása nélkül.

Hozzáférés és elérés

Kibővíti a hozzáférést a nyelvek és a kommunikációs stílusok között.

Tisztább döntések

A csapatok több időt tölthetnek az ítélkezéssel, míg az automatizálás kezeli az ismétlést.

A Wordpiece Tokenization jövője

Az újabb nagy nyelvi modellek egyre inkább előnyben részesítik a bájtszintű BPE (GPT család) vagy a SentencePiece unigram modelleket, amelyek elkerülik a nyelvspecifikus előfeldolgozást, és kezelnek bármilyen Unicode bevitelt. A WordPiece továbbra is az alapja a BERT-eredetű kódolóknak, amelyeket továbbra is széles körben alkalmaznak keresésre és osztályozásra. Az éles NLP-ben további felhasználásra kell számítani, valamint a tokenizátor-mentes bájt- és karaktermodellek kutatására, amelyek végső soron csökkenthetik a rögzített részszószókincsekre való támaszkodást.

Valós megvalósítás

A BERT tokenizálja a keresési lekérdezéseket a Google Keresésben, részszavakra bontva az ismeretlen kifejezéseket, így a modell továbbra is egyezhet a releváns oldalakkal.

A Hugging Face BertTokenenizer a WordPiece segítségével alakítja át a nyers szöveget a BERT-nek betáplált tokenazonosítókká a hangulatelemzés és az elnevezett entitás felismerés céljából.

A többnyelvű BERT megosztott WordPiece szókincset használ több mint 100 nyelven, lehetővé téve a töredékek újrafelhasználását a kapcsolódó szkriptekben.

A DistilBERT és a klinikai/orvosbiológiai BERT-változatok öröklik a WordPiece-t, és olyan ritka orvosi kifejezéseket kezelnek, mint a „pneumonoconiosis”, ismert részekre bontva azokat.

Kockázatok és védőkorlátok

A hallucinált tények csendben bekerülhetnek a jelentésekbe, a támogatási folyamatokba vagy a kutatási eredményekbe.

Az azonnali érzékenység inkonzisztens eredményeket eredményezhet a hasonló kérések között.

Ha a hozzáférés-szabályozás gyenge, az érzékeny szöveges adatok megjelenhetnek.

Végrehajtási ütemterv

1

A kiadás előtt határozza meg a kimeneti formátumot, hangszínt és minőségi szabványokat.

2

Földelje a válaszokat megbízható forrásokból, amikor a pontosság számít.

3

Tartson emberi ellenőrzési pontot a nagy tétű kimenetekhez.

4

Kövesse nyomon a meghibásodási mintákat, és rendszeresen tanítsa át az utasításokat vagy a munkafolyamatokat.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is WordPiece Tokenization?

A WordPiece az a részszó-tokenizációs algoritmus, amely a BERT-et és számos Google modellt működteti, a szavakat újrafelhasználható töredékekre bontja, így a modell bármilyen, rögzített szókinccsel rendelkező szöveget képes kezelni. Ez az oka annak, hogy egy modell, aki soha nem látott „boldogtalanságot”, még mindig megértheti azt, ha elolvassa az „un”, „##happy” és „##ness” szavakat.

Mit jelez a "##" előtag a WordPiece kimenetben?

A WordPiece az alszavak folytatásait „##”-al jelöli, így a „playing” szóból „play” + „##ing” lesz, így a dekóder rekonstruálja a szóhatárokat.

Körülbelül mekkora az eredeti BERT által használt WordPiece szókincs?

A BERT nagyjából 30 000 részszóegységből álló WordPiece szókincset használ, egyensúlyozva a lefedettséget a beágyazott táblázat méretével.

Miben különbözik a WordPiece egyesítési feltétele a szabványos bájtpáros kódolástól?

A BPE a leggyakoribb szomszédos párt egyesíti, míg a WordPiece azt a párt, amely leginkább növeli a korpusz valószínűségét, előnyben részesítve azokat a párokat, amelyek együttes gyakorisága meghaladja a részeik szorzatát.

Hogyan kezeli a WordPiece egy szót, amelyet edzés közben nem látott?

A nem látott szavakat a leghosszabb egyező ismert részszavakra bontják, amelyek visszaesnek egyetlen karakterre, ami megoldja a szókincsen kívüli problémát.

A következtetés időpontjában hogyan választja ki a WordPiece a szó felosztását?

A WordPiece mohón tokenizál, a szókincs leghosszabb bejegyzéséhez illeszkedik, az aktuális pozíciótól kezdve, majd a maradékon ismétlődik.