Език AI РЪКОВОДСТВО

Токенизация на WordPiece

WordPiece е алгоритъмът за токенизиране на поддуми, който захранва BERT и много модели Google, като разделя думите на многократно използвани фрагменти, така че моделът да може да обработва всеки текст с фиксиран речник.

2 min readПоследна актуализация

Преглед

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

Дълбоко гмуркане

WordPiece изгражда речник от единици поддуми, а не цели думи или единични знаци. Започвайки от отделни знаци, той алчно обединява двойката символи, които най-много увеличават вероятността от обучителния корпус, като се повтаря, докато достигне целевия размер на речника (BERT използва около 30 000 токена). При извод, той алчно токенизира отляво надясно, съвпадайки с най-дългата поддума в речника, след което продължава върху останалата част. Продълженията вътре в една дума са маркирани с префикс '##', така че 'playing' става 'playing' + '##ing'. Това решава проблема с липсата на речник: редки или невиждани думи просто се разлагат на известни фрагменти, до единични знаци, ако е необходимо, докато общите думи остават като единични токени за ефективност.

Техническа информация

WordPiece се различава от Byte-Pair Encoding по своя критерий за сливане. BPE обединява най-честата съседна двойка; WordPiece обединява двойката, която увеличава максимално вероятността от данни за обучение, грубо избирайки двойката, чиято обща честота най-много надвишава произведението на честотите на нейните части. Маркерът '##' разграничава началните части на думата от продълженията, позволявайки на токенизатора да реконструира недвусмислено границите на думите при декодиране обратно към текст.

Стратегическо въздействие

Speed and scale

Езиковите работни процеси могат да се движат по-бързо, без да се жертва последователността.

Access and reach

Той разширява достъпа между езици и стилове на комуникация.

Clearer decisions

Екипите могат да отделят повече време за преценка, докато автоматизацията се справя с повторението.

Бъдещето на токенизацията на WordPiece

По-новите големи езикови модели все повече предпочитат BPE на ниво байт (семейство GPT) или униграмни модели на SentencePiece, които избягват специфична за езика предварителна обработка и обработват всяко въвеждане на Unicode. WordPiece остава основополагащ в получените от BERT енкодери, които все още са широко разпространени за търсене и класификация. Очаквайте продължителна употреба в производствения NLP, заедно с изследванията на модели на байтове и знаци без токенизатори, които в крайна сметка могат напълно да намалят зависимостта от речници с фиксирани поддуми.

Внедряване в реалния свят

BERT токенизира заявките за търсене в Google Търсене, разделяйки непознатите термини на поддуми, така че моделът да може да съпостави подходящи страници.

BertTokenizer на Hugging Face използва WordPiece за преобразуване на необработен текст в идентификатори на токени, подавани на BERT за анализ на настроението и разпознаване на именуван обект.

Многоезичният BERT използва споделен речник на WordPiece в над 100 езика, което позволява повторно използване на фрагменти в свързани скриптове.

DistilBERT и клиничните/биомедицинските варианти на BERT наследяват WordPiece, като обработват редки медицински термини като „пневмонокониоза“, като ги разделят на известни части.

Рискове и предпазни огради

Халюцинираните факти могат тихо да влязат в отчети, потоци за поддръжка или резултати от изследвания.

Бързата чувствителност може да създаде противоречиви резултати при подобни заявки.

Чувствителните текстови данни могат да бъдат разкрити, ако контролите за достъп са слаби.

Пътна карта за изпълнение

1

Определете изходен формат, тон и стандарти за качество преди внедряване.

2

Наземни отговори с доверени източници винаги, когато точността има значение.

3

Поддържайте контролна точка за човешки преглед за изходи с високи залози.

4

Проследявайте моделите на неуспехи и редовно обучавайте подкани или работни потоци.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Токенизиране на поддуми

Frequently asked questions

What is WordPiece Tokenization?

WordPiece е алгоритъмът за токенизиране на поддуми, който захранва BERT и много модели Google, като разделя думите на многократно използвани фрагменти, така че моделът да може да обработва всеки текст с фиксиран речник. Ето защо модел, който никога не е виждал „нещастие“, все още може да го разбере, като прочете „не“, „##щастлив“ и „##ност“.

Какво показва префиксът '##' в изхода на WordPiece?

WordPiece маркира продълженията на поддумата с '##', така че 'playing' става 'play' + '##ing', позволявайки на декодера да реконструира границите на думите.

Приблизително колко голям е речникът на WordPiece, използван от оригиналния BERT?

BERT използва речник на WordPiece от приблизително 30 000 единици поддуми, като балансира покритието спрямо размера на таблицата за вграждане.

По какво се различава критерият за сливане на WordPiece от стандартното кодиране на двойки байтове?

BPE обединява най-често срещаната съседна двойка, докато WordPiece обединява двойката, която най-много увеличава вероятността за корпуса, предпочитайки двойки, чиято обща честота надвишава произведението на техните части.

Как WordPiece се справя с дума, която никога не е виждана по време на обучение?

Невидимите думи се разделят на най-дългите съвпадащи известни поддуми, връщайки се към единични знаци, което решава проблема с липсата на речник.

По време на извод как WordPiece избира как да раздели дума?

WordPiece токенизира алчно, съвпадайки с най-дългия запис в речника, започвайки от текущата позиция, след което се повтаря в остатъка.