PRZEWODNIK Językowy AI

Tokenizacja podsłowa

Tokenizacja podsłów dzieli tekst na jednostki mniejsze niż słowa, ale większe niż znaki, takie jak „token” plus „izacja”.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.

Głębokie nurkowanie

Słów jest zbyt wiele, aby je wyliczyć (słowniki byłyby ogromne i pomijały rzadkie słowa), podczas gdy pojedyncze znaki nie miałyby większego znaczenia i powodowałyby, że sekwencje byłyby bardzo długie. Tokenizacja podsłów jest kompromisem: utrzymuje częste słowa w całości, ale dzieli rzadkie lub złożone słowa na znaczące fragmenty. „Nieszczęście” może stać się „un”, „happi”, „ness”. Główne algorytmy obejmują kodowanie par bajtów (używane przez GPT), WordPiece (używane przez BERT) i Unigram/SentencePiece (używane przez T5 i wiele modeli wielojęzycznych). To podejście z wdziękiem radzi sobie z niewidzialnymi słowami, dzieli fragmenty powiązanych słów („gra”, „gra”, „gra”) i obsługuje dowolny język. Każdy fragment jest odwzorowywany na identyfikator całkowity, a te identyfikatory są tym, co warstwa osadzająca modelu konwertuje na wektory.

Wgląd techniczny

Różne algorytmy różnie wybierają podsłowa: BPE łączy częste pary od dołu do góry, WordPiece wybiera połączenia, które najbardziej zwiększają prawdopodobieństwo korpusu, a Unigram zaczyna od dużego słownictwa i przycina tokeny, które najmniej szkodzą prawdopodobieństwu. WordPiece oznacza fragmenty wewnętrzne wyrazów prefiksem „##”, podczas gdy SentencePiece traktuje spacje jako specjalny symbol, więc działa bezpośrednio na nieprzetworzonym tekście bez wstępnego dzielenia na białe znaki, co jest idealne w przypadku języków bez spacji.

Wpływ strategiczny

Szybkość i skala

Przepływy pracy związane z językiem mogą przebiegać szybciej bez utraty spójności.

Dostęp i zasięg

Rozszerza dostęp w różnych językach i stylach komunikacji.

Jaśniejsze decyzje

Zespoły mogą spędzać więcej czasu na ocenie, podczas gdy automatyzacja radzi sobie z powtarzalnością.

Przyszłość tokenizacji podsłów

Tokenizacja podsłów pozostanie dominująca, ponieważ jest szybka i zwarta, ale jej słabości, niezręczne podziały w matematyce, kodzie i rzadkich skryptach, a także nierówne koszty tokenów w różnych językach, napędzają badania nad modelami na poziomie bajtów i bez tokenów. Oczekuj mądrzejszych, prawdopodobnie wyuczonych lub adaptacyjnych tokenizatorów i lepszej wielojęzycznej uczciwości, aby tekst w języku innym niż angielski nie był karany znacznie większą liczbą tokenów za zdanie.

Implementacja w świecie rzeczywistym

BERT używa tokenizacji WordPiece, zaznaczając elementy kontynuacji, takie jak „##ing”, aby odbudować oryginalne słowa.

T5 i wiele modeli wielojęzycznych korzysta z SentencePiece, który bezpośrednio obsługuje języki bez spacji, takie jak japoński.

Modele czatu dzielą rzadki termin techniczny na znane fragmenty, zamiast pomijać nieznane słowo.

Tokenizatory dzielą słowa podrzędne na „bieganie”, „bieganie” i „biegacz”, umożliwiając modelowi efektywne uogólnianie morfologii.

Zagrożenia i poręcze

Halucynacyjne fakty mogą po cichu trafiać do raportów, strumieni wsparcia lub wyników badań.

Szybka czułość może spowodować niespójne wyniki w przypadku podobnych żądań.

Wrażliwe dane tekstowe mogą zostać ujawnione, jeśli kontrola dostępu jest słaba.

Plan wdrożenia

1

Zdefiniuj format wyjściowy, ton i standardy jakości przed wdrożeniem.

2

Zawsze, gdy liczy się dokładność, korzystaj z zaufanych źródeł.

3

Utrzymuj punkt kontrolny weryfikacji ręcznej w przypadku wyników o wysokiej stawce.

4

Śledź wzorce niepowodzeń i regularnie powtarzaj monity lub przepływy pracy.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Subword Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Tokenizacja fragmentu zdania

Często zadawane pytania

What is Subword Tokenization?

Tokenizacja podsłów dzieli tekst na jednostki mniejsze niż słowa, ale większe niż znaki, takie jak „token” plus „izacja”. Jest to standardowy sposób, w jaki współczesne modele językowe przekształcają tekst w dyskretne identyfikatory, które faktycznie przetwarzają, równoważąc wielkość słownictwa ze znaczeniem.

Jaki problem rozwiązuje tokenizacja podsłów w porównaniu z używaniem całych słów?

Słowniki składające się z całych słów są ogromne i wciąż brakuje w nich rzadkich słów; Podsłowa ułatwiają zarządzanie słownikami i wdziękiem dzielą nieznane słowa.

Który z nich jest algorytmem tokenizacji podsłów używanym przez BERT?

BERT używa programu WordPiece, który wybiera połączenia, które najbardziej zwiększają prawdopodobieństwo korpusu szkoleniowego.

W jaki sposób program WordPiece zazwyczaj oznacza fragment będący kontynuacją słowa?

WordPiece poprzedza słowa podrzędne znajdujące się wewnątrz słów za pomocą „##”, więc „granie” staje się „graniem” plus „##ing”.

Dlaczego SentencePiece dobrze nadaje się do języków takich jak japoński?

SentencePiece działa na surowym tekście i koduje spacje jako specjalny symbol, więc działa nawet bez spacji między słowami.

Do czego ostatecznie odnosi się każdy fragment słowa podrzędnego, zanim dotrze do modelu?

Każdemu podsłowu przypisany jest identyfikator całkowity, który warstwa osadzająca zamienia na wektor, który model może przetworzyć.