WordPiece-Tokenisierung
WordPiece ist der Unterwort-Tokenisierungsalgorithmus, der BERT und viele Google-Modelle unterstützt und Wörter in wiederverwendbare Fragmente aufteilt, sodass ein Modell jeden Text mit einem festen Vokabular verarbeiten kann.
Übersicht
It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.
Tiefer Einblick
WordPiece erstellt ein Vokabular aus Unterworteinheiten und nicht aus ganzen Wörtern oder einzelnen Zeichen. Ausgehend von einzelnen Zeichen führt es gierig das Symbolpaar zusammen, das die Wahrscheinlichkeit des Trainingskorpus am meisten erhöht, und wiederholt dies, bis eine Zielwortschatzgröße erreicht ist (BERT verwendet etwa 30.000 Token). Bei der Schlussfolgerung erfolgt die Tokenisierung gierig von links nach rechts, wobei das längste Unterwort im Vokabular gefunden wird, und dann mit dem Rest fortgefahren. Fortsetzungsteile innerhalb eines Wortes werden mit einem „##“-Präfix gekennzeichnet, sodass „playing“ zu „play“ + „##ing“ wird. Dadurch wird das Problem des fehlenden Wortschatzes gelöst: Seltene oder unsichtbare Wörter zerfallen einfach in bekannte Fragmente, bei Bedarf bis hin zu einzelnen Zeichen, während gebräuchliche Wörter aus Effizienzgründen als einzelne Token verbleiben.
Technischer Einblick
WordPiece unterscheidet sich von der Byte-Pair-Kodierung durch das Zusammenführungskriterium. BPE führt das häufigste benachbarte Paar zusammen; WordPiece führt das Paar zusammen, das die Wahrscheinlichkeit der Trainingsdaten maximiert, und wählt grob das Paar aus, dessen gemeinsame Häufigkeit das Produkt der Häufigkeiten seiner Teile am meisten übersteigt. Die Markierung „##“ unterscheidet Wortanfangsteile von Wortfortsetzungen und ermöglicht dem Tokenizer die eindeutige Rekonstruktion von Wortgrenzen beim Zurückdekodieren in Text.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft der WordPiece-Tokenisierung
Neuere große Sprachmodelle bevorzugen zunehmend BPE- (GPT-Familie) oder SentencePiece-Unigrammmodelle auf Byte-Ebene, die eine sprachspezifische Vorverarbeitung vermeiden und alle Unicode-Eingaben verarbeiten. WordPiece bleibt die Grundlage für von BERT abgeleitete Encoder, die immer noch häufig für die Suche und Klassifizierung eingesetzt werden. Erwarten Sie eine fortgesetzte Verwendung im Produktions-NLP sowie die Erforschung tokenisiererfreier Byte- und Zeichenmodelle, die letztendlich die Abhängigkeit von festen Unterwortvokabularen insgesamt reduzieren können.
Reale Umsetzung
BERT tokenisiert Suchanfragen in der Google-Suche und zerlegt unbekannte Begriffe in Unterwörter, damit das Modell weiterhin mit relevanten Seiten übereinstimmen kann.
Der BertTokenizer von Hugging Face verwendet WordPiece, um Rohtext in die Token-IDs umzuwandeln, die BERT zur Stimmungsanalyse und Erkennung benannter Entitäten zugeführt werden.
Das mehrsprachige BERT verwendet ein gemeinsames WordPiece-Vokabular in über 100 Sprachen und ermöglicht die Wiederverwendung von Fragmenten in verwandten Skripten.
DistilBERT und klinisch-biomedizinische BERT-Varianten erben WordPiece und verarbeiten seltene medizinische Begriffe wie „Pneumonokoniose“, indem sie sie in bekannte Teile aufteilen.
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WordPiece Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Unterwort-Tokenisierung
Häufig gestellte Fragen
What is WordPiece Tokenization?
WordPiece ist der Unterwort-Tokenisierungsalgorithmus, der BERT und viele Google-Modelle unterstützt und Wörter in wiederverwendbare Fragmente aufteilt, sodass ein Modell jeden Text mit einem festen Vokabular verarbeiten kann. Aus diesem Grund kann ein Model, das noch nie „Unglück“ gesehen hat, es dennoch verstehen, indem es „un“, „##glücklich“ und „##ness“ liest.
Was bedeutet das Präfix „##“ in der WordPiece-Ausgabe?
WordPiece markiert Unterwortfortsetzungen mit „##“, sodass „playing“ zu „play“ + „##ing“ wird und der Decoder die Wortgrenzen rekonstruieren kann.
Wie groß ist ungefähr der WordPiece-Vokabular, der vom ursprünglichen BERT verwendet wird?
BERT verwendet ein WordPiece-Vokabular von etwa 30.000 Unterworteinheiten und gleicht die Abdeckung mit der Größe der Einbettungstabelle ab.
Wie unterscheidet sich das Zusammenführungskriterium von WordPiece von der Standard-Bytepaar-Kodierung?
BPE führt das häufigste benachbarte Paar zusammen, während WordPiece das Paar zusammenführt, das die Korpuswahrscheinlichkeit am meisten erhöht, und Paare bevorzugt, deren gemeinsame Häufigkeit das Produkt ihrer Teile übersteigt.
Wie geht WordPiece mit einem Wort um, das während des Trainings nie gesehen wurde?
Ungesehene Wörter werden in die am längsten passenden bekannten Unterwörter zerlegt, wobei auf einzelne Zeichen zurückgegriffen wird, wodurch das Problem des fehlenden Wortschatzes gelöst wird.
Wie entscheidet WordPiece zum Zeitpunkt der Inferenz, wie ein Wort aufgeteilt wird?
WordPiece tokenisiert gierig, indem es den längsten Vokabeleintrag abgleicht, beginnend an der aktuellen Position, und es dann am Rest wiederholt.