Unterwort-Tokenisierung
Bei der Unterwort-Tokenisierung wird Text in Einheiten aufgeteilt, die kleiner als Wörter, aber größer als Zeichen sind, wie „Token“ plus „isierung“.
Übersicht
It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.
Tiefer Einblick
Es gibt zu viele Wörter, um sie aufzuzählen (das Vokabular wäre riesig und seltene Wörter würden fehlen), während einzelne Zeichen wenig Bedeutung haben und Sequenzen sehr lang machen. Die Unterwort-Tokenisierung ist der Kompromiss: Häufige Wörter bleiben erhalten, seltene oder komplexe Wörter werden jedoch in sinnvolle Fragmente zerlegt. „Unglück“ könnte zu „un“, „happi“, „ness“ werden. Zu den wichtigsten Algorithmen gehören Byte-Pair-Encoding (verwendet von GPT), WordPiece (verwendet von BERT) und Unigram/SentencePiece (verwendet von T5 und vielen mehrsprachigen Modellen). Dieser Ansatz geht elegant mit unsichtbaren Wörtern um, teilt Teile über verwandte Wörter hinweg („spielen“, „spielen“, „gespielt“) und unterstützt jede Sprache. Jedes Fragment wird einer ganzzahligen ID zugeordnet, und diese IDs werden von der Einbettungsschicht des Modells in Vektoren umgewandelt.
Technischer Einblick
Verschiedene Algorithmen wählen Unterwörter unterschiedlich aus: BPE führt häufige Paare von unten nach oben zusammen, WordPiece wählt Zusammenführungen aus, die die Korpuswahrscheinlichkeit am meisten erhöhen, und Unigram beginnt mit einem großen Vokabular und beschneidet Token, die die Wahrscheinlichkeit am wenigsten beeinträchtigen. WordPiece markiert wortinterne Teile mit einem „##“-Präfix, während SentencePiece Leerzeichen als spezielles Symbol behandelt, sodass es direkt auf Rohtext funktioniert, ohne vorher in Leerzeichen aufzuteilen, ideal für Sprachen ohne Leerzeichen.
Strategische Auswirkungen
Geschwindigkeit und Umfang
Sprachworkflows können schneller ablaufen, ohne dass die Konsistenz darunter leidet.
Zugang und Erreichbarkeit
Es erweitert den Zugang über Sprachen und Kommunikationsstile hinweg.
Klarere Entscheidungen
Teams können mehr Zeit für die Beurteilung aufwenden, während die Automatisierung die Wiederholungen bewältigt.
Die Zukunft der Subword-Tokenisierung
Die Unterwort-Tokenisierung wird dominant bleiben, weil sie schnell und kompakt ist, aber ihre Schwächen, umständliche Aufteilungen in Mathematik, Code und seltenen Skripten sowie ungleiche Token-Kosten in den verschiedenen Sprachen treiben die Forschung nach Modellen auf Byte-Ebene und ohne Token voran. Erwarten Sie intelligentere, möglicherweise erlernte oder adaptive Tokenisierer und eine bessere mehrsprachige Fairness, damit nicht-englischer Text nicht mit weit mehr Token pro Satz bestraft wird.
Reale Umsetzung
BERT nutzt die WordPiece-Tokenisierung und markiert Fortsetzungsteile wie „##ing“, um ursprüngliche Wörter wiederherzustellen.
T5 und viele mehrsprachige Modelle verwenden SentencePiece, das raumlose Sprachen wie Japanisch direkt verarbeitet.
Chat-Modelle zerlegen einen seltenen Fachbegriff in bekannte Fragmente, anstatt an einem unbekannten Wort zu scheitern.
Tokenizer teilen Unterwörter für „run“, „running“ und „runner“, sodass das Modell die Morphologie effizient verallgemeinern kann.
Risiken und Leitplanken
Halluzinierte Fakten können still und leise in Berichte, Support-Flows oder Forschungsergebnisse einfließen.
Eine schnelle Sensibilität kann bei ähnlichen Anfragen zu inkonsistenten Ergebnissen führen.
Sensible Textdaten können offengelegt werden, wenn die Zugriffskontrollen schwach sind.
Implementierungs-Roadmap
Definieren Sie vor dem Rollout Ausgabeformat, Ton und Qualitätsstandards.
Bodenantworten mit vertrauenswürdigen Quellen, wann immer es auf Genauigkeit ankommt.
Halten Sie einen Kontrollpunkt für die menschliche Überprüfung für Ergebnisse mit hohem Risiko ein.
Verfolgen Sie Fehlermuster und trainieren Sie Eingabeaufforderungen oder Arbeitsabläufe regelmäßig neu.
Entdecken Sie weiter
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Subword Tokenization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Nächster Leitfaden
Satzstück-Tokenisierung
Häufig gestellte Fragen
What is Subword Tokenization?
Bei der Unterwort-Tokenisierung wird Text in Einheiten aufgeteilt, die kleiner als Wörter, aber größer als Zeichen sind, wie „Token“ plus „isierung“. Dies ist die Standardmethode, mit der moderne Sprachmodelle Text in die diskreten IDs umwandeln, die sie tatsächlich verarbeiten, und dabei die Größe des Wortschatzes gegen die Bedeutung abwägen.
Welches Problem löst die Unterwort-Tokenisierung im Vergleich zur Verwendung ganzer Wörter?
Der Wortschatz für ganze Wörter ist riesig und es fehlen immer noch seltene Wörter. Unterwörter halten das Vokabular übersichtlich und teilen unbekannte Wörter elegant auf.
Welcher davon ist ein von BERT verwendeter Unterwort-Tokenisierungsalgorithmus?
BERT verwendet WordPiece, das Zusammenführungen auswählt, die die Wahrscheinlichkeit des Trainingskorpus am meisten erhöhen.
Wie markiert WordPiece normalerweise ein Stück, das ein Wort fortsetzt?
WordPiece stellt wortinternen Unterwörtern das Präfix „##“ voran, sodass „playing“ zu „play“ plus „##ing“ wird.
Warum eignet sich SentencePiece gut für Sprachen wie Japanisch?
SentencePiece arbeitet mit Rohtext und kodiert Leerzeichen als spezielles Symbol, sodass es auch ohne Leerzeichen zwischen Wörtern funktioniert.
Worauf wird jedes Unterwortfragment letztendlich abgebildet, bevor es das Modell erreicht?
Jedem Unterwort wird eine ganzzahlige ID zugewiesen, die die Einbettungsschicht in einen Vektor umwandelt, den das Modell verarbeiten kann.