言語AIガイド

WordPiece のトークン化

WordPiece は、BERT および多くの Google モデルを強化するサブワード トークン化アルゴリズムであり、単語を再利用可能なフラグメントに分割するため、モデルは固定語彙を持つあらゆるテキストを処理できます。

2分の読書最終更新日

概要

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

ディープダイブ

WordPiece は、単語全体や単一の文字ではなく、サブワード単位の語彙を構築します。個々の文字から開始して、トレーニング コーパスの可能性を最も高める記号のペアを貪欲にマージし、目標語彙サイズに達するまで繰り返します (BERT は約 30,000 トークンを使用します)。推論では、左から右に貪欲にトークン化して、語彙内の最も長いサブワードを照合し、残りの部分を続行します。単語内の継続部分には「##」接頭辞が付けられるため、「playing」は「play」+「##ing」になります。これにより、語彙不足の問題が解決されます。珍しい単語や見たことのない単語は、必要に応じて単一の文字に至るまで既知の断片に単純に分解されますが、一般的な単語は効率を高めるために単一のトークンのままです。

技術的な洞察

WordPiece は、マージ基準がバイト ペア エンコーディングとは異なります。 BPE は、最も頻度の高い隣接ペアをマージします。 WordPiece は、トレーニング データの尤度を最大化するペアをマージし、結合周波数がその部分の周波数の積を最も多く超えるペアを大まかに選択します。 「##」マーカーは単語の先頭部分と継続部分を区別し、トークナイザーがテキストにデコードするときに単語の境界を明確に再構築できるようにします。

戦略的影響

速度とスケール

言語ワークフローは、一貫性を犠牲にすることなく、より高速に移行できます。

アクセスと到達範囲

言語やコミュニケーション スタイルを超えてアクセスが拡張されます。

より明確な判決

自動化が繰り返しを処理する間、チームは判断により多くの時間を費やすことができます。

WordPiece トークン化の将来

新しい大規模言語モデルでは、言語固有の前処理を回避し、Unicode 入力を処理するバイトレベルの BPE (GPT ファミリ) または SentencePiece ユニグラム モデルがますます好まれています。 WordPiece は、検索と分類のために現在も広く導入されている BERT 由来のエンコーダーの基礎となっています。最終的には固定サブワード語彙への依存を完全に減らす可能性のあるトークナイザーのないバイトおよび文字モデルの研究と並行して、実稼働 NLP での継続的な使用が期待されます。

現実世界の実装

BERT は Google 検索で検索クエリをトークン化し、馴染みのない用語をサブワードに分割して、モデルが関連するページと引き続き一致できるようにします。

Hugging Face の BertTokenizer は WordPiece を使用して、感情分析と固有表現認識のために生のテキストを BERT に供給されるトークン ID に変換します。

多言語 BERT は、100 以上の言語で共有された WordPiece 語彙を使用し、関連するスクリプト間でフラグメントを再利用できます。

DistilBERT および臨床/生物医学 BERT のバリアントは WordPiece を継承しており、既知の部分に分割することで「じん肺」などの珍しい医学用語を処理します。

リスクとガードレール

幻覚のような事実が、レポート、サポート フロー、または研究結果に静かに組み込まれる可能性があります。

迅速な対応により、同様のリクエスト間で一貫性のない結果が生じる可能性があります。

アクセス制御が弱いと、機密テキスト データが漏洩する可能性があります。

実装ロードマップ

1

展開する前に、出力形式、トーン、品質基準を定義します。

2

正確さが重要な場合は常に、信頼できる情報源を使って地上対応を行ってください。

3

一か八かの成果物については人間によるレビュー チェックポイントを維持します。

4

失敗パターンを追跡し、プロンプトやワークフローを定期的に再トレーニングします。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

サブワードのトークン化

よくある質問

What is WordPiece Tokenization?

WordPiece は、BERT および多くの Google モデルを強化するサブワード トークン化アルゴリズムであり、単語を再利用可能なフラグメントに分割するため、モデルは固定語彙を持つあらゆるテキストを処理できます。 「不幸」を一度も見たことがないモデルでも、「un」、「##happy」、「##ness」を読めば理解できるのはこのためです。

WordPiece 出力の「##」プレフィックスは何を示していますか?

WordPiece はサブワードの継続を '##' でマークするため、'playing' は 'play' + '##ing' となり、デコーダが単語の境界を再構築できるようになります。

元の BERT で使用されている WordPiece ボキャブラリはおよそどれくらいの大きさですか?

BERT は、約 30,000 サブワード単位の WordPiece 語彙を使用し、カバレッジと埋め込みテーブルのサイズのバランスをとります。

WordPiece の結合基準は標準のバイト ペア エンコーディングとどのように異なりますか?

BPE は最も頻繁に隣接するペアをマージしますが、WordPiece はコーパス尤度を最も高めるペアをマージし、結合頻度が各部分の積を超えるペアを優先します。

WordPiece はトレーニング中に一度も見たことのない単語をどのように処理しますか?

目に見えない単語は既知の最も長く一致するサブワードに分割され、単一の文字に戻るため、語彙不足の問題が解決されます。

推論時に、WordPiece は単語の分割方法をどのように選択しますか?

WordPiece は貪欲にトークン化し、現在の位置から開始して最長の語彙エントリを照合し、残りの部分で繰り返します。