基本ガイド

トークン化

トークン化は、テキストをトークンと呼ばれる小さな部分に切り分けるステップです。トークンは、言語モデルが実際に読み取って予測する単位です。

2分の読書最終更新日

概要

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

ディープダイブ

モデルがテキストを認識する前に、トークナイザーはテキストをトークンに分割します。トークンは通常、単語全体や単一の文字ではなくサブワードの塊です。 「unhappiness」という言葉が「un」になったり、「happiness」になったり、あるいは「トークン化」が「トークン」と「化」に分かれたりするかもしれません。一般的な単語は 1 つのトークンにマッピングされることがよくありますが、まれな単語、名前、またはコードはいくつかに分割されます。各トークンは、モデルによってベクトルに変換される ID 番号にマッピングされます。これは実際的に重要です。モデルにはトークン単位で測定される固定コンテキスト ウィンドウがあり、API はトークンごとに請求されるため、英語のおおよその経験則はトークンあたり約 4 文字または 0.75 単語になります。トークン化は、モデルの古典的な癖も説明します。モデルは個々の文字ではなくチャンクを認識するため、文字を数えたり正確なスペルを実行するのは困難です。

技術的な洞察

最新の LLM のほとんどは、バイト ペア エンコーディング (BPE) またはそのバイトレベルのバリアントなどのサブワード トークン化を使用します。 BPE は文字から開始し、最も頻繁に使用される隣接するペアを繰り返しマージして、固定語彙 (多くの場合 30,000 ~ 100,000 以上のトークン) を構築します。これにより、2 つの極端なバランスがとれます。単語レベルのトークン化では目に見えない単語を処理できないのに対し、文字レベルではシーケンスが非常に長くなるということです。サブワードを使用すると、シーケンスを適度に短く保ちながら、既知の部分を構成することで、タイプミスや新しい単語を含むあらゆる文字列をモデルで表現できます。

戦略的影響

より明確な判決

これは、明確な技術的主張とマーケティング言語を区別するのに役立ちます。

費用と予算

お金や時間を費やす前に、実装に関するより良い質問をすることができます。

チームとワークフロー

共通の理解を持ったチームは、製品、ポリシー、学習に関する意思決定をより適切に行うことができます。

トークン化の未来

トークン化は、まさに効率性と公平性を制限するため、活発な研究分野です。より多くの部分にトークン化される言語はコストが高くなり、コンテキストをより早く使い果たすため、多言語の公平性は、より優れた、よりバランスのとれた語彙によって対処される真の懸念事項です。研究者はまた、トークンフリーまたはバイトレベルのモデル (ByT5 など) を調査し、脆弱な手動調整ステップを完全に削除できるトークン化を学習しました。現時点では、より多くの語彙、よりスマートな多言語トークナイザー、そしてトークンベースの価格設定とコンテキスト予算設定に対するユーザーの意識の高まりが期待されています。

現実世界の実装

GPT や Claude などのモデルの API 料金は入力トークンと出力トークンごとに請求されるため、トークン数はコストに直接影響します。

コンテキスト ウィンドウの制限 (128K または 200K トークンなど) はトークンで測定され、含めることができるテキストまたはコードの量に上限が設定されます。

開発者はトークナイザー (tiktoken など) を使用して、リクエストを送信する前にプロンプ​​トのサイズを見積もり、コンテンツをトリミングします。

モデルは文字ではなくサブワードのチャンクを認識するため、モデルが単語内の文字を数えたり、文字列を反転したりするのに苦労する理由は、トークン化によって説明されます。

リスクとガードレール

チームが異なれば、同じ用語の使用方法も異なる可能性があるため、範囲を早めに定義してください。

ベンチマークは好調に見えても、実際のパフォーマンスにはばらつきがある場合があります。

データの品質と評価計画を無視すると、多くの場合、脆弱な結果が生じます。

実装ロードマップ

1

必要な結果を平易な言葉で定義することから始めます。

2

テストする前に、成功指標と失敗条件を 1 つ選択します。

3

洗練されたデモセットではなく、代表的なデータを使用して小規模なパイロットを実行します。

4

トークン化が役立つ場合と、より単純な方法の方が優れている場合を文書化します。

探検を続けましょう

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

クイズを開始する

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

次のガイド

SentencePiece のトークン化

よくある質問

What is Tokenization?

トークン化は、テキストをトークンと呼ばれる小さな部分に切り分けるステップです。トークンは、言語モデルが実際に読み取って予測する単位です。コスト、コンテキストの制限、さらにはモデルがスペルや珍しい単語をどの程度うまく処理できるかさえも、静かに形作られます。

言語モデルのコンテキストにおける「トークン」とは何ですか?

トークンはモデルが処理する単位であり、通常はサブワードのチャンク、場合によっては単語全体または単一の文字です。

最新の LLM はどのトークン化アプローチを使用していますか?

BPE などのサブワード手法は、頻繁に使用される文字のペアをマージし、純粋な単語レベルのアプローチと文字レベルのアプローチの弱点のバランスをとります。

トークン化により、LLM にとって単語内の文字を数えるなどのタスクが困難になるのはなぜですか?

テキストはサブワード トークンにグループ化されているため、モデルは各文字を直接認識せず、文字レベルのタスクでエラーが発生しやすくなります。

トークン化が API コストとコンテキスト制限に影響するのはなぜですか?

プロバイダーはトークンごとに料金を請求し、コンテキスト ウィンドウのサイズはトークン単位であるため、トークン数によって価格と含めることができる量の両方が決まります。

同じ文でも、一部の言語では英語よりもトークンのコストが高くなるのはなぜですか?

主に英語で訓練された語彙は他の言語をより多くのトークンに分割するため、コストが上昇し、コンテキストの消費が速くなります。