基礎知識指南

代幣化

標記化是將文字切成更小的片段(稱為標記)的步驟,標記是語言模型實際讀取和預測的單位。

閱讀時間約2分鐘最後更新

概述

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

深入探討

在模型看到您的文字之前,分詞器會將其拆分為標記,這些標記通常是子詞塊,而不是整個單字或單個字母。 “unhappiness”這個詞可能會變成“un”,“happiness”,或者“tokenization”可能會分裂成“token”和“ization”。常見的單字通常會對應到單一標記,而罕見的單字、名稱或代碼則分為多個。然後,每個標記都會對應到一個 ID 號,模型會將其轉換為向量。這實際上很重要,因為模型具有以令牌衡量的固定上下文窗口,並且 API 按令牌計費,因此粗略的英語經驗法則是每個令牌大約 4 個字元或 0.75 個單字。標記化也解釋了經典模型的怪癖:計算字母或進行精確拼字很困難,因為模型看到的是區塊,而不是單一字元。

技術洞察

大多數現代法學碩士都使用子字標記化,例如位元組對編碼(BPE)或其位元組級變體。 BPE 從字元開始,重複合併最頻繁的相鄰對以建立固定詞彙表(通常有 30,000 到 100,000+ 個標記)。這平衡了兩個極端:單字級標記化無法處理看不見的單詞,而字元級則使序列非常長。子詞讓模型透過組合已知的片段來表示任何字串,包括拼字錯誤和新詞,同時保持序列相當短。

戰略影響

更明確的決策

它可以幫助您將清晰的技術聲明與行銷語言分開。

成本與預算

在花費金錢或時間之前,您可以提出更好的實施問題。

團隊與工作流程

具有共同理解的團隊可以做出更好的產品、政策和學習決策。

代幣化的未來

代幣化是一個活躍的研究領域,正是因為它限制了效率和公平性。標記為更多部分的語言成本更高,並且更快地耗盡上下文,因此多語言公平性是一個真正值得關注的問題,需要透過更好、更平衡的詞彙來解決。研究人員也正在探索無令牌或位元組級模型(如 ByT5),並學習了可以完全消除脆弱的手動調整步驟的令牌化。目前,預計會有更大的詞彙量、更聰明的多語言標記器,以及用戶對基於標記的定價和上下文預算的意識不斷增強。

現實世界的實施

GPT 和 Claude 等模型的 API 定價會按輸入和輸出令牌計費,因此令牌數量直接影響成本。

上下文視窗限制(例如 128K 或 200K 令牌)以令牌為單位進行衡量,限制了您可以包含的文字或程式碼的數量。

開發人員在發送請求之前使用分詞器(例如 tiktoken)來估計提示大小並修剪內容。

標記化解釋了為什麼模型難以計算單字中的字母或反轉字串,因為它們看到的是子詞塊,而不是字元。

風險與防護欄

不同的團隊可能會以不同的方式使用相同術語,因此請儘早定義範圍。

基準測試可能看起來很強大,但實際效能卻參差不齊。

忽視數據品質和評估計劃通常會產生脆弱的結果。

實施路線圖

1

從您需要的結果的簡單語言定義開始。

2

在測試之前選擇一種成功指標和一種失敗條件。

3

使用代表性資料運行小型試點,而不是完善的演示集。

4

記錄標記化在哪些方面有幫助以及在哪些方面更簡單的方法更好。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

句段標記化

常見問題

What is Tokenization?

標記化是將文字切成更小的片段(稱為標記)的步驟,標記是語言模型實際讀取和預測的單位。它悄悄地決定了成本、上下文限制,甚至模型處理拼字和罕見單字的能力。

語言模型上下文中的「令牌」是什麼?

標記是模型處理的單位,通常是子詞塊,有時是整個單字或單字。

大多數現代法學碩士使用哪種標記化方法?

BPE 等子詞方法合併了頻繁的字元對,平衡了純單字級和字元級方法的弱點。

為什麼標記化使得諸如計算單字中的字母之類的任務對於法學碩士來說變得困難?

由於文本被分組為子詞標記,因此模型無法直接感知每個字符,從而使得字母級任務容易出錯。

為什麼標記化對於 API 成本和情境限制很重要?

提供者按令牌計費,上下文視窗的大小以令牌為單位,因此令牌數量決定了價格和您可以包含的數量。

為什麼同一個句子在某些語言中比在英語中花費更多的標記?

主要針對英語訓練的詞彙將其他語言分割成更多的標記,從而提高了成本並更快地消耗上下文。