下一個令牌預測
下一個標記預測是 GPT 風格模型背後看似簡單的目標:給定到目前為止的所有內容,猜測下一個文字區塊。
概述
Repeated billions of times, this single task produces models that write, reason, and converse.
深入探討
下一个标记预测训练模型在给定所有先前标记的情况下为下一个标记分配概率。文字首先被標記器(如位元組對編碼)分解為標記(子字片段)。僅解碼器的 Transformer 從左到右讀取序列,並輸出下一個位置的整個詞彙表的機率分佈。在訓練過程中,模型會顯示大量文字語料庫,並且每當它為實際的下一個標記分配低機率時就會受到懲罰。在生成時,模型採樣或貪婪地選擇一個標記,將其附加,並自回歸地重複此循環。這個目標的規模非常大:GPT-2、GPT-3 和後繼者都純粹透過非常擅長預測下一個標記來學習文法、事實、翻譯和推理。
技術洞察
关键机制是因果(屏蔽)自注意力:在预测位置 N 时,模型可能只关注位置 1 到 N-1,而不会关注未来。輸出層將最終的隱藏狀態投影到詞彙表上,並應用 softmax 來取得機率。训练最小化交叉熵,相当于最大化观察到的文本的可能性。溫度和 top-p 等取樣控制重塑了推理時的分佈,以權衡創造力和可靠性。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
下一個代幣預測的未來
下一個令牌預測基本上支撐著所有現代大型語言模型,並將仍然是產生人工智慧的支柱。研究正在透過更長的上下文視窗、推測性和並行解碼以提高速度以及同時猜測多個未來令牌的多令牌預測目標來擴展它。从顶部的人类反馈层进行强化学习以调整输出。前沿技术正在使同样简单的目标变得更便宜、更快,并且在更大的范围内更容易控制。
現實世界的實施
為 ChatGPT 和類似助手提供動力,一次產生一個令牌的對話回應。
當您鍵入時,GitHub Copilot 等工具中的自動補全和程式碼建議。
根據簡短的提示起草電子郵件、文章和行銷文案。
寫作助理中的即時文字生成可以完成您的句子。
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Next-Token Prediction quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Next-Token Prediction?
下一個標記預測是 GPT 風格模型背後看似簡單的目標:給定到目前為止的所有內容,猜測下一個文字區塊。重複數十億次,這個單一任務會產生能夠書寫、推理和交談的模型。
下一個令牌預測模型在每一步輸出什麼?
該模型為每個可能的下一個標記生成機率,然後透過採樣或貪婪選擇來選擇一個。
GPT 風格的解碼器使用哪種類型的注意力?
因果屏蔽確保位置 N 只能看到它之前的位置,從而保留從左到右的預測設定。
這裡的「自回歸」世代是什麼意思?
自迴歸產生一個標記,將其加入到上下文中,然後重複循環。
在訓練過程中通常最小化什麼損失函數?
交叉熵懲罰為真正的下一個標記分配低機率的模型,相當於最大化可能性。
採樣時升高溫度有什麼作用?
較高的溫度使機率分佈平坦,增加隨機性;較低的溫度使選擇更保守。