語言人工智慧指南

Nucleus 和 Top-k 採樣

Nucleus (top-p) 和 top-k 採樣是透過限制可以選擇的標記來為文字產生添加受控隨機性的解碼方法。

閱讀時間約2分鐘最後更新

概述

They matter because they make AI writing feel natural and varied instead of repetitive or robotic.

深入探討

語言模型在每一步驟輸出整個詞彙的機率分佈。直接從中採樣可以挑選出奇怪的、低機率的標記;總是獲取頂部令牌(貪婪)會產生枯燥、重複的循環。 Top-k 取樣透過僅保留 k 個最高機率標記(例如 k=40)、重新標準化並在其中取樣來解決此問題。細胞核採樣,由 Holtzman 等人提出。在 2019 年,而是保留累積機率超過閾值 p(例如 0.9)的最小標記集——「核心」。關鍵的優點是,當模型有信心時,該集合會縮小,而當模型不確定時,該集合會擴展,從而動態適應。兩者通常與溫度參數結合,在採樣前使分佈尖銳或平坦。

技術洞察

關鍵的差異在於固定截斷與自適應截斷。 Top-k 始終保留恰好 k 個令牌,當許多選項都合理時,這些令牌可能太少,或者當只有幾個選項合理時,這些令牌可能會包含垃圾。 Top-p 保留一個可變數量——剛好足以覆蓋機率質量 p 的標記——因此它會截斷不可靠的長尾,同時考慮分佈的峰值或平坦程度。溫度(通常為 0.7-1.0)會在任一方法之前重新調整 logits:較低的值集中機率,較高的值分散機率。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

Nucleus 和 Top-k 採樣的未來

基於採樣的解碼現在是聊天機器人和創意工具的預設設置,並且研究不斷對其進行改進:典型採樣、min-p 和 eta/epsilon 採樣等方法旨在比固定 p 或 k 更聰明地截斷尾部。預計解碼參數將變得更加具有上下文感知能力,甚至可以學習,自動收緊事實答案並放鬆頭腦風暴。隨著模型的改進,仔細的採樣控制對於平衡可靠性、多樣性和減少幻覺仍然至關重要。

現實世界的實施

聊天機器人使用 0.9 左右的 top-p 來保持對話中回應的多樣性和連貫性

創意寫作助理提高溫度和壓力,集思廣益不同的故事想法

程式碼產生工具可降低溫度和 k,以獲得更具確定性、更正確的程式碼片段

API 使用者調整 top_p 和 top_k 參數來控制模型輸出的冒險程度

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Nucleus and Top-k Sampling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

常見問題

What is Nucleus and Top-k Sampling?

Nucleus (top-p) 和 top-k 採樣是透過限制可以選擇的標記來為文字產生添加受控隨機性的解碼方法。它們很重要,因為它們讓人工智慧寫作感覺自然且多樣,而不是重複或機械化。

top-k 採樣如何限制 token 選擇?

Top-k 將分佈截斷為固定數量 k 個最可能的標記,重新標準化,並從中進行取樣。

什麼定義了核(top-p)採樣中的「核」?

Top-p保留累積機率達到閾值p的最小的top token組,然後在其中進行採樣。

top-p 相對於 top-k 的主要優勢是什麼?

與 top-k 的固定計數不同,Top-p 的候選集在模型有信心時會縮小,在不確定時會增加。

採樣前溫度參數有什麼作用?

較低的溫度將機率集中在頂級令牌上(更具確定性);較高的溫度使其變平(更加多樣化)。

為什麼對於開放式文本來說,純粹的貪婪解碼(始終是頂部標記)通常是不可取的?

貪婪解碼經常陷入重複,並且缺乏受控採樣所提供的自然多樣性。