Perplexity 與語言指標
Perplexity 是衡量語言模型對真實文本的「驚訝」程度的經典分數 - 較低意味著它更自信地預測單字。
概述
It and metrics like BLEU and ROUGE are how researchers actually measure whether a model is getting better.
深入探討
語言模型為每個下一個單字分配一個機率。 Perplexity 將這些機率轉換為一個數字,該數字詢問:平均而言,模型在每一步中都會做出多少個同等可能的選擇?如果模型完全自信且正確,則困惑度為 1;如果模型完全正確,則困惑度為 1;如果在50,000個單字中統一猜測,則困惑度為50,000。越低越好。它是平均每個單字損失的數學指數,因此它直接追蹤訓練。但困惑度只衡量下一個單字的預測,而不衡量輸出是否有用、真實或寫得好。這就是為什麼生成任務添加了 BLEU(用於翻譯的 n-gram 重疊)和 ROUGE(用於摘要的重疊)等指標,以及為什麼現代評估越來越依賴人類評分和任務基準的原因。
技術洞察
Perplexity 等於模型分配給保留文字的平均負對數似然指數:exp(-(1/N) * log P(單字 | 前一個單字)) 的總和。它實際上是交叉熵損失的轉換版本,只是表示為有效分支因子而不是位元或 nat。因為它取決於模型的確切詞彙和分詞器,所以困惑度值只能在共享相同分詞的模型之間進行比較——直接將詞級模型與子詞模型進行比較是沒有意義的。
戰略影響
速度與規模
語言工作流程可以在不犧牲一致性的情況下更快地移動。
交通與覆蓋範圍
它擴展了跨語言和溝通方式的訪問。
更明確的決策
團隊可以花更多時間進行判斷,而自動化則可以處理重複。
Perplexity 與語言指標的未來
Perplexity 將繼續作為核心訓練時診斷,因為它成本低廉並且可以順利追蹤優化,但該領域在判斷真實能力方面已經很大程度上超越了它。隨著模型飽和,評估正在轉向任務基準,例如 MMLU、人類偏好排名以及法學碩士作為法官對有用性和正確性的評分。預計困惑度仍將是工程師在預訓練期間觀察的儀表板指標,而公眾聲稱模型「更好」的說法依賴於基準套件和麵對面的人類評估,而這些評估無法捕捉推理和真實性。
現實世界的實施
在預訓練期間追蹤驗證困惑,以確認模型仍在學習並檢測模型何時開始過度擬合
使用 BLEU 分數將新機器翻譯系統與人工參考翻譯進行比較
報告 ROUGE-L 重疊,以根據黃金標準摘要對新聞摘要模型進行基準測試
比較同一保留語料庫上的兩個模型檢查點,以確定哪一個更自信地預測文本
風險與防護欄
幻覺的事實可以悄悄地進入報告、支持流程或研究成果。
及時的敏感性可能會在類似的請求中產生不一致的結果。
如果存取控制薄弱,敏感文字資料可能會暴露。
實施路線圖
在推出之前定義輸出格式、語氣和品質標準。
當準確性很重要時,請使用可信任來源進行地面回應。
為高風險輸出保留人工審查檢查點。
追蹤故障模式並定期重新訓練提示或工作流程。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Perplexity and Language Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Perplexity and Language Metrics?
Perplexity 是衡量語言模型對真實文本的「驚訝」程度的經典分數 - 較低意味著它更自信地預測單字。它以及 BLEU 和 ROUGE 等指標是研究人員實際衡量模型是否變得更好的方式。
較低的困惑度分數顯示語言模型的什麼?
Perplexity 衡量模型對真實文本的驚訝程度;較低的困惑度意味著它為實際的下一個單字分配了更高的機率,因此它的預測更加自信。
Perplexity 在數學上是從哪個訓練量導出的?
Perplexity 是平均負對數似然的指數,使其成為模型經過訓練以最小化的交叉熵損失的直接變換。
模型在不進行學習的情況下為 10,000 個單字的詞彙分配統一的機率。它的困惑是什麼?
Perplexity 是同等可能選擇的有效數量。超過 10,000 個單字的純統一猜測會產生 10,000 的困惑度。
為什麼兩個不同模型的困惑度分數在直接比較時會產生誤導?
由於困惑度是按標記計算的,因此單字級模型和子單字模型以不同的方式分割文本,使得它們的原始困惑度值無法直接比較。
哪個指標與透過 n-gram 與參考重疊來評估機器翻譯最相關?
BLEU 測量系統翻譯和人類參考之間單字 n 元語法的重疊,是翻譯評估的長期標準。