語言人工智慧指南

自一致性解碼

自洽是一種解碼策略,它從語言模型中取樣許多不同的推理路徑,然後選擇大多數人都同意的答案。

閱讀時間約2分鐘最後更新

概述

It matters because a single greedy answer can be wrong, while the consensus across diverse attempts is far more often correct.

深入探討

由 Google 研究人員於 2022 年引入,自一致性取代了通常的「貪婪」解碼,即模型透過採樣和投票方法在每一步承諾單一最有可能的下一個標記。這個想法建立在思維鏈提示的基礎上:模型被要求逐步推理,但它不是產生一條鏈,而是使用非零溫度對許多不同的鏈進行取樣。每條鏈可能採取不同的路線,但正確的推理往往會收斂於相同的最終答案,而錯誤則分散在不同的方向。然後系統對最終答案進行多數投票。這個簡單的改變在算術和常識推理基準(例如 GSM8K)上產生了巨大的進步,通常無需任何重新訓練即可實現兩位數的精度提升。

技術洞察

這個方法利用了這樣的直覺:有許多有效的方法可以得出正確的答案,但有無數的方法會導致錯誤。透過對 40 個溫度高於零度的鏈進行取樣,該模型會產生不同的推理。只有最終答案是透過邊緣化式的多數投票來總結的;推理文本被丟棄。準確度通常會隨著樣本的增加而提高,但回報會遞減,並用額外的推理計算來換取可靠性。它不需要標記資料或微調。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

自一致性解碼的未來

自一致性是推理時間擴展的一個基本範例,它的後代現在為推理模型提供動力,這些模型花費額外的計算來更深入地思考。未來的方向包括透過學習驗證者或置信度分數對投票進行加權,而不是平均計數,根據問題難度自適應地選擇要抽取的樣本數量,並將投票與思想樹等搜尋框架結合。當正確性比延遲更重要時,期望它仍然是一個廉價的、免訓練的基線,任何系統都可以分層。

現實世界的實施

透過對許多解決方案路徑進行取樣並對最終數字進行投票,提高小學數學應用問題 (GSM8K) 的準確性。

提高多步驟常識性問題回答的可靠性,其中單一鏈可能會因一個推論而出錯。

透過檢查樣本中哪個輸出最一致,提高對程式碼產生答案的信心。

加強符號或邏輯推理任務,其中不同的推導應匯聚成一個正確的結論。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Self-Consistency Decoding quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

美杜莎解碼頭

常見問題

What is Self-Consistency Decoding?

自洽是一種解碼策略,它從語言模型中取樣許多不同的推理路徑,然後選擇大多數人都同意的答案。這很重要,因為單一的貪婪答案可能是錯的,而不同嘗試的共識往往是正確的。

自一致性解碼背後的核心思想是什麼?

自我一致性對多個不同的推理鏈進行取樣,並選擇大多數推理鏈都同意的最終答案。

為什麼取樣不同的推理路徑有助於準確性?

獲得正確答案的有效途徑有很多,但犯錯的方式也有無數種,因此正確答案會聚集在一起,而錯誤會分散,從而使大多數答案更加可靠。

自一致性取代了什麼解碼方法?

與其貪婪地致力於一條最有可能的路徑,不如在多條路徑上進行自我一致性採樣和聚合。

每個採樣鏈的哪一部分實際用於最終投票?

中間推理被丟棄;僅透過多數票匯總最終答案。

使用自洽的主要成本是什麼?

產生幾十條推理鏈,推理成本倍增;隨著樣本數的增加,準確度會提高,但效益會遞減。