語言人工智慧指南

測試時計算擴展

測試時計算擴展意味著在模型回答問題時給予模型更多的思考時間和計算,而不是僅僅在訓練期間使其更大。

閱讀時間約2分鐘最後更新

概述

It is the breakthrough behind 'reasoning models' that can solve hard math and coding problems by deliberating before responding.

深入探討

多年來,人工智慧的進步意味著擴展訓練:更多數據、更多參數、更多預訓練計算。測試時計算縮放添加了第二個軸,在推理上花費更多計算。推理模型不是立即給出答案,而是產生一個很長的內在思考鏈,探索步驟、檢查工作和回溯。技術包括擴展思想鏈、對許多候選解決方案進行採樣並選擇最佳解決方案(自洽或 N 中最佳),以及由驗證者或獎勵模型引導的樹式搜尋。 OpenAI 的 o1 和 o3、DeepSeek-R1 和 Claude 的擴展思維普及了這一點:當你讓模型「思考得更久」時,競賽數學和程式設計的準確性會急劇上升,在快速回答失敗的情況下,用延遲和成本來換取問題的正確性成本。

技術洞察

該模型透過強化學習進行訓練,以產生有用的推理標記,然後在推理時分配「思考預算」。更多的代幣可以讓它分解問題、捕獲自己的錯誤並進行自我驗證。 Best-of-N 取樣和驗證者引導的搜尋添加了平行計算:產生多次嘗試,對它們進行評分,保留獲勝者。至關重要的是,具有大量測試時間計算能力的較小模型可以與立即給出答案的較大模型相匹配,從而重塑成本曲線。

戰略影響

速度與規模

語言工作流程可以在不犧牲一致性的情況下更快地移動。

交通與覆蓋範圍

它擴展了跨語言和溝通方式的訪問。

更明確的決策

團隊可以花更多時間進行判斷,而自動化則可以處理重複。

測試時計算擴展的未來

測試時計算現在是與訓練一起的主要擴展槓桿。預計模型會根據難度來決定思考的難度,透過將長鏈提煉為較短的鏈來進行更便宜的推理,以及將思維與工具呼叫和網路搜尋交織在一起的「代理」循環。隨著推理硬體的改進,深思熟慮的推理將成為科學研究、軟體工程和複雜規劃等高風險任務的預設方式,而快速查找將保持快速且廉價。

現實世界的實施

OpenAI 的 o1 和 o3 模型逐步思考奧林匹克層級的數學問題,在 AIME 和競賽基準上顯著超越即時答案模型。

DeepSeek-R1 使用強化學習來教導長鏈思維推理,公開展示了額外推理計算帶來的巨大準確性提升。

Claude 的擴展思維模式允許開發人員設定令牌預算,以便模型在回復之前對複雜的編碼或分析任務進行更長時間的推理。

AlphaCode 和類似的系統在測試時對數千個候選程式進行取樣,然後對它們進行過濾和排名以解決競爭性程式設計挑戰。

風險與防護欄

幻覺的事實可以悄悄地進入報告、支持流程或研究成果。

及時的敏感性可能會在類似的請求中產生不一致的結果。

如果存取控制薄弱,敏感文字資料可能會暴露。

實施路線圖

1

在推出之前定義輸出格式、語氣和品質標準。

2

當準確性很重要時,請使用可信任來源進行地面回應。

3

為高風險輸出保留人工審查檢查點。

4

追蹤故障模式並定期重新訓練提示或工作流程。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Test-Time Compute Scaling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

測試時間增加

常見問題

What is Test-Time Compute Scaling?

測試時計算擴展意味著在模型回答問題時給予模型更多的思考時間和計算,而不是僅僅在訓練期間使其更大。這是「推理模型」背後的突破,可以透過在回應之前深思熟慮來解決困難的數學和編碼問題。

「測試時計算」指的是什麼?

測驗時(推理時)計算是產生答案時完成的工作,與預訓練期間使用的計算不同。

像 o1 這樣的推理模型如何使用額外的測驗時來計算?

他們會進行擴展的逐步推理、探索和檢查解決方案,然後做出最終答案。

測試時計算擴充的核心權衡是什麼?

讓模型思考更長時間可以提高解決難題的正確性,但會增加回應時間和計算成本。

什麼是「N 次最佳」採樣?

Best-of-N 並行產生多個解決方案嘗試,並使用評分器或驗證器來保留最強的一個,這是測試時間縮放的一種形式。

為什麼測試時計算被視為新的「縮放軸」?

多年來,規模化意味著更大規模的訓練;測試時計算增加了第二種提高能力的方法,即在推理時進行更多計算。