發生了什麼事
一項新的 arXiv 案例研究描述了人工智慧研究系統如何幫助數學家改進格洛騰迪克常數的已知界限,這是一個可追溯至 1953 年的開放問題。本文介紹了數學結果,並詳細記錄了系統在哪些方面表現良好、在哪些方面必須由人來引導,以及哪些主張仍需機器驗證而不是人工驗證。
格洛騰迪克常數衡量了困難的組合最佳化問題和更容易處理的半定鬆弛問題之間的差距。作者報告了一個新的區間,其下限為 6pi/11,約為 1.7135,上限約為 1.7818。配套的數學論文提供了證明。下界結果值得注意,因為它不建構硬實例;相反,它會產生適用於相關舍入方案的障礙。
此研究系統將推理模型與編碼代理結合。論文稱,該運行使用 GPT-5.5-Pro 和後來的 GPT-5.6-Sol 進行推理,並使用 Claude Code 與 Opus 和後來的 Fable 5 進行執行,並使用四 GPU 節點進行數值搜尋。會議透過文件、筆錄、實驗日誌和摘要來保持連續性,將主張記錄為經過驗證的、有數字支持的、推測的或啟發式的,而不是依賴於一個不間斷的上下文。
該運行涵蓋了從 6 月 16 日到 7 月 24 日的大約 240 個研究會議,其中有 2,091 次推理模型調用和估計 1.52 億個代幣,API 成本估計為 5,400 美元。大約 40 條過時的人類指令指導了這項工作。當上限搜尋趨於穩定時,操作員意識到重複失敗可能表示存在普遍障礙,並將系統重定向到下限參數。該論文將研究方向的改變描述為人為幹預,而不是自主決策。
該系統產生了一個中央重構和 6pi/11 下界的完整證明,然後作者對其進行了修改和獨立驗證。它還產生了透過內部檢查協議的更強的數值上限和下限候選,但作者尚未獨立驗證這些證書,也沒有將它們表述為定理。因此,本文將經過驗證的數學結果與系統更具推測性或機器測試的輸出分開。
來源詳情: Long-horizon AI mathematics case study on arXiv ↗
為什麼這很重要
該研究提供了關於人工智慧在整個研究項目而不是單一基準任務中使用的異常具體的證據。它最重要的發現是分工:系統在技術執行方面很強,而人類研究人員仍然負責議程設定、判斷和最終驗證。
對於人工智慧系統來說,長期研究是困難的,因為隨著失敗方法的積累,目標可能會改變。一個有用的合作者必須保留已經嘗試過的東西,區分死胡同和未解決的想法,並決定何時一個新問題比另一個局部優化更有價值。作者基於文件的記憶和聲明標籤是為了使研究狀態可見且可審計,而不是讓流暢的反應來代替進度。
下限發現表明,即使智能體可以執行數學運算,人類的判斷仍然很重要。操作員注意到許多嘗試的構造都以同樣的方式失敗,並提供了概念支點:證明重複的障礙本身。然後,該系統幫助形式化並證明了這一論點。這個序列更接近監督探索,而不是獨立的機器數學家,在描述證據支持的內容時,這種差異很重要。
獨立驗證是結果的發布門。該案例研究稱,作者檢查了下限,完整的證明出現在配套論文中。它並沒有說運行期間產生的每個數字都是正確的。將定理層面的主張、機器測試的候選者和假設分開,為讀者提供了評估貢獻的方法,而無需接受人工智慧系統的內部信心作為數學證明。
對於研究組織來說,實作課程是可操作的。人工智慧系統可以搜尋文獻、編寫程式碼、運行實驗、保留失敗的嘗試並提出轉換建議,但周圍的工作流程需要出處、可重複的計算、明確的人工檢查點以及重建團隊改變方向的原因的方法。報告的成本和計算也清楚地表明,長期能力不僅是模型智能的問題,也是模型智能的問題。這取決於腳手架、時間和持續的監督。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
What most distinguishes an AI agent from a basic chatbot?
接下來看什麼
下一個問題是這種協作模式是否可以推廣到一個問題和團隊之外,以及獨立研究人員是否可以在衡量每個人和人工智慧貢獻的成本和可靠性的同時重現經過驗證的結果。
複製應該測試其他數學領域、問題類型以及具有不同記憶體和工具設計的研究系統。格洛騰迪克問題已經有了一個實質的人工建造框架、累積的筆記、認證機制和候選方向。先前的結構有助於運行,因此未來的研究應該報告預先提供了多少研究狀態,以及當系統必須定義問題本身時結果如何變化。
研究人員還應該使用前瞻性措施將技術執行與研究判斷進行比較。有用的指標可以包括所選方向的品質、放棄失敗路徑的時間、不受支持的主張的比率、人工幹預的數量以及通過獨立檢查的輸出的比例。完善的案例研究可以展示發生的情況,但需要進行受控比較來估計人工智慧協作者何時改進流程,而不是簡單地添加另一層審查。
機器驗證和人工驗證之間的界限值得持續關注。區間算術、證明助手、測試和對抗性審計可以發現許多錯誤,但證書仍然可能編碼錯誤的目標或依賴從未受到質疑的假設。後續工作應該發布完整的工件,重新運行最強的未經驗證的邊界,並使失敗或撤回的結果與成功的結果一樣可見。
最後,應在許可和隱私允許的情況下保留模型版本、提示、指導指令、程式碼、計算和記錄。目前的論文之所以有價值,部分原因在於它報告了這些條件並描述了該系統的弱點,包括脆弱的研究狀態代表性和有限的判斷自主權。在其他團隊重現模式之前,這是人工智慧輔助數學進步的有力證據,而不是人工智慧系統可以獨立進行開放式研究的證據。