發生了什麼事
2026 年 8 月 3 日發佈在 arXiv 上的八頁註釋報告稱,OpenAI 的《數學和理論計算機科學的十大進展》第 6 章中貪婪條件引理的印刷證明反轉了互補事件之間的條件。作者說引理的陳述是正確的,為印刷的過程提供了一個反例,並給出了他們描述為本地修復的更正證明。
Mikołaj Sienicki 和 Krzysztof Sienicki 於 2026 年 8 月 3 日在 arXiv 上發布的一條簡短說明報告了標題為「數學和理論計算機科學的十大進展」的 OpenAI 文檔第 6 章中引理的證明印刷中的錯誤。 arXiv 清單 (2608.14673) 在人工智慧下歸檔並交叉列出到量子物理,其元資料描述了一篇八頁論文和五個參考文獻。根據該說明,本章聲稱存在一個涵蓋所有有限兩人、一輪糾纏遊戲的指數並行重複定理——粗略地說,當共享量子糾纏的玩家同時玩多個副本時,擊敗此類遊戲的機會呈指數下降。
有爭議的步驟是註釋中所說的定量貪婪條件引理,在本章論證的早期使用。它的工作是選擇一小組座標 D,使得在玩家贏得 D 中的每個座標後,隨機選擇的剩餘座標以至少 1−δ 的平均機率獲勝。作者對這說法沒有異議;他們說這是正確的。他們的反對意見是其下方的論點。如所寫的,該過程的連續測試以平均成功率來表示,而下一步則需要存在一個具有較大條件失敗機率的特定座標。註釋說這個暗示是錯誤的。
為了支持這一觀點,作者給出了一個明確的反例,並表示即使是簡單的例子也可能使印刷的過程沒有有效的下一步——也就是說,編寫的循環可能會停止而不是產生它需要的座標。然後,他們確定他們所認為的預期延續條件,用失敗而不是成功來表示,並提供完整的糾正證明。他們將修復描述為局部的:引理的陳述沒有改變,本章其餘部分從中得出的參數也是如此,因此引用引理的下游步驟不需要重寫。
該說明異常明確地說明了它沒有建立的內容。作者寫道,他們的修正不應被視為對主要平行重複定理的獨立驗證;他們修復了一個早期的引理,而不是章節。從來源本身來看,有幾件事是未知的。它沒有指明哪個模型生成了該章節,沒有描述文本是如何生成的,也沒有說明在出版之前它接受了多少人工編輯。它不報告任何有缺陷或糾正的證明的機器檢查形式化,不包括 OpenAI 的任何回應,並且——作為 arXiv 預印本——沒有同行評審的跡象。在現階段,關於印刷校樣已損壞且修復有效的主張是作者的主張,可以接受他們所申請的相同審查。
為什麼這很重要
所報告的失敗並不是幻覺的引文或虛構的數字,而是隱藏在看似合理的論點中的一個單一的反向不等式——這種缺陷可以在略讀之後倖存下來,只有通過逐行閱讀才能發現。這是一個懸而未決的問題的具體數據點:人工智慧產生的數學在被依賴之前應該如何檢查。
大多數公眾對技術寫作中人工智慧錯誤的討論都集中在明顯的失敗上:捏造的引文、捏造的數字、在檢查時失敗的算術。這裡描述的缺陷是不同的物種。一個事件陳述的條件被寫在它的補充上-在需要失敗的地方成功。周圍的散文閱讀正確,被證明的引理是正確的,並且參數全部對齊。這種結合使得事情變得困難:這個論點在每個層面上都是合理的,除了決定它是否有效的層面。檢查語句、常數和整體形狀的審查者可以通過它,但仍然會錯過休息。
對於任何使用模型來起草推導、演算法正確性論證或協議分析的人來說,這都會產生實際的影響。確認結果為真與確認所提供的證據證實此結果是不同的。在這種情況下,這兩件事碰巧是可以分開的:主張成立,但推理卻失敗了。在其他情況下,同一類錯誤可能會支持一個完全錯誤的結論,而沒有外部檢查來發現它。人工智慧產生的數學的可行審查單元似乎是單獨的推理步驟,而不是定理,而這是昂貴的人類工作。
這事件也指出形式驗證是一種歧視工具。互補事件之間的極性反轉正是證明助手機械地捕獲的缺陷,因為所產生的物件的類型與下一步所需的類型不符。如同所描述的,本章是散文數學,以讀者一直以來檢視散文數學的方式進行檢視。隨著人工智慧系統產生的候選證明數量超出了專家的閱讀能力,可產生的內容與可審核的內容之間的差距不斷擴大,而機器檢查顯然是縮小這一差距的候選者。
對於閱讀本文的深度,需要謹慎一些。這是一篇文件的一章中的一個引理,由兩位作者在一篇八頁的註釋中報告。它沒有提供錯誤率,沒有與類似長度的人類編寫的證明進行比較,也沒有證據表明這種錯誤在人工智慧生成的數學中是罕見還是常見。人類撰寫的論文也存在可修復的錯誤,而文獻中也有這種類型的糾正註釋的悠久傳統。新的主題是:有缺陷的文本來自一個系統,該系統由一家對如何判斷其數學輸出產生濃厚興趣的公司發布。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
What is the best response when AI Models Explained makes a mistake in production?
接下來看什麼
OpenAI 是否承認或更正該章節,其他章節是否進行類似的審核,以及是否有人獨立驗證更正引理所輸入的主要平行重複定理。同樣值得關注的是機器檢查的形式化是否會成為人工智慧產生證明的規範。
首先要注意的是 OpenAI 是否有回應-包括勘誤、修訂章節或實質分歧。明顯的更正表明該文件正在像技術工件而不是演示一樣被維護;沉默會讓讀者將已發表的文本與第三方註釋進行核對。如果進行了修正,是否與此處提出的修正相符是一個值得追蹤的單獨問題,因為不同的修復可能不會保留稍後章節所依賴的參數。
其次,同一文件中的其他章節是否也受到類似的審查。單次審計只是軼事;對十項聲稱的進展進行一組獨立審計將開始描述收集的可靠性以及故障模式集中的位置。障礙在於,這種審查需要領域專家願意花很多時間研究別人的成果,而這樣做幾乎沒有傳統的學術獎勵。
第三,是否有人獨立驗證了修正引理支持的主要平行重複定理。作者明確表示他們沒有。在此之前,證據的狀態是,早期的一步現在已經有了作者認為合理的證據,而更大的主張仍然未經公開檢驗。機器檢查的章節形式化——甚至單獨的引理——將極大地改變結果可以承受的重量。
第四,規範是否圍繞著披露和審核人工智慧產生的數學形成:標記哪些論點是模型產生的,說明應用了哪些人工或自動檢查,並將未經驗證的證明視為草稿而不是結果。期刊和預印本伺服器在類似問題上進展緩慢。這篇筆記也是預印本,本身還沒有經過同行評審,因此它自己的接受程度——無論量子並行重複專家是否確認反例並接受修復——都是要遵循的內容的一部分。