返回新聞
創新AI Understanding 簡報

論文介紹「影子評估」:人工智慧代理完成了工程但未能通過兩個研究問題

一份由 24 位作者組成的預印本讓前沿 AI 代理嘗試解決兩篇未發表的 NeurIPS 2026 論文的核心研究問題,然後讓論文自己的作者對結果進行評分。特工們在六天內獨立完成了工程,但在研究中被明確拒絕。

6 min readRead the primary source
Source-provided image accompanying Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questions
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2607.27191
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

人工智慧(AI)
建構執行需要模式識別、推理、語言或決策的任務的系統的廣泛領域。
機器學習(ML)
允許系統從數據中學習模式並隨著時間的推移進行改進的方法。
人工智慧治理
指導人工智慧如何在社會中發展和使用的政策、標準和監督機制。
測試一下自己AI 代理測驗

發生了什麼事

2026 年 7 月 29 日發佈到 arXiv 並於 8 月 7 日修訂的預印本提出了一種衡量自動化人工智慧研究進展的新方法:向代理提供一篇高質量未發表論文的中心開放式問題,並讓該論文的原作者對輸出進行評分。在兩項試驗中,前沿特工在沒有人類幫助的情況下完成了工程,但被人類分級人員拒絕了,作者確定了五種反覆出現的故障模式。

arXiv 上的預印本於 2026 年 7 月 29 日提交並於 2026 年 8 月 7 日修訂,詢問人工智慧代理是否可以進行開放式人工智慧研究。該資料庫列出了 24 名作者,包括 Peter Kirgis、Sayash Kapoor、Helen Toner、Gillian Hadfield、Seth Lazar、Rishi Bommasani 和 Arvind Narayanan,並在人工智慧、電腦與社會以及機器學習項下歸檔。其核心貢獻是一種被作者稱為「影子評估」的測量方法:向智能體提供一篇高品質但未發表的論文的核心、開放式研究問題,然後論文的原始作者對智能體產生的結果進行評分。

作者將此視為他們認為不充分的兩種現有方法之間的第三種選擇。他們寫道,目前的智能體評估要么在狹隘的、可驗證的任務上測試智能體——從結構上排除了開放式研究——要么將人工智能生成的論文提交給盲目的同行評審,他們認為這種評審過度緊張、隨機且評審質量較差。相反,影子評估使用已經了解該問題、其文獻及其陷阱的人作為評分者,因為他們有一個未發表的答案可供比較。

該團隊在向 NeurIPS 2026 提交的兩份未發布的提交中運行了該方法。根據摘要,前沿代理每次嘗試需要六天的時間和數千美元的計算量。這些代理人在沒有人類幫助的情況下完成了所有工程——程式碼、實驗、基礎設施——但無法在回答研究問題本身方面取得實質進展。用作者的話來說,這兩篇論文都被當成審稿人的原作者明確拒絕。

作者從成績單中提取了五種反覆出現的失敗模式:對可發表研究的標準判斷不佳;對研究設計中的缺陷做出的缺乏創造性的反應;從死胡同中無效回溯;資源意識差;和指令漂移。他們報告說,使用第二個模型和第二個支架進行的穩健性檢查重現了相同的故障,這反駁了結果是某個特定係統或線束的偽影。該團隊表示正在發布專家評論、調查回應、代理儲存庫和日誌。

摘要中沒有確定的一些事情值得明確說明。它沒有指明使用了哪些代理、模型或支架,也沒有指明穩健性檢查中的第二個系統。它沒有識別兩個 NeurIPS 提交的內容或其子字段,沒有給出超出「數千美元」的精確計算數字,沒有描述評分標準,也沒有說明評分者是否對他們正在審查代理輸出的事實視而不見。該作品是預印本;來源中沒有任何內容表明它已完成同行評審。樣本是兩個研究問題,由提出問題的人評分。

來源詳情: arxiv.org

為什麼這很重要

人工智慧進步將急劇加速的論點基於人工智慧系統可以接管人工智慧研究本身的前提。這是直接的(即使是很小的)證據,表明前提尚未成立,並且它將代理人已經可以做的部分(實施)與他們不能做的部分區分開來:判斷什麼值得發表,重新設計有缺陷的研究,並放棄死胡同。

該論文的框架直接針對目前人工智慧預測中的承載假設。正如摘要所說,人工智慧爆炸性進展的預測取決於人工智慧代理自動化人工智慧研究——更好的系統建立更好的系統的循環。這種循環經常被斷言,但很少被測量,因為自動化的工作正是那種抵制評分腳本的工作。與已知答案的任務的基準分數相比,由工作研究人員對即時的、未解答的問題產生分級結論的方法是對該假設的更直接的探索。

結果是在工作的中間畫了一條線,而不是圍繞著它。代理人在無人值守的情況下運行了多天的實驗程序,並產生了工作代碼和結果——這是一種真正的能力,也是與幾年前相比有意義的變化。他們沒有做的是決定研究是否值得發表的部分:認識到結果很薄弱,發明一種解決設計缺陷的方法,並知道攻擊線何時消失。對於決定在研究或工程管道中放置代理的團隊來說,這種差異比整體能力分數更具可操作性。

五種失效模式中的兩種具有普遍性,遠遠超出了研究範圍。資源意識差(在不進行調整的情況下消耗固定的計算或時間預算)和指令漂移(代理逐漸停止執行其要求的操作)是任何長期自主部署(從多天編碼代理到操作自動化)中反覆出現的問題。按照評估標準,這裡為期六天的跑步時間異常漫長,而長遠的視野恰恰是這些失敗有可能在人們注意到之前複合的地方。

這些限制是真實存在的,作者並沒有隱藏它們。在一個地點進行的兩個案例研究,根據一份模型快照進行評估,並不能支持關於代理人明年能夠做什麼的說法。這是帶有時間戳的空結果。作者評分者對他們選擇研究的問題也有明顯的利害關係,而這種方法在一定程度上會消耗掉自己:論文一旦發表,其研究問題就不能再充當看不見的測試。發布評論、儲存庫和日誌是使發現可檢查的原因,而不是值得信賴的聲明。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
互動式概念檢查+10 Points
AI Agents Quiz

What most distinguishes an AI agent from a basic chatbot?

接下來看什麼

是否以盲法、預先註冊的分級方式大規模重複影子評估;當針對已發布的存儲庫和日誌重新運行時,新的代理和腳手架是否縮小了差距;以及這五種失敗模式是否經得起獨立審查和同行評審。

首先要注意的是影子評估是否會成為一種可重複的工具,還是仍然是一次性的演示。這將意味著更多的論文跨越更多的場地和子領域,在代理運行之前預先註冊的評分標準達成一致,並且評分不考慮輸出是來自代理還是人類。這也意味著解決供應問題:該方法需要穩定的高品質未發表作品,其作者願意為代理人的嘗試花費真正的審查精力。

第二個問題是差距是否縮小以及縮小的速度。由於代理存儲庫和日誌正在發布,其他小組可以針對相同的兩個研究問題重新運行新的模型和支架並直接進行比較。觀察改進是否表現為更好的工程——代理人已經這樣做了——還是表現為判斷失誤的行動,這是論文所說缺失的部分。重新運行產生更多實驗但同樣的拒絕,與產生原始作者認真對待的論文的信號不同。

第三,對已發布的工件進行獨立審查。五種失敗模式是作者閱讀自己的筆錄;其他閱讀相同日誌的研究人員可能會對故障進行不同的分類,或發現一些故障歸因於支架和提示而不是模型。預印本是否通過同儕評審,以及其分類是否能經得起其他人的評估,將決定它的分量。

最後,研究界之外的吸收。作者名單包括直接從事人工智慧治理和政策工作的人員,以及自動化人工智慧研發納入前沿安全框架、能力閾值和國家政策辯論的時間表。觀察這些證據是否在這些環境中被引用,以及是否被準確報道:該論文基於兩個案例表示,當今的特工在研究生命週期的關鍵部分中苦苦掙扎——並不是說他們永遠無法進行研究,也不是說他們所展示的工程能力微不足道。

相關指引和測驗

人工智慧代理AI 的未來人工智慧模型解釋測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語
覺得有用嗎?