發生了什麼事
8 月 11 日發布的新預印本將代理程式編碼儲存庫中觀察到的故障模式命名為「災難性記憶」:專案指導文件不斷累積規則,因為添加預防措施的成本很低,而安全刪除舊規則在其原始原理消失後變得更加困難。
研究人員從包含 CLAUDE.md 等文件的 1,867 個公共儲存庫中收集了 247,694 個指令生命週期和 299,440 個提交到提交的轉換。他們透過編輯追蹤各個指令,並報告說,在觀察到的生命週期內,文件增長了 226%,每次修改提交平均添加 4.9 條淨指令。該研究將這些數字視為樣本中持續累積的證據,而不是證明每條指令都是不必要的或所有代理編碼項目的行為方式都相同。
本文的核心機制是不對稱證據。維護者或編碼代理可以在錯誤後附加新指令,而無需重建已存在的規則之間的每個互動。稍後刪除的風險更大:一旦激勵失敗和周圍環境消失,刪除一個指令可能需要檢查它是否仍然可以防止在剩餘指令的許多組合下出現回歸。在儲存庫資料中,估計的刪除風險隨著指令老化而下降,報告的每次提交的日誌風險斜率為 -0.032。
為了測試可能的補救措施,作者透過反轉 IFEval 約束創建了指令追蹤任務,然後將包含裸規則的提示與也保留解釋每個規則存在原因的簡短註釋的提示進行比較。在他們的受控設定中,未註釋的提示累計了 211.3% 的超額指令,而帶註釋的提示則超額了 1.4%。這些註釋並不是模型的額外命令;它們是緊湊的出處,旨在使以後的移除決定可審計。
團隊也評估了更小、記錄更完善的提示是否有助於客服人員遵循指示。根據其由 WildIFEval 得出的基準,該論文報告稱,當保留基本原理並刪除過時的規則時,收益可提高高達 23.1 個百分點。這些結果來自新發布的未經同行評審的預印本。這項工作並沒有證明僅靠評論就能改善每個編碼代理、儲存庫、語言或生產工作流程。
來源詳情: Catastrophic remembering research paper on arXiv ↗
為什麼這很重要
儲存庫級指令檔案正在成為編碼代理的持久操作內存,因此不受控制的增長可能會提高代幣成本,保留過時的約束,並使人們更難理解管理自動程式碼變更的規則。
實際風險不僅僅是一個長文件。每條指令都會爭奪模型的注意力,並且可以與更新的規則、工具描述、程式碼上下文和使用者的請求進行互動。在程式碼庫更改後,為防止歷史故障而編寫的指令可能會變得無關緊要,與新策略衝突或過度限制不相關的工作。如果沒有人能夠重建它存在的原因,那麼最安全的本地選擇通常是保留它,這會將清理成本轉移到未來的提交中。
這種模式比 CLAUDE.md 更重要。團隊越來越多地將約定、安全邊界、測試命令、架構決策和部署注意事項儲存在機器可讀的專案指南中。這些文件可以提高一致性並減少重複錯誤,但它們也成為治理表面:人們應該能夠識別誰引入了相應的規則,什麼證據證明它是合理的,以及什麼條件允許它被淘汰。理由註釋是該審計追蹤的輕量級版本。
結果提出了一個有用的智能體記憶設計原則:記憶應該包括遺忘的條件。系統可以保留觀察到的故障、規則的範圍、相關組件或測試以及審查觸發器,而不是只記錄「總是做 X」。這不會自動刪除,但它為後來的維護者提供了證據,以決定該約束是否仍然保護正確性或僅反映舊環境。
當編碼代理接觸更重要的軟體時,也存在著公共利益的角度。累積的私人指令可以悄悄地影響安全決策、可存取行為、資料處理或代理程式對故障的回應方式。較小的文件不一定會更安全,積極的清理可能會消除重要的保護措施。有用的結果是可追溯性:更少的無法解釋的規則、明確的所有權以及允許人類挑戰添加和刪除的審查實踐。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
crm_get_transaction(id='4092').What most distinguishes an AI agent from a basic chatbot?
接下來看什麼
下一個測試是跨語言、組織、代理產品和長期儲存庫的獨立複製,然後進行前瞻性試驗,衡量記錄的清理是否可以在不刪除重要保護措施的情況下提高程式碼品質。
觀察樣本有選擇限制。提交代理指令檔案的公共儲存庫可能與私人企業程式碼庫不同,且儲存庫歷史記錄無法揭示激發規則的每個平台外討論或事件。當專案擴展時,成長也可以是理性的。未來的分析應該將新元件的有用覆蓋範圍與重複、矛盾或過時的指令分開,並報告結果如何因儲存庫年齡、大小、語言、貢獻者數量和代理平台而變化。
對照實驗需要更廣泛的驗證。這些任務源自於指令追蹤基準測試,而不是數月的即時軟體維護,論文的匹配流程是在 50 個轉換樣本上進行檢查的。一位作者製作了部分驗證中使用的手工註釋。該研究沒有涵蓋非英語教學文件,也沒有涵蓋用於決定更改何時算是重寫而不是教學延續的每個閾值。
評論可以像保留正確的理由一樣容易地保留不正確的理由。因此,團隊應該針對替代方案(例如連結問題、失敗的回歸測試、到期日期、所有權欄位或標記重複和衝突指令的自動檢查)來測試結構化來源。最安全的工作流程將建議刪除、顯示證據和受影響的測試,並要求審查高影響力的規則,而不是允許代理人僅為了保存令牌而修剪指令。
有用的後續證據將衡量端到端結果:提示大小、指令合規性、任務成功、回歸、審查時間以及刪除後恢復的規則數量。研究人員還應該測試模型是否確實按照預期使用了基本原理註釋,或者有時將它們誤認為是附加要求。在這些結果出現之前,災難性記憶是對作者資料集和實驗的充分支持的描述,而不是普遍法則或大規模刪除成熟專案指導的理由。