代理循環中的自我反思
自我反思讓人工智慧代理在任務中批評自己的產出和行動,然後根據該批評進行修改。
概述
It turns a one-shot guesser into a system that catches and fixes its own mistakes.
深入探討
在代理循環中,語言模型採取操作(呼叫工具、編寫程式碼、應答)、觀察結果並決定下一步要做什麼。自我反思增加了一個深思熟慮的步驟,模型在繼續之前評估其最近的工作。像 Reflexion (2023) 這樣的框架使這一點具體化:在一次失敗的嘗試之後,智能體會寫一個簡短的口頭批評(“我忘記處理空列表案例”)並將其存儲在內存中,因此下一次嘗試以該教訓為條件。 Self-Refine 使用相同的模型來產生回饋,然後迭代地重寫其答案。反思可以來自將輸出與目標進行比較、檢查錯誤訊息或執行測試。其回報是在編碼、網路導航和數學等多步驟任務上具有更高的可靠性,其中單次傳遞經常失敗,但批評和重試循環會成功。
技術洞察
反思通常作為額外的提示來實現:模型被要求充當其自身行為記錄的批評者,產生自然語言回饋,然後將其附加到上下文中以供下一次嘗試。反射將這些批評儲存在試驗中的情景記憶緩衝區中,而不是微調權重,因此學習完全在上下文中進行。驅動反射的訊號可以是外部的(測試通過/失敗、工具錯誤)或自身產生的,而外部訊號往往更加可靠。
戰略影響
成本與預算
多年來,架構決策決定著效能和營運成本。
更明確的決策
技術教育幫助團隊選擇正確的堆疊,而不僅僅是最新的堆疊。
品質管控
更好的工程選擇可以減少生產中的可靠性事故。
代理循環中自我反思的未來
期望反射成為內建的代理原語,而不是提示技巧,經過訓練的模型可以知道反射何時值得額外的令牌以及何時會消耗計算量。驗證者模型和執行回饋將越來越多地進行自我批評,這樣代理人就不再幻想錯誤的答案是正確的。研究還針對失敗模式,其中模型自信地確認糟糕的工作,推動校準、基於證據的反思和學習的循環停止標準。
現實世界的實施
編碼代理執行失敗的單元測試,讀取回溯,寫入指出差一錯誤的反射,並在下一個循環迭代中重寫函數。
點擊錯誤連結的網路瀏覽代理程式會反映在它所登陸的頁面上,識別出與其目標不符的情況,並回溯以嘗試不同的連結。
研究助理起草一份答案,批評其不受支持的主張,並在返回之前進行修改以添加引文或對沖不確定的陳述。
數學求解代理根據問題約束檢查其最終答案,注意到單位不匹配,並重新計算而不是提交有缺陷的結果。
風險與防護欄
優化一項基準測試可以隱藏更廣泛的系統弱點。
基礎設施和維護成本常常被低估。
隨著系統變得更加複雜,安全性和可觀察性差距可能會擴大。
實施路線圖
在實施之前定義延遲、品質和成本目標。
在實際負載和資料條件下進行基準測試。
儀器監控錯誤、漂移和使用者影響。
在擴展之前準備回滾和事件回應路徑。
不斷探索
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Reflection in Agent Loops quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
常見問題
What is Self-Reflection in Agent Loops?
自我反思讓人工智慧代理在任務中批評自己的產出和行動,然後根據該批評進行修改。它將一次性猜測器變成了一個可以捕獲並修復自身錯誤的系統。
自我反思為標準代理循環添加了什麼?
自我反思插入了一個評估步驟,其中代理批評其最近的行動或輸出,並使用該批評來指導其下一步。
在Reflexion框架中,模型的自我批判儲存在哪裡?
反思將口頭自我批評保留在情景記憶緩衝區中,並在以後的試驗中將其反饋到上下文中,因此學習是在上下文中進行的,而不是透過體重更新進行的。
哪種反射回饋訊號最可靠?
接地的外部訊號(例如失敗的測試或運行時錯誤)會提供具體的、值得信賴的回饋,而純粹自我產生的批評可能是錯誤的。
已知的自我反思失敗模式是什麼?
如果沒有紮實的回饋,模型有時會審查有缺陷的工作並錯誤地得出結論:它沒問題,因此外部驗證很重要。
自我完善方法通常如何產生回饋?
Self-Refine 有一個模型對其草稿產生回饋,然後使用該回饋迭代修改輸出。