發生了什麼事
GIGAZINE 報告稱,Devin 背後的公司 Cognition 發布了 Fusion,這是一款旨在改進先進人工智慧模型計劃、執行、審查和從停滯任務中恢復的工具。該系統將用於規劃和審查的高端模型與用於執行的較便宜模型配對,同時使用單獨的上下文和工具並行運行兩個代理程式。
GIGAZINE 報導稱,Cognition 開發並發布了 Fusion,作為 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Fable 的工具。本文將線束描述為為模型提供操作指令、工具使用規則和條件分支的層,可能會影響代理是否完成任務或陷入循環。
據 GIGAZINE 稱,Fusion 將最先進的規劃和審查模型與具有成本效益的執行模型相結合。 Cognition 推薦 GPT-6 Astra 和 Claude Fable 作為高級模型,並將 Cognition 的 SWE-2 編碼模型視為更便宜的執行選項。文章稱此組合與 Claude Fable 5.1 的效能最佳。
GIGAZINE 報告稱,使用 Claude Code 的 Claude Fable 5.1 的基準分數為 62.2,而結合低成本模型和 Fusion 的 Claude Fable 5.1 的基準分數為 61.7。據報道,後一種組合便宜 36%。對於 GPT-6 Astra,文章稱 Fusion 實現了與 Codex 相當的性能,同時成本降低了 39%。
文章將評價歸功於人工智慧分析公司Artificial Analysis和Vals AI。它說,Fusion 並行運行兩個代理,每個代理都有獨立的上下文和工具,並且僅交換摘要、結果和回饋,而不是完整的對話。 GIGAZINE 表示,這種方法更常利用了即時快取。該來源沒有提供完整的基準方法、絕對價格或可用性條款。
為什麼這很重要
如果報告的結果成立,Fusion 可以降低使用前沿人工智慧代理的成本,而編碼效能不會出現類似的損失。這對於大規模運行使用工具的系統的開發人員和組織來說很重要,其中模型推理和重複的代理嘗試可能成為主要費用。結果由 GIGAZINE 報告,並由 Artificial Analysis 和 Vals AI 評估,但來源沒有提供足夠的方法來獨立評估比較。
報告的結果表明,代理架構可以對前沿模型的經濟性產生重大影響。將執行委託給更便宜的模型,同時保留更強大的規劃和審查模型的系統可以降低軟體代理的成本,而不需要用戶放棄更高功能的模型。
成本降低對於編碼代理尤其重要,編碼代理可能會進行許多工具呼叫、重複失敗的嘗試或維護較長的上下文。如果可以獨立重現,所報告的 36% 和 39% 的減少可能會影響公司設計生產代理工作流程以及在專有工具之間進行選擇的方式。
所提供的報告中的證據仍然有限。 GIGAZINE 提供選定的分數和節省百分比,但不提供任務集、運行計數、定價假設、延遲、故障率或比較條件。因此,所聲稱的與 Codex 的等效性和所述的效率增益在此並未獨立確認。
互動機制:它實際上是如何運作的
以互動方式探索這項發展背後的基礎技術。
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
接下來看什麼
關鍵問題是誰可以存取 Fusion、它支援哪些模型和工具、它是否普遍可用以及其成本如何計算。進一步的報告應闡明基準測試任務、基線、樣本大小、提示快取假設以及結果是否超出編碼範圍。該消息來源還使用“SWE-2”和“SWR-2”作為低成本模型,這種不一致應該得到解決。
原始碼中未記錄存取條件。目前尚不清楚 Fusion 是否可公開下載、透過 Cognition 的產品提供、僅限於選定的用戶,或透過其他商業安排提供。定價和任何所需的模型訂閱也未知。
後續報告應確定 Fusion 是否支援 GPT-6 Astra 和 Claude Fable 以外的模型,使用者是否可以提供自己的工具和提示,以及節省多少取決於提示快取或特定提供者的定價。
基準命名包含原始碼層級的不一致:文章將更便宜的編碼模型標識為 SWE-2,但後來提到「SWR-2」。在將比較視為精確的產品聲明之前,應先驗證該指定。
獨立測試應檢查編碼成功率、延遲、可靠性、上下文處理以及報告基準之外的任務效能。即使模型成本下降,並行代理也可能增加編排複雜性或整體工具活動。