返回新聞
產品展示AI Understanding 簡報

Cognition 發布 Fusion 工具以實現更低成本的 AI 代理性能

GIGAZINE 報告稱,Cognition 發布了 Fusion,這是一種適用於 GPT-6 Astra 和 Claude Fable 的工具,可在基準測試中匹配競爭代理系統,同時將報告的成本降低高達 39%。

4 min readRead the linked source
Source-provided image accompanying Cognition releases Fusion harness for lower-cost AI agent performance
來源參考來源記錄
出版商
gigazine.net
來源連結
gigazine.nethttps://gigazine.net/gsc_news/en/20260914-cognition-fusion/
來源類型
連結來源-主要來源狀態尚未確定。
背景60 秒內了解這一點

從這裡開始

關鍵術語

人工智慧代理
一種可以觀察、推理並採取行動來實現目標的軟體系統,通常使用工具和記憶體。
基準測試
用於測量和比較模型性能的標準化測試或資料集。
推理
經過訓練的模型產生預測或輸出的運行時階段。
測試一下自己AI 代理測驗

發生了什麼事

GIGAZINE 報告稱,Devin 背後的公司 Cognition 發布了 Fusion,這是一款旨在改進先進人工智慧模型計劃、執行、審查和從停滯任務中恢復的工具。該系統將用於規劃和審查的高端模型與用於執行的較便宜模型配對,同時使用單獨的上下文和工具並行運行兩個代理程式。

GIGAZINE 報導稱,Cognition 開發並發布了 Fusion,作為 OpenAI 的 GPT-6 Astra 和 Anthropic 的 Claude Fable 的工具。本文將線束描述為為模型提供操作指令、工具使用規則和條件分支的層,可能會影響代理是否完成任務或陷入循環。

據 GIGAZINE 稱,Fusion 將最先進的規劃和審查模型與具有成本效益的執行模型相結合。 Cognition 推薦 GPT-6 Astra 和 Claude Fable 作為高級模型,並將 Cognition 的 SWE-2 編碼模型視為更便宜的執行選項。文章稱此組合與 Claude Fable 5.1 的效能最佳。

GIGAZINE 報告稱,使用 Claude Code 的 Claude Fable 5.1 的基準分數為 62.2,而結合低成本模型和 Fusion 的 Claude Fable 5.1 的基準分數為 61.7。據報道,後一種組合便宜 36%。對於 GPT-6 Astra,文章稱 Fusion 實現了與 Codex 相當的性能,同時成本降低了 39%。

文章將評價歸功於人工智慧分析公司Artificial Analysis和Vals AI。它說,Fusion 並行運行兩個代理,每個代理都有獨立的上下文和工具,並且僅交換摘要、結果和回饋,而不是完整的對話。 GIGAZINE 表示,這種方法更常利用了即時快取。該來源沒有提供完整的基準方法、絕對價格或可用性條款。

來源詳情: gigazine.net ↗

為什麼這很重要

如果報告的結果成立,Fusion 可以降低使用前沿人工智慧代理的成本,而編碼效能不會出現類似的損失。這對於大規模運行使用工具的系統的開發人員和組織來說很重要,其中模型推理和重複的代理嘗試可能成為主要費用。結果由 GIGAZINE 報告,並由 Artificial Analysis 和 Vals AI 評估,但來源沒有提供足夠的方法來獨立評估比較。

報告的結果表明,代理架構可以對前沿模型的經濟性產生重大影響。將執行委託給更便宜的模型,同時保留更強大的規劃和審查模型的系統可以降低軟體代理的成本,而不需要用戶放棄更高功能的模型。

成本降低對於編碼代理尤其重要,編碼代理可能會進行許多工具呼叫、重複失敗的嘗試或維護較長的上下文。如果可以獨立重現,所報告的 36% 和 39% 的減少可能會影響公司設計生產代理工作流程以及在專有工具之間進行選擇的方式。

所提供的報告中的證據仍然有限。 GIGAZINE 提供選定的分數和節省百分比,但不提供任務集、運行計數、定價假設、延遲、故障率或比較條件。因此,所聲稱的與 Codex 的等效性和所述的效率增益在此並未獨立確認。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
互動式概念檢查+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

接下來看什麼

關鍵問題是誰可以存取 Fusion、它支援哪些模型和工具、它是否普遍可用以及其成本如何計算。進一步的報告應闡明基準測試任務、基線、樣本大小、提示快取假設以及結果是否超出編碼範圍。該消息來源還使用“SWE-2”和“SWR-2”作為低成本模型,這種不一致應該得到解決。

原始碼中未記錄存取條件。目前尚不清楚 Fusion 是否可公開下載、透過 Cognition 的產品提供、僅限於選定的用戶,或透過其他商業安排提供。定價和任何所需的模型訂閱也未知。

後續報告應確定 Fusion 是否支援 GPT-6 Astra 和 Claude Fable 以外的模型,使用者是否可以提供自己的工具和提示,以及節省多少取決於提示快取或特定提供者的定價。

基準命名包含原始碼層級的不一致:文章將更便宜的編碼模型標識為 SWE-2,但後來提到「SWR-2」。在將比較視為精確的產品聲明之前,應先驗證該指定。

獨立測試應檢查編碼成功率、延遲、可靠性、上下文處理以及報告基準之外的任務效能。即使模型成本下降,並行代理也可能增加編排複雜性或整體工具活動。

相關指引和測驗

人工智慧代理人工智慧模型解釋Prompt Engineering測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語關注 AI 模型發布追蹤器
覺得有用嗎?