Apa yang berlaku
GIGAZINE melaporkan bahawa Cognition, syarikat di belakang Devin, mengeluarkan Fusion, abah-abah yang direka untuk menambah baik cara model AI canggih merancang, melaksanakan, menyemak dan memulihkan tugas yang terhenti. Sistem ini menggandingkan model mewah untuk perancangan dan semakan dengan model yang lebih murah untuk pelaksanaan, sambil menjalankan dua ejen selari dengan konteks dan alatan yang berasingan.
GIGAZINE melaporkan bahawa Kognisi membangunkan dan mengeluarkan Fusion sebagai abah-abah untuk GPT-6 Astra OpenAI dan Claude Fable Anthropic. Artikel itu menerangkan abah-abah sebagai lapisan yang membekalkan model dengan arahan pengendalian, peraturan penggunaan alat dan percabangan bersyarat, yang berpotensi menjejaskan sama ada ejen menyelesaikan tugas atau tersekat dalam gelung.
Menurut GIGAZINE, Fusion menggabungkan model terkini untuk perancangan dan semakan dengan model kos efektif untuk pelaksanaan. Cognition mengesyorkan GPT-6 Astra dan Claude Fable sebagai model lanjutan, dan mengenal pasti model pengekodan SWE-2 Cognition sebagai pilihan pelaksanaan yang lebih murah. Artikel itu mengatakan gabungan itu menunjukkan prestasi terbaik dengan Claude Fable 5.1.
GIGAZINE melaporkan skor penanda aras 62.2 untuk Claude Fable 5.1 dengan Claude Code, berbanding 61.7 untuk Claude Fable 5.1 digabungkan dengan model kos rendah dan Fusion. Gabungan terakhir dilaporkan sebagai 36% lebih murah. Untuk GPT-6 Astra, artikel itu mengatakan Fusion mencapai prestasi yang setara dengan Codex sambil mengurangkan kos sebanyak 39%.
Artikel itu mengaitkan penilaian kepada syarikat analisis AI, Artificial Analysis dan Vals AI. Ia mengatakan Fusion menjalankan dua ejen secara selari, masing-masing dengan konteks dan alatan bebas, dan hanya bertukar ringkasan, keputusan dan maklum balas berbanding perbualan penuh. GIGAZINE berkata pendekatan ini menggunakan lebih banyak caching segera. Sumber tidak menyediakan metodologi penanda aras penuh, harga mutlak atau syarat ketersediaan.
Butiran sumber: gigazine.net ↗
Mengapa ia penting
Jika keputusan yang dilaporkan kekal, Fusion boleh mengurangkan kos menggunakan ejen AI sempadan tanpa kehilangan prestasi pengekodan yang setanding. Itu penting bagi pembangun dan organisasi yang menjalankan sistem penggunaan alat secara berskala, di mana inferens model dan percubaan ejen berulang boleh menjadi perbelanjaan besar. Hasilnya dilaporkan oleh GIGAZINE dan dinilai oleh Analisis Buatan dan Vals AI, tetapi sumbernya tidak menyediakan metodologi yang mencukupi untuk menilai perbandingan secara bebas.
Keputusan yang dilaporkan menunjukkan bahawa seni bina ejen boleh menjejaskan ekonomi model sempadan secara material. Sistem yang mewakilkan pelaksanaan kepada model yang lebih murah sambil mengekalkan model yang lebih kukuh untuk perancangan dan semakan boleh mengurangkan kos ejen perisian tanpa memerlukan pengguna untuk meninggalkan model berkeupayaan lebih tinggi.
Pengurangan kos amat relevan untuk ejen pengekodan, yang mungkin membuat banyak panggilan alat, mengulangi percubaan yang gagal atau mengekalkan konteks yang panjang. Jika boleh diterbitkan secara bebas, pengurangan 36% dan 39% yang dilaporkan boleh mempengaruhi cara syarikat mereka bentuk aliran kerja ejen pengeluaran dan memilih antara abah-abah proprietari.
Bukti masih terhad dalam laporan yang dibekalkan. GIGAZINE menyediakan markah terpilih dan penjimatan peratusan tetapi bukan set tugasan, kiraan larian, andaian harga, kependaman, kadar kegagalan atau keadaan perbandingan. Oleh itu, persamaan yang didakwa dengan Codex dan keuntungan kecekapan yang dinyatakan tidak disahkan secara bebas di sini.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Soalan utama ialah siapa yang boleh mengakses Fusion, model dan alatan yang disokongnya, sama ada ia tersedia secara umum dan cara kosnya dikira. Pelaporan selanjutnya harus menjelaskan tugas penanda aras, garis dasar, saiz sampel, andaian cache segera, dan sama ada keputusan dipindahkan melebihi pengekodan. Sumber itu juga menggunakan kedua-dua "SWE-2" dan "SWR-2" untuk model kos rendah, ketidakkonsistenan yang harus diselesaikan.
Syarat capaian tidak didokumenkan dalam sumber. Tidak diketahui sama ada Fusion boleh dimuat turun secara terbuka, tersedia melalui produk Cognition, terhad kepada pengguna terpilih atau ditawarkan melalui susunan komersial yang lain. Harga dan sebarang langganan model yang diperlukan juga tidak diketahui.
Pelaporan susulan harus menentukan sama ada Fusion menyokong model melangkaui GPT-6 Astra dan Claude Fable, sama ada pengguna boleh membekalkan alatan dan gesaan mereka sendiri, dan berapa banyak penjimatan bergantung pada caching segera atau harga pembekal khusus.
Penamaan penanda aras mengandungi ketidakkonsistenan peringkat sumber: artikel mengenal pasti model pengekodan yang lebih murah sebagai SWE-2 tetapi kemudiannya merujuk kepada "SWR-2." Penamaan itu harus disahkan sebelum menganggap perbandingan sebagai tuntutan produk yang tepat.
Ujian bebas harus memeriksa kadar kejayaan pengekodan, kependaman, kebolehpercayaan, pengendalian konteks dan prestasi pada tugas selain daripada penanda aras yang dilaporkan. Ejen selari juga boleh meningkatkan kerumitan orkestra atau jumlah aktiviti alat walaupun kos model jatuh.