Que s'est-il passé
GIGAZINE rapporte que Cognition, la société derrière Devin, a publié Fusion, un exploit conçu pour améliorer la façon dont les modèles d'IA avancés planifient, exécutent, examinent et récupèrent des tâches bloquées. Le système associe un modèle haut de gamme pour la planification et la révision à un modèle d'exécution moins coûteux, tout en exécutant deux agents en parallèle avec des contextes et des outils distincts.
GIGAZINE rapporte que Cognition a développé et publié Fusion en tant que harnais pour le GPT-6 Astra de OpenAI et le Claude Fable de Anthropic. L'article décrit un harnais comme la couche qui fournit aux modèles des instructions d'utilisation, des règles d'utilisation des outils et des branchements conditionnels, affectant potentiellement le fait qu'un agent termine une tâche ou reste bloqué dans une boucle.
Selon GIGAZINE, Fusion combine un modèle de planification et de révision de pointe avec un modèle d'exécution rentable. Cognition a recommandé GPT-6 Astra et Claude Fable comme modèles avancés et a identifié le modèle de codage SWE-2 de Cognition comme l'option d'exécution la moins chère. L'article indique que la combinaison a mieux fonctionné avec Claude Fable 5.1.
GIGAZINE rapporte un score de référence de 62,2 pour Claude Fable 5.1 avec Claude Code, contre 61,7 pour Claude Fable 5.1 combiné avec le modèle moins coûteux et Fusion. Cette dernière combinaison serait 36 % moins chère. Pour GPT-6 Astra, l'article indique que Fusion a atteint des performances équivalentes à Codex tout en réduisant les coûts de 39 %.
L’article attribue des évaluations aux sociétés d’analyse d’IA Artificial Analysis et Vals AI. Il indique que Fusion gère deux agents en parallèle, chacun avec un contexte et des outils indépendants, et n'échange que des résumés, des résultats et des commentaires plutôt que la conversation complète. GIGAZINE affirme que cette approche utilise davantage la mise en cache rapide. La source ne fournit pas la méthodologie complète de référence, les prix absolus ou les conditions de disponibilité.
Détails de la source: gigazine.net ↗
Pourquoi c'est important
Si les résultats rapportés se confirment, Fusion pourrait réduire le coût d’utilisation des agents d’IA frontaliers sans perte comparable de performances de codage. Cela est important pour les développeurs et les organisations qui exécutent des systèmes utilisant des outils à grande échelle, où l'inférence de modèle et les tentatives répétées d'agents peuvent devenir des dépenses importantes. Les résultats sont rapportés par GIGAZINE et évalués par Artificial Analysis et Vals AI, mais la source ne fournit pas suffisamment de méthodologie pour évaluer de manière indépendante les comparaisons.
Les résultats rapportés suggèrent que l’architecture des agents peut affecter sensiblement l’économie des modèles frontières. Un système qui délègue l'exécution à un modèle moins cher tout en conservant un modèle plus solide pour la planification et la révision pourrait réduire le coût des agents logiciels sans obliger les utilisateurs à abandonner des modèles plus performants.
Les réductions de coûts sont particulièrement pertinentes pour les agents de codage, qui peuvent effectuer de nombreux appels d'outils, répéter des tentatives infructueuses ou gérer des contextes longs. Si elles sont reproductibles de manière indépendante, les réductions signalées de 36 % et 39 % pourraient influencer la façon dont les entreprises conçoivent les flux de travail des agents de production et choisissent entre des harnais propriétaires.
Les preuves restent limitées dans le rapport fourni. GIGAZINE fournit des scores sélectionnés et des pourcentages d'économies, mais pas l'ensemble des tâches, le nombre d'exécutions, les hypothèses de tarification, la latence, les taux d'échec ou les conditions de comparaison. L'équivalence revendiquée avec Codex et les gains d'efficacité déclarés ne sont donc pas confirmés ici de manière indépendante.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Que regarder ensuite
Les questions clés sont de savoir qui peut accéder à Fusion, quels modèles et outils il prend en charge, s'il est généralement disponible et comment ses coûts sont calculés. Des rapports supplémentaires devraient clarifier les tâches de référence, les lignes de base, la taille des échantillons, les hypothèses de mise en cache rapide et si les résultats sont transférés au-delà du codage. La source utilise également à la fois « SWE-2 » et « SWR-2 » pour le modèle le moins coûteux, une incohérence qui devrait être résolue.
Les conditions d'accès ne sont pas documentées dans la source. On ne sait pas si Fusion est téléchargeable publiquement, disponible via les produits Cognition, réservé à des utilisateurs sélectionnés ou proposé dans le cadre d'un autre accord commercial. Les prix et les abonnements aux modèles requis sont également inconnus.
Les rapports de suivi doivent déterminer si Fusion prend en charge les modèles au-delà de GPT-6 Astra et Claude Fable, si les utilisateurs peuvent fournir leurs propres outils et invites, et quelle part des économies dépend de la mise en cache rapide ou des tarifs spécifiques du fournisseur.
La dénomination du contient une incohérence au niveau de la source : l'article identifie le modèle de codage le moins cher comme étant SWE-2 mais fait plus tard référence à « SWR-2 ». Cette désignation doit être vérifiée avant de traiter la comparaison comme une allégation précise du produit.
Les tests indépendants doivent examiner les taux de réussite du codage, la latence, la fiabilité, la gestion du contexte et les performances sur des tâches autres que le rapporté. Les agents parallèles peuvent également accroître la complexité de l'orchestration ou l'activité totale des outils, même lorsque les coûts du modèle diminuent.