que paso
GIGAZINE informa que Cognition, la compañía detrás de Devin, lanzó Fusion, un arnés diseñado para mejorar la forma en que los modelos avanzados de IA planifican, ejecutan, revisan y se recuperan de tareas estancadas. El sistema combina un modelo de alta gama para planificación y revisión con un modelo menos costoso para ejecución, mientras ejecuta dos agentes en paralelo con contextos y herramientas separados.
GIGAZINE informa que Cognition desarrolló y lanzó Fusion como un arnés para GPT-6 Astra de OpenAI y Claude Fable de Anthropic. El artículo describe un arnés como la capa que proporciona a los modelos instrucciones operativas, reglas de uso de herramientas y ramificaciones condicionales, lo que puede afectar si un agente completa una tarea o se queda atrapado en un bucle.
Según GIGAZINE, Fusion combina un modelo de última generación para planificación y revisión con un modelo rentable para ejecución. Cognition recomendó GPT-6 Astra y Claude Fable como modelos avanzados, e identificó el modelo de codificación SWE-2 de Cognition como la opción de ejecución más económica. El artículo dice que la combinación funcionó mejor con Claude Fable 5.1.
GIGAZINE reporta una puntuación de referencia de 62,2 para Claude Fable 5.1 con Claude Code, en comparación con 61,7 para Claude Fable 5.1 combinado con el modelo de menor costo y Fusion. Se informó que esta última combinación era un 36% más barata. Para GPT-6 Astra, el artículo dice que Fusion logró un rendimiento equivalente a Codex al tiempo que redujo los costos en un 39%.
El artículo atribuye las evaluaciones a las empresas de análisis de IA Artificial Analysis y Vals AI. Dice que Fusion ejecuta dos agentes en paralelo, cada uno con contexto y herramientas independientes, e intercambia solo resúmenes, resultados y comentarios en lugar de la conversación completa. GIGAZINE dice que este enfoque hace un mayor uso del almacenamiento en caché rápido. La fuente no proporciona la metodología de referencia completa, los precios absolutos ni los términos de disponibilidad.
Detalles de la fuente: gigazine.net ↗
Por qué es importante
Si los resultados informados se mantienen, Fusion podría reducir el costo del uso de agentes de inteligencia artificial de vanguardia sin una pérdida comparable en el rendimiento de la codificación. Esto es importante para los desarrolladores y las organizaciones que ejecutan sistemas que utilizan herramientas a escala, donde la inferencia de modelos y los intentos repetidos de los agentes pueden convertirse en gastos importantes. Los resultados los informa GIGAZINE y los evalúan Artificial Analysis y Vals AI, pero la fuente no proporciona suficiente metodología para evaluar las comparaciones de forma independiente.
Los resultados informados sugieren que la arquitectura del agente puede afectar materialmente la economía de los modelos de frontera. Un sistema que delega la ejecución a un modelo más económico y al mismo tiempo conserva un modelo más sólido para la planificación y revisión podría reducir el costo de los agentes de software sin requerir que los usuarios abandonen los modelos de mayor capacidad.
Las reducciones de costos son particularmente relevantes para los agentes de codificación, que pueden realizar muchas llamadas a herramientas, repetir intentos fallidos o mantener contextos prolongados. Si se pueden reproducir de forma independiente, las reducciones informadas del 36% y el 39% podrían influir en la forma en que las empresas diseñan los flujos de trabajo de los agentes de producción y eligen entre arneses patentados.
Las pruebas siguen siendo limitadas en el informe suministrado. GIGAZINE proporciona puntuaciones seleccionadas y porcentajes de ahorro, pero no el conjunto de tareas, el recuento de ejecuciones, los supuestos de precios, la latencia, las tasas de falla o las condiciones de comparación. Por lo tanto, la supuesta equivalencia con Codex y las ganancias de eficiencia declaradas no se confirman aquí de forma independiente.
Mecanismo interactivo: cómo funciona realmente
Explore la tecnología subyacente detrás de este desarrollo de forma interactiva.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Qué ver a continuación
Las preguntas clave son quién puede acceder a Fusion, qué modelos y herramientas admite, si está disponible de forma generalizada y cómo se calculan sus costos. Los informes adicionales deberían aclarar las tareas de referencia, las líneas de base, los tamaños de las muestras, los supuestos de caché rápida y si los resultados se transfieren más allá de la codificación. La fuente también utiliza tanto “SWE-2” como “SWR-2” para el modelo de menor costo, una inconsistencia que debería resolverse.
Las condiciones de acceso no están documentadas en la fuente. Se desconoce si Fusion se puede descargar públicamente, está disponible a través de los productos de Cognition, está restringido a usuarios seleccionados o se ofrece a través de otro acuerdo comercial. También se desconocen los precios y las suscripciones a los modelos requeridos.
Los informes de seguimiento deben establecer si Fusion admite modelos más allá de GPT-6 Astra y Claude Fable, si los usuarios pueden proporcionar sus propias herramientas e indicaciones, y cuánto de los ahorros depende del almacenamiento en caché de las indicaciones o del precio de un proveedor específico.
La denominación del punto de referencia contiene una inconsistencia a nivel de fuente: el artículo identifica el modelo de codificación más económico como SWE-2, pero luego se refiere a "SWR-2". Esa designación debe verificarse antes de tratar la comparación como una declaración precisa de un producto.
Las pruebas independientes deben examinar las tasas de éxito de la codificación, la latencia, la confiabilidad, el manejo del contexto y el desempeño en tareas distintas al punto de referencia informado. Los agentes paralelos también pueden aumentar la complejidad de la orquestación o la actividad total de la herramienta incluso cuando los costos del modelo caen.