Que s'est-il passé
MarkTechPost rapporte que Cognition a publié SWE-2, un modèle de codage post-entraîné à partir du Kimi K3 de Moonshot AI. Le modèle est disponible uniquement dans Devin, initialement via ses produits Desktop et CLI. L'accès Devin Web et Fusion serait en cours de déploiement. MarkTechPost indique que Cognition rapporte des résultats de référence et de coûts, mais ces comparaisons n'ont pas été confirmées de manière indépendante.
MarkTechPost rapporte que Cognition, la société derrière Devin, a publié SWE-2 comme son modèle de codage le plus performant à ce jour. Selon le média, Cognition a post-entraîné le Kimi K3 de Moonshot AI, décrit comme un modèle ouvert de 2,8 billions de paramètres, utilisant l'apprentissage par renforcement. MarkTechPost indique que Cognition a rapporté un score de 50,0 % sur FrontierCode 1.1 Main, à un point de pourcentage près de Fable 5.1 à un coût inférieur de 64 %. Ces résultats sont déclarés par l'entreprise ; la source ne fournit pas de vérification indépendante.
Le modèle n’est pas proposé en tant que version ouverte ou API autonome. MarkTechPost indique que SWE-2 fonctionne uniquement dans Devin, avec un accès Desktop et CLI disponible au moment du rapport et du déploiement de Devin Web et Fusion. La source ne documente pas de prix, de conditions d'éligibilité, de limites géographiques ou de date de disponibilité générale.
Un changement central est l’effort de raisonnement sélectionnable. MarkTechPost rapporte que Cognition a entraîné trois niveaux d'effort au cours d'une seule exécution d'apprentissage par renforcement et a attribué à chaque niveau une pénalité de coût différente. Le point de vente décrit également les améliorations revendiquées par rapport à SWE-1.7, notamment moins de tours avant d'effectuer une première modification et un coût rapporté inférieur sur FrontierCode. Cognition affirme que le modèle a amélioré la couverture des tests, l'ingéniosité dans l'utilisation des outils et le comportement de vérification, mais ces affirmations comportementales ne sont pas établies de manière indépendante par la source.
Détails de la source: marktechpost.com ↗
Pourquoi c'est important
SWE-2 représente un changement de produit significatif car il offre aux utilisateurs de Devin plusieurs choix d'efforts de raisonnement et améliorerait les performances de codage tout en réduisant les coûts et les explorations inutiles. Sa portée pratique est cependant limitée : les utilisateurs ne peuvent pas déployer le modèle sur leur propre infrastructure ni l'appeler via une API autonome, et les prix ne sont pas documentés dans la source.
La version rapportée est importante car elle déplace le contrôle au niveau du modèle sur l'effort de raisonnement vers un produit d'agent de codage. Si les différences de coûts et de performances signalées restent en dehors des évaluations de Cognition, les développeurs pourraient choisir un comportement plus rapide ou plus délibéré en fonction de la difficulté de la tâche au lieu d'utiliser un paramètre fixe.
Le modèle d'accès limite également l'importance immédiate de la diffusion. Les organisations qui nécessitent un auto-hébergement, une intégration directe d'API ou un contrôle sur les pondérations des modèles ne peuvent pas utiliser SWE-2 selon ces conditions, en fonction des informations disponibles. La source ne précise pas si une future API ou une option de déploiement plus large est prévue.
Le contexte de l’évaluation est important. MarkTechPost indique que FrontierCode est la propre référence de Cognition et que les scores concurrents dans la comparaison proviennent de l'évaluation de Cognition. La source note également une faiblesse substantielle sur Terminal-Bench 4, où SWE-2 aurait été en retard d'environ 30 points sur les autres systèmes comparés. Cela rend la version conséquente mais ne prouve pas des performances de codage uniformément plus fortes.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
Which component of an AI application is the machine-learning model itself?
Que regarder ensuite
Surveillez les tests indépendants de SWE-2 sur des références de codage, des informations plus claires sur la disponibilité et les prix, ainsi que les preuves des utilisateurs indiquant si ses paramètres d'effort produisent des compromis coûts-performances fiables dans des projets logiciels réels.
Les résultats de références indépendants devraient clarifier si les avantages signalés par SWE-2 persistent dans les environnements de codage, les référentiels, les langages et les harnais d'évaluation. Une attention particulière doit être portée au Terminal-Bench 4 et aux tests qui mesurent les modifications apportées et corrigées plutôt que l'achèvement des tâches uniquement.
Les utilisateurs doivent surveiller la documentation confirmant quand Devin Web et Fusion reçoivent SWE-2, quels niveaux d'effort sont disponibles dans chaque produit et comment l'utilisation est facturée. MarkTechPost ne fournit pas de tarifs ni de politique d'accès détaillée.
Des informations techniques supplémentaires pourraient aider à évaluer les méthodes d'apprentissage par renforcement, la qualité des vérificateurs, les choix de quantification et les résultats de sécurité revendiqués. MarkTechPost rapporte que Cognition a réexécuté les évaluations de fiabilité, mais la source n'établit pas dans quelle mesure ces tests sont représentatifs de l'utilisation du codage de production ou reproduisent indépendamment leurs résultats.