Retour aux Actualités
ProduitBriefing AI Understanding

Cognition publie le modèle de codage SWE-2 pour Devin

MarkTechPost rapporte que le modèle de codage SWE-2 de Cognition est disponible dans Devin, avec des niveaux d'effort de raisonnement sélectionnables mais pas d'API autonome ni de pondérations ouvertes.

4 min readRead the linked source
Source-provided image accompanying Cognition releases SWE-2 coding model for Devin
Référence sourceSource enregistrée
Éditeur
marktechpost.com
Lien source
marktechpost.comhttps://www.marktechpost.com/2026/09/12/cognition-releases-swe-2-a-kimi-k3-post-trained-coding-model-that-matches-fable-5-1-on-frontiercode-at-64-lower-cost/amp/
Type de source
Source liée : le statut de source principale n'a pas été établi.
ContexteComprenez cela en 60 secondes

Commencez ici

Termes clés

API (interface de programmation d'applications)
Une manière structurée permettant à un système logiciel d'envoyer des requêtes et de recevoir des réponses d'un autre système.
Apprentissage par renforcement
La formation par récompense signale qu'un agent apprend des actions qui maximisent le rendement à long terme.
Quantification
Conversion des poids de modèle en formats de précision inférieure tels que 8 bits ou 4 bits.
Testez-vousQuiz sur les modèles d'IA expliqués

Que s'est-il passé

MarkTechPost rapporte que Cognition a publié SWE-2, un modèle de codage post-entraîné à partir du Kimi K3 de Moonshot AI. Le modèle est disponible uniquement dans Devin, initialement via ses produits Desktop et CLI. L'accès Devin Web et Fusion serait en cours de déploiement. MarkTechPost indique que Cognition rapporte des résultats de référence et de coûts, mais ces comparaisons n'ont pas été confirmées de manière indépendante.

MarkTechPost rapporte que Cognition, la société derrière Devin, a publié SWE-2 comme son modèle de codage le plus performant à ce jour. Selon le média, Cognition a post-entraîné le Kimi K3 de Moonshot AI, décrit comme un modèle ouvert de 2,8 billions de paramètres, utilisant l'apprentissage par renforcement. MarkTechPost indique que Cognition a rapporté un score de 50,0 % sur FrontierCode 1.1 Main, à un point de pourcentage près de Fable 5.1 à un coût inférieur de 64 %. Ces résultats sont déclarés par l'entreprise ; la source ne fournit pas de vérification indépendante.

Le modèle n’est pas proposé en tant que version ouverte ou API autonome. MarkTechPost indique que SWE-2 fonctionne uniquement dans Devin, avec un accès Desktop et CLI disponible au moment du rapport et du déploiement de Devin Web et Fusion. La source ne documente pas de prix, de conditions d'éligibilité, de limites géographiques ou de date de disponibilité générale.

Un changement central est l’effort de raisonnement sélectionnable. MarkTechPost rapporte que Cognition a entraîné trois niveaux d'effort au cours d'une seule exécution d'apprentissage par renforcement et a attribué à chaque niveau une pénalité de coût différente. Le point de vente décrit également les améliorations revendiquées par rapport à SWE-1.7, notamment moins de tours avant d'effectuer une première modification et un coût rapporté inférieur sur FrontierCode. Cognition affirme que le modèle a amélioré la couverture des tests, l'ingéniosité dans l'utilisation des outils et le comportement de vérification, mais ces affirmations comportementales ne sont pas établies de manière indépendante par la source.

Détails de la source: marktechpost.com ↗

Pourquoi c'est important

SWE-2 représente un changement de produit significatif car il offre aux utilisateurs de Devin plusieurs choix d'efforts de raisonnement et améliorerait les performances de codage tout en réduisant les coûts et les explorations inutiles. Sa portée pratique est cependant limitée : les utilisateurs ne peuvent pas déployer le modèle sur leur propre infrastructure ni l'appeler via une API autonome, et les prix ne sont pas documentés dans la source.

La version rapportée est importante car elle déplace le contrôle au niveau du modèle sur l'effort de raisonnement vers un produit d'agent de codage. Si les différences de coûts et de performances signalées restent en dehors des évaluations de Cognition, les développeurs pourraient choisir un comportement plus rapide ou plus délibéré en fonction de la difficulté de la tâche au lieu d'utiliser un paramètre fixe.

Le modèle d'accès limite également l'importance immédiate de la diffusion. Les organisations qui nécessitent un auto-hébergement, une intégration directe d'API ou un contrôle sur les pondérations des modèles ne peuvent pas utiliser SWE-2 selon ces conditions, en fonction des informations disponibles. La source ne précise pas si une future API ou une option de déploiement plus large est prévue.

Le contexte de l’évaluation est important. MarkTechPost indique que FrontierCode est la propre référence de Cognition et que les scores concurrents dans la comparaison proviennent de l'évaluation de Cognition. La source note également une faiblesse substantielle sur Terminal-Bench 4, où SWE-2 aurait été en retard d'environ 30 points sur les autres systèmes comparés. Cela rend la version conséquente mais ne prouve pas des performances de codage uniformément plus fortes.

Interactive Mechanism

Mécanisme interactif : comment cela fonctionne réellement

Explorez de manière interactive la technologie sous-jacente à ce développement.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Vérification de concept interactive+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Que regarder ensuite

Surveillez les tests indépendants de SWE-2 sur des références de codage, des informations plus claires sur la disponibilité et les prix, ainsi que les preuves des utilisateurs indiquant si ses paramètres d'effort produisent des compromis coûts-performances fiables dans des projets logiciels réels.

Les résultats de références indépendants devraient clarifier si les avantages signalés par SWE-2 persistent dans les environnements de codage, les référentiels, les langages et les harnais d'évaluation. Une attention particulière doit être portée au Terminal-Bench 4 et aux tests qui mesurent les modifications apportées et corrigées plutôt que l'achèvement des tâches uniquement.

Les utilisateurs doivent surveiller la documentation confirmant quand Devin Web et Fusion reçoivent SWE-2, quels niveaux d'effort sont disponibles dans chaque produit et comment l'utilisation est facturée. MarkTechPost ne fournit pas de tarifs ni de politique d'accès détaillée.

Des informations techniques supplémentaires pourraient aider à évaluer les méthodes d'apprentissage par renforcement, la qualité des vérificateurs, les choix de quantification et les résultats de sécurité revendiqués. MarkTechPost rapporte que Cognition a réexécuté les évaluations de fiabilité, mais la source n'établit pas dans quelle mesure ces tests sont représentatifs de l'utilisation du codage de production ou reproduisent indépendamment leurs résultats.

Guides et quiz associés

Modèles d'IA expliquésAgents IAFormation IAPrompt EngineeringTestez ce que vous savez : essayez un quiz gratuit sur l'IARecherchez un terme d'IA dans notre glossaireSuivez le suivi des versions du modèle AI
Vous avez trouvé cela utile ?