Tilbake til Nyheter
ProduktAI Understanding orientering

Cognition gir ut SWE-2-kodemodell for Devin

MarkTechPost rapporterer at Cognitions SWE-2-kodemodell er tilgjengelig i Devin, med valgbare resonnement-innsatsnivåer, men ingen frittstående API eller åpne vekter.

4 min readRead the linked source
Source-provided image accompanying Cognition releases SWE-2 coding model for Devin
KildereferanseKilde registrert
Utgiver
marktechpost.com
Kilde lenke
marktechpost.comhttps://www.marktechpost.com/2026/09/12/cognition-releases-swe-2-a-kimi-k3-post-trained-coding-model-that-matches-fable-5-1-on-frontiercode-at-64-lower-cost/amp/
Kildetype
Koblet kilde – status for primærkilde er ikke etablert.
KontekstForstå dette på 60 sekunder

Start her

Nøkkelord

API (Application Programming Interface)
En strukturert måte for ett programvaresystem å sende forespørsler til og motta svar fra et annet system.
Forsterkende læring
Trening med belønningssignaler der en agent lærer handlinger som maksimerer langsiktig avkastning.
Kvantisering
Konvertering av modellvekter til formater med lavere presisjon som 8-bit eller 4-bit.
Test deg selvQuiz for forklaring av AI-modeller

Hva skjedde

MarkTechPost rapporterer at Cognition ga ut SWE-2, en kodemodell ettertrent fra Moonshot AIs Kimi K3. Modellen er kun tilgjengelig i Devin, først gjennom Desktop- og CLI-produktene. Devin Web og Fusion-tilgang rulles angivelig ut. MarkTechPost sier at Cognition rapporterer benchmark- og kostnadsresultater, men disse sammenligningene har ikke blitt bekreftet uavhengig.

MarkTechPost rapporterer at Cognition, selskapet bak Devin, ga ut SWE-2 som sin mest kapable kodemodell til dags dato. I følge utsalgsstedet har Cognition ettertrent Moonshot AIs Kimi K3, beskrevet som en åpen modell med 2,8 billioner parametere, ved å bruke forsterkningslæring. MarkTechPost sier Cognition rapporterte en 50,0 % poengsum på FrontierCode 1.1 Main, innenfor ett prosentpoeng fra Fable 5.1 til 64 % lavere kostnad. Disse resultatene er bedriftsrapportert; kilden gir ikke uavhengig bekreftelse.

Modellen tilbys ikke som en åpen utgivelse eller frittstående API. MarkTechPost sier at SWE-2 bare kjører i Devin, med skrivebords- og CLI-tilgang tilgjengelig på rapporteringstidspunktet og Devin Web and Fusion rulles ut. Kilden dokumenterer ikke en pris, kvalifikasjonskrav, geografiske grenser eller en generell tilgjengelighetsdato.

En sentral endring er valgbar resonnementinnsats. MarkTechPost rapporterer at Cognition trente tre innsatsnivåer i et enkelt forsterkningslæringsløp og tildelte hvert nivå en annen kostnadsstraff. Utsalgsstedet beskriver også påståtte forbedringer i forhold til SWE-1.7, inkludert færre svinger før du foretar en innledende redigering og lavere rapporterte kostnader på FrontierCode. Cognition sier at modellen forbedret testdekning, oppfinnsomhet ved bruk av verktøy og verifikasjonsatferd, men disse atferdspåstandene er ikke uavhengig etablert av kilden.

Kildedetaljer: marktechpost.com ↗

Hvorfor det betyr noe

SWE-2 representerer en meningsfull produktendring fordi den gir Devin-brukere flere resonnement-innsatsvalg og angivelig forbedrer kodeytelsen samtidig som kostnadene og unødvendig leting reduseres. Den praktiske rekkevidden er imidlertid begrenset: brukere kan ikke distribuere modellen på sin egen infrastruktur eller kalle den gjennom en frittstående API, og prissetting er ikke dokumentert i kilden.

Den rapporterte utgivelsen er viktig fordi den flytter kontroll på modellnivå over resonnementinnsats til et kodeagentprodukt. Hvis de rapporterte kostnads- og ytelsesforskjellene holder utenfor Cognitions evalueringer, kan utviklere velge raskere eller mer bevisst oppførsel i henhold til oppgavevanskeligheter i stedet for å bruke én fast innstilling.

Tilgangsmodellen begrenser også den umiddelbare betydningen av utgivelsen. Organisasjoner som krever selvhosting, direkte API-integrasjon eller kontroll over modellvekter kan ikke bruke SWE-2 på disse vilkårene basert på tilgjengelig informasjon. Kilden sier ikke om en fremtidig API eller et bredere distribusjonsalternativ er planlagt.

Evalueringskontekst er viktig. MarkTechPost sier at FrontierCode er Cognitions egen benchmark og at rivaliserende poengsum i sammenligningen kom fra Cognitions evaluering. Kilden bemerker også en betydelig svakhet på Terminal-Bench 4, der SWE-2 angivelig følger andre sammenlignede systemer med omtrent 30 poeng. Det gjør utgivelsen konsekvens, men ikke bevis på jevnt sterkere kodeytelse.

Interactive Mechanism

Interaktiv mekanisme: Hvordan det faktisk fungerer

Utforsk den underliggende teknologien bak denne utviklingen interaktivt.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktiv konseptsjekk+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Hva du skal se neste

Se etter uavhengig testing av SWE-2 på kodingsreferanser, klarere tilgjengelighet og prisinformasjon, og bevis fra brukere om hvorvidt innsatsinnstillingene gir pålitelige avveininger mellom kostnad og ytelse i ekte programvareprosjekter.

Uavhengige benchmarkresultater bør avklare om SWE-2s rapporterte fordeler vedvarer på tvers av kodemiljøer, arkiver, språk og evalueringssystemer. Spesiell oppmerksomhet bør gå til Terminal-Bench 4 og til tester som måler fullførte, korrekte endringer i stedet for oppgavefullføring alene.

Brukere bør se etter dokumentasjon som bekrefter når Devin Web og Fusion mottar SWE-2, hvilke innsatsnivåer som er tilgjengelige i hvert produkt, og hvordan bruken faktureres. MarkTechPost gir ikke priser eller en detaljert tilgangspolicy.

Ytterligere teknisk avsløring kan bidra til å vurdere forsterkningslæringsmetodene, verifikatorens kvalitet, kvantiseringsvalg og påståtte sikkerhetsresultater. MarkTechPost rapporterer at Cognition kjørte pålitelighetsevalueringer på nytt, men kilden fastslår ikke hvor representative disse testene er for bruk av produksjonskoding eller uavhengig reproduserer funnene deres.

Relaterte guider og quizer

AI-modeller forklartAI-agenterAI treningPrompt EngineeringTest det du vet – prøv en gratis AI-quizSlå opp et AI-begrep i ordlisten vårFølg AI-modellutgivelsessporeren
Fant du dette nyttig?