Hva skjedde
MarkTechPost rapporterer at Cognition ga ut SWE-2, en kodemodell ettertrent fra Moonshot AIs Kimi K3. Modellen er kun tilgjengelig i Devin, først gjennom Desktop- og CLI-produktene. Devin Web og Fusion-tilgang rulles angivelig ut. MarkTechPost sier at Cognition rapporterer benchmark- og kostnadsresultater, men disse sammenligningene har ikke blitt bekreftet uavhengig.
MarkTechPost rapporterer at Cognition, selskapet bak Devin, ga ut SWE-2 som sin mest kapable kodemodell til dags dato. I følge utsalgsstedet har Cognition ettertrent Moonshot AIs Kimi K3, beskrevet som en åpen modell med 2,8 billioner parametere, ved å bruke forsterkningslæring. MarkTechPost sier Cognition rapporterte en 50,0 % poengsum på FrontierCode 1.1 Main, innenfor ett prosentpoeng fra Fable 5.1 til 64 % lavere kostnad. Disse resultatene er bedriftsrapportert; kilden gir ikke uavhengig bekreftelse.
Modellen tilbys ikke som en åpen utgivelse eller frittstående API. MarkTechPost sier at SWE-2 bare kjører i Devin, med skrivebords- og CLI-tilgang tilgjengelig på rapporteringstidspunktet og Devin Web and Fusion rulles ut. Kilden dokumenterer ikke en pris, kvalifikasjonskrav, geografiske grenser eller en generell tilgjengelighetsdato.
En sentral endring er valgbar resonnementinnsats. MarkTechPost rapporterer at Cognition trente tre innsatsnivåer i et enkelt forsterkningslæringsløp og tildelte hvert nivå en annen kostnadsstraff. Utsalgsstedet beskriver også påståtte forbedringer i forhold til SWE-1.7, inkludert færre svinger før du foretar en innledende redigering og lavere rapporterte kostnader på FrontierCode. Cognition sier at modellen forbedret testdekning, oppfinnsomhet ved bruk av verktøy og verifikasjonsatferd, men disse atferdspåstandene er ikke uavhengig etablert av kilden.
Kildedetaljer: marktechpost.com ↗
Hvorfor det betyr noe
SWE-2 representerer en meningsfull produktendring fordi den gir Devin-brukere flere resonnement-innsatsvalg og angivelig forbedrer kodeytelsen samtidig som kostnadene og unødvendig leting reduseres. Den praktiske rekkevidden er imidlertid begrenset: brukere kan ikke distribuere modellen på sin egen infrastruktur eller kalle den gjennom en frittstående API, og prissetting er ikke dokumentert i kilden.
Den rapporterte utgivelsen er viktig fordi den flytter kontroll på modellnivå over resonnementinnsats til et kodeagentprodukt. Hvis de rapporterte kostnads- og ytelsesforskjellene holder utenfor Cognitions evalueringer, kan utviklere velge raskere eller mer bevisst oppførsel i henhold til oppgavevanskeligheter i stedet for å bruke én fast innstilling.
Tilgangsmodellen begrenser også den umiddelbare betydningen av utgivelsen. Organisasjoner som krever selvhosting, direkte API-integrasjon eller kontroll over modellvekter kan ikke bruke SWE-2 på disse vilkårene basert på tilgjengelig informasjon. Kilden sier ikke om en fremtidig API eller et bredere distribusjonsalternativ er planlagt.
Evalueringskontekst er viktig. MarkTechPost sier at FrontierCode er Cognitions egen benchmark og at rivaliserende poengsum i sammenligningen kom fra Cognitions evaluering. Kilden bemerker også en betydelig svakhet på Terminal-Bench 4, der SWE-2 angivelig følger andre sammenlignede systemer med omtrent 30 poeng. Det gjør utgivelsen konsekvens, men ikke bevis på jevnt sterkere kodeytelse.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
Which component of an AI application is the machine-learning model itself?
Hva du skal se neste
Se etter uavhengig testing av SWE-2 på kodingsreferanser, klarere tilgjengelighet og prisinformasjon, og bevis fra brukere om hvorvidt innsatsinnstillingene gir pålitelige avveininger mellom kostnad og ytelse i ekte programvareprosjekter.
Uavhengige benchmarkresultater bør avklare om SWE-2s rapporterte fordeler vedvarer på tvers av kodemiljøer, arkiver, språk og evalueringssystemer. Spesiell oppmerksomhet bør gå til Terminal-Bench 4 og til tester som måler fullførte, korrekte endringer i stedet for oppgavefullføring alene.
Brukere bør se etter dokumentasjon som bekrefter når Devin Web og Fusion mottar SWE-2, hvilke innsatsnivåer som er tilgjengelige i hvert produkt, og hvordan bruken faktureres. MarkTechPost gir ikke priser eller en detaljert tilgangspolicy.
Ytterligere teknisk avsløring kan bidra til å vurdere forsterkningslæringsmetodene, verifikatorens kvalitet, kvantiseringsvalg og påståtte sikkerhetsresultater. MarkTechPost rapporterer at Cognition kjørte pålitelighetsevalueringer på nytt, men kilden fastslår ikke hvor representative disse testene er for bruk av produksjonskoding eller uavhengig reproduserer funnene deres.