Înapoi la Știri
ProdusAI Understanding briefing

Cognition lansează modelul de codare SWE-2 pentru Devin

MarkTechPost raportează că modelul de codare SWE-2 al Cognition este disponibil în interiorul Devin, cu niveluri de efort de raționament selectabile, dar fără API autonome sau greutăți deschise.

4 min readRead the linked source
Source-provided image accompanying Cognition releases SWE-2 coding model for Devin
Referință la sursăSursa înregistrată
Editor
marktechpost.com
Link sursă
marktechpost.comhttps://www.marktechpost.com/2026/09/12/cognition-releases-swe-2-a-kimi-k3-post-trained-coding-model-that-matches-fable-5-1-on-frontiercode-at-64-lower-cost/amp/
Tip sursă
Sursă conectată — starea sursei primare nu a fost stabilită.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

API (Interfață de programare a aplicației)
O modalitate structurată pentru ca un sistem software să trimită cereri și să primească răspunsuri de la un alt sistem.
Învățare prin întărire
Antrenamentul prin recompensă semnalează în cazul în care un agent învață acțiuni care maximizează rentabilitatea pe termen lung.
Cuantizarea
Conversia greutăților modelului în formate de precizie mai scăzută, cum ar fi 8 biți sau 4 biți.
Testează-teTest explicativ pentru modelele AI

Ce sa întâmplat

MarkTechPost raportează că Cognition a lansat SWE-2, un model de codare post-antrenat de la Kimi K3 de la Moonshot AI. Modelul este disponibil numai în cadrul Devin, inițial prin produsele sale Desktop și CLI. Se pare că accesul Devin Web și Fusion se lansează. MarkTechPost spune că Cognition raportează rezultate de referință și costuri, dar acele comparații nu au fost confirmate independent.

MarkTechPost raportează că Cognition, compania din spatele lui Devin, a lansat SWE-2 ca model de codare cel mai capabil de până acum. Potrivit publicației, Cognition a post-antrenat Moonshot AI Kimi K3, descris ca un model deschis de 2,8 trilioane de parametri, folosind învățarea prin întărire. MarkTechPost spune că Cognition a raportat un scor de 50,0% pe FrontierCode 1.1 Main, cu un punct procentual față de Fable 5.1 la un cost cu 64% mai mic. Aceste rezultate sunt raportate de companie; sursa nu oferă verificare independentă.

Modelul nu este oferit ca lansare deschisă sau ca API de sine stătătoare. MarkTechPost spune că SWE-2 rulează numai în interiorul Devin, cu acces la Desktop și CLI disponibil în momentul raportării și lansarea Devin Web și Fusion. Sursa nu documentează un preț, cerințe de eligibilitate, limite geografice sau o dată de disponibilitate generală.

O schimbare centrală este efortul de raționament selectabil. MarkTechPost raportează că Cognition a antrenat trei niveluri de efort într-o singură cursă de învățare-întărire și a atribuit fiecărui nivel o penalizare diferită. Punctul de vânzare descrie, de asemenea, îmbunătățirile pretinse față de SWE-1.7, inclusiv mai puține ture înainte de a face o editare inițială și un cost raportat mai mic pe FrontierCode. Cognition spune că modelul a îmbunătățit acoperirea testelor, ingeniozitatea utilizării instrumentelor și comportamentul de verificare, dar aceste afirmații comportamentale nu sunt stabilite în mod independent de către sursă.

Detalii sursa: marktechpost.com ↗

De ce contează

SWE-2 reprezintă o schimbare semnificativă a produsului, deoarece oferă utilizatorilor Devin mai multe opțiuni de raționament și efort și se pare că îmbunătățește performanța de codare, reducând în același timp costurile și explorarea inutilă. Cu toate acestea, acoperirea sa practică este limitată: utilizatorii nu pot implementa modelul pe propria infrastructură sau îl pot apela printr-un API autonom, iar prețul nu este documentat în sursă.

Eliberarea raportată contează deoarece mută controlul la nivel de model asupra efortului de raționament într-un produs de codificare. Dacă diferențele raportate de cost și performanță rămân în afara evaluărilor Cognition, dezvoltatorii ar putea alege un comportament mai rapid sau mai deliberat în funcție de dificultatea sarcinii în loc să folosească o singură setare fixă.

Modelul de acces limitează, de asemenea, semnificația imediată a lansării. Organizațiile care necesită auto-găzduire, integrare directă API sau control asupra greutăților modelului nu pot utiliza SWE-2 în acei termeni pe baza informațiilor disponibile. Sursa nu spune dacă este planificată o viitoare API sau o opțiune de implementare mai largă.

Contextul de evaluare este important. MarkTechPost spune că FrontierCode este propriul punct de referință al Cognition și că scorurile rivalilor în comparație provin din evaluarea Cognition. Sursa notează, de asemenea, o slăbiciune substanțială pe Terminal-Bench 4, unde SWE-2 se pare că este în urmă cu aproximativ 30 de puncte pe alte sisteme comparate. Acest lucru face ca lansarea să fie semnificativă, dar nu o dovadă a performanței de codare uniform mai puternice.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Ce să urmărești în continuare

Urmăriți testarea independentă a SWE-2 cu privire la benchmark-uri de codare, informații mai clare despre disponibilitate și prețuri și dovezi de la utilizatori despre dacă setările sale de efort produc compromisuri fiabile cost-performanță în proiecte software reale.

Rezultatele de referință independente ar trebui să clarifice dacă avantajele raportate ale SWE-2 persistă în mediile de codare, depozite, limbi și sisteme de evaluare. O atenție deosebită ar trebui acordată Terminal-Bench 4 și testelor care măsoară modificările finalizate, corectează, mai degrabă decât finalizarea sarcinilor.

Utilizatorii ar trebui să urmărească documentația care confirmă când Devin Web și Fusion primesc SWE-2, ce niveluri de efort sunt disponibile în fiecare produs și modul în care este facturată utilizarea. MarkTechPost nu oferă prețuri sau o politică detaliată de acces.

Dezvăluirile tehnice suplimentare ar putea ajuta la evaluarea metodelor de învățare-întărire, a calității verificatorului, a opțiunilor de cuantificare și a rezultatelor de siguranță pretinse. MarkTechPost raportează că Cognition a efectuat din nou evaluări de încredere, dar sursa nu stabilește cât de reprezentative sunt acele teste în ceea ce privește utilizarea codurilor de producție și nici nu reproduce în mod independent constatările lor.

Ghiduri și chestionare conexe

Modelele AI explicateAgenți AIAntrenament AIPrompt EngineeringTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?