Ce sa întâmplat
MarkTechPost raportează că Cognition a lansat SWE-2, un model de codare post-antrenat de la Kimi K3 de la Moonshot AI. Modelul este disponibil numai în cadrul Devin, inițial prin produsele sale Desktop și CLI. Se pare că accesul Devin Web și Fusion se lansează. MarkTechPost spune că Cognition raportează rezultate de referință și costuri, dar acele comparații nu au fost confirmate independent.
MarkTechPost raportează că Cognition, compania din spatele lui Devin, a lansat SWE-2 ca model de codare cel mai capabil de până acum. Potrivit publicației, Cognition a post-antrenat Moonshot AI Kimi K3, descris ca un model deschis de 2,8 trilioane de parametri, folosind învățarea prin întărire. MarkTechPost spune că Cognition a raportat un scor de 50,0% pe FrontierCode 1.1 Main, cu un punct procentual față de Fable 5.1 la un cost cu 64% mai mic. Aceste rezultate sunt raportate de companie; sursa nu oferă verificare independentă.
Modelul nu este oferit ca lansare deschisă sau ca API de sine stătătoare. MarkTechPost spune că SWE-2 rulează numai în interiorul Devin, cu acces la Desktop și CLI disponibil în momentul raportării și lansarea Devin Web și Fusion. Sursa nu documentează un preț, cerințe de eligibilitate, limite geografice sau o dată de disponibilitate generală.
O schimbare centrală este efortul de raționament selectabil. MarkTechPost raportează că Cognition a antrenat trei niveluri de efort într-o singură cursă de învățare-întărire și a atribuit fiecărui nivel o penalizare diferită. Punctul de vânzare descrie, de asemenea, îmbunătățirile pretinse față de SWE-1.7, inclusiv mai puține ture înainte de a face o editare inițială și un cost raportat mai mic pe FrontierCode. Cognition spune că modelul a îmbunătățit acoperirea testelor, ingeniozitatea utilizării instrumentelor și comportamentul de verificare, dar aceste afirmații comportamentale nu sunt stabilite în mod independent de către sursă.
Detalii sursa: marktechpost.com ↗
De ce contează
SWE-2 reprezintă o schimbare semnificativă a produsului, deoarece oferă utilizatorilor Devin mai multe opțiuni de raționament și efort și se pare că îmbunătățește performanța de codare, reducând în același timp costurile și explorarea inutilă. Cu toate acestea, acoperirea sa practică este limitată: utilizatorii nu pot implementa modelul pe propria infrastructură sau îl pot apela printr-un API autonom, iar prețul nu este documentat în sursă.
Eliberarea raportată contează deoarece mută controlul la nivel de model asupra efortului de raționament într-un produs de codificare. Dacă diferențele raportate de cost și performanță rămân în afara evaluărilor Cognition, dezvoltatorii ar putea alege un comportament mai rapid sau mai deliberat în funcție de dificultatea sarcinii în loc să folosească o singură setare fixă.
Modelul de acces limitează, de asemenea, semnificația imediată a lansării. Organizațiile care necesită auto-găzduire, integrare directă API sau control asupra greutăților modelului nu pot utiliza SWE-2 în acei termeni pe baza informațiilor disponibile. Sursa nu spune dacă este planificată o viitoare API sau o opțiune de implementare mai largă.
Contextul de evaluare este important. MarkTechPost spune că FrontierCode este propriul punct de referință al Cognition și că scorurile rivalilor în comparație provin din evaluarea Cognition. Sursa notează, de asemenea, o slăbiciune substanțială pe Terminal-Bench 4, unde SWE-2 se pare că este în urmă cu aproximativ 30 de puncte pe alte sisteme comparate. Acest lucru face ca lansarea să fie semnificativă, dar nu o dovadă a performanței de codare uniform mai puternice.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
Which component of an AI application is the machine-learning model itself?
Ce să urmărești în continuare
Urmăriți testarea independentă a SWE-2 cu privire la benchmark-uri de codare, informații mai clare despre disponibilitate și prețuri și dovezi de la utilizatori despre dacă setările sale de efort produc compromisuri fiabile cost-performanță în proiecte software reale.
Rezultatele de referință independente ar trebui să clarifice dacă avantajele raportate ale SWE-2 persistă în mediile de codare, depozite, limbi și sisteme de evaluare. O atenție deosebită ar trebui acordată Terminal-Bench 4 și testelor care măsoară modificările finalizate, corectează, mai degrabă decât finalizarea sarcinilor.
Utilizatorii ar trebui să urmărească documentația care confirmă când Devin Web și Fusion primesc SWE-2, ce niveluri de efort sunt disponibile în fiecare produs și modul în care este facturată utilizarea. MarkTechPost nu oferă prețuri sau o politică detaliată de acces.
Dezvăluirile tehnice suplimentare ar putea ajuta la evaluarea metodelor de învățare-întărire, a calității verificatorului, a opțiunilor de cuantificare și a rezultatelor de siguranță pretinse. MarkTechPost raportează că Cognition a efectuat din nou evaluări de încredere, dar sursa nu stabilește cât de reprezentative sunt acele teste în ceea ce privește utilizarea codurilor de producție și nici nu reproduce în mod independent constatările lor.