Co se stalo
MarkTechPost uvádí, že společnost Cognition vydala SWE-2, model kódování vytrénovaný z Moonshot AI Kimi K3. Model je dostupný pouze v rámci Devinu, zpočátku prostřednictvím jeho produktů Desktop a CLI. Přístup k Devin Web a Fusion se údajně zavádí. MarkTechPost říká, že Cognition uvádí výsledky benchmarků a nákladů, ale tato srovnání nebyla nezávisle potvrzena.
MarkTechPost uvádí, že společnost Cognition, která stojí za Devinem, vydala SWE-2 jako svůj dosud nejschopnější model kódování. Podle výstupu společnost Cognition následně trénovala Moonshot AI K3 Kimi K3, který je popsán jako otevřený model s 2,8 biliony parametrů, pomocí učení posílení. MarkTechPost říká, že Cognition oznámilo 50,0% skóre na FrontierCode 1.1 Main, v rámci jednoho procentního bodu od Fable 5.1 při o 64% nižších nákladech. Tyto výsledky jsou hlášeny společností; zdroj neposkytuje nezávislé ověření.
Model není nabízen jako verze s otevřenou váhou nebo jako samostatné API. MarkTechPost říká, že SWE-2 běží pouze v Devinu, přičemž v době hlášení a spuštění Devin Web a Fusion je k dispozici přístup k ploše a CLI. Zdroj neuvádí cenu, požadavky na způsobilost, geografické limity ani datum obecné dostupnosti.
Ústřední změnou je volitelné uvažování. MarkTechPost uvádí, že Cognition trénoval tři úrovně úsilí v jediném běhu posilování a učení a přiřadil každé úrovni jinou cenovou penalizaci. Outlet také popisuje nárokovaná vylepšení oproti SWE-1.7, včetně menšího počtu otáček před provedením počáteční úpravy a nižších hlášených nákladů na FrontierCode. Cognition říká, že model zlepšil pokrytí testů, vynalézavost při používání nástrojů a chování při ověřování, ale tato tvrzení o chování nejsou nezávisle stanovena zdrojem.
Podrobnosti o zdroji: marktechpost.com ↗
Proč na tom záleží
SWE-2 představuje smysluplnou změnu produktu, protože dává uživatelům Devinu více možností uvažování a úsilí a údajně zlepšuje výkon kódování a zároveň snižuje náklady a zbytečné zkoumání. Jeho praktický dosah je však omezený: uživatelé nemohou model nasadit na vlastní infrastrukturu nebo jej volat prostřednictvím samostatného rozhraní API a cena není zdokumentována ve zdroji.
Ohlášené vydání je důležité, protože přesouvá kontrolu nad uvažováním na úrovni modelu do produktu kódovacího agenta. Pokud se nahlášené rozdíly v nákladech a výkonu drží mimo hodnocení Cognition, mohli by vývojáři zvolit rychlejší nebo promyšlenější chování podle obtížnosti úkolu namísto použití jednoho pevného nastavení.
Přístupový model také omezuje bezprostřední význam vydání. Organizace, které vyžadují vlastní hostování, přímou integraci API nebo kontrolu nad váhami modelů, nemohou na základě dostupných informací používat SWE-2 za těchto podmínek. Zdroj neuvádí, zda se plánuje budoucí API nebo širší možnost nasazení.
Důležitý je kontext hodnocení. MarkTechPost říká, že FrontierCode je vlastním měřítkem společnosti Cognition a že konkurenční skóre ve srovnání pochází z hodnocení společnosti Cognition. Zdroj také zaznamenal podstatnou slabinu na Terminal-Bench 4, kde SWE-2 údajně zaostává za ostatními porovnávanými systémy asi o 30 bodů. Díky tomu je vydání důsledkem, ale není důkazem rovnoměrně silnějšího výkonu kódování.
Interaktivní mechanismus: Jak to vlastně funguje
Interaktivně prozkoumejte základní technologii tohoto vývoje.
Which component of an AI application is the machine-learning model itself?
Na co se dále dívat
Sledujte nezávislé testování SWE-2 na srovnávacích testech kódování, jasnější informace o dostupnosti a cenách a důkazy od uživatelů o tom, zda jeho nastavení úsilí vytváří spolehlivé kompromisy mezi cenou a výkonem ve skutečných softwarových projektech.
Nezávislé výsledky benchmarku by měly objasnit, zda uváděné výhody SWE-2 přetrvávají napříč kódovacími prostředími, repozitáři, jazyky a vyhodnocovacími svazky. Zvláštní pozornost by měla být věnována Terminal-Bench 4 a testům, které měří dokončené, opravné změny spíše než samotné dokončení úkolu.
Uživatelé by měli sledovat dokumentaci potvrzující, kdy Devin Web a Fusion obdrží SWE-2, jaké úrovně úsilí jsou k dispozici v každém produktu a jak je účtováno použití. MarkTechPost neposkytuje ceny ani podrobné zásady přístupu.
Další technické zveřejnění by mohlo pomoci vyhodnotit metody učení se zesílením, kvalitu ověřovače, volby kvantizace a deklarované výsledky bezpečnosti. MarkTechPost uvádí, že Cognition znovu provedla hodnocení důvěryhodnosti, ale zdroj nestanoví, jak reprezentativní jsou tyto testy pro použití produkčního kódování, ani nezávisle reprodukují jejich zjištění.