Zpět na Novinky
ProduktInstruktáž AI Understanding

Cognition vydává kódovací model SWE-2 pro Devin

MarkTechPost uvádí, že kódovací model SWE-2 společnosti Cognition je k dispozici v Devinu s volitelnými úrovněmi uvažování a úsilí, ale bez samostatného API nebo otevřených vah.

4 min readRead the linked source
Source-provided image accompanying Cognition releases SWE-2 coding model for Devin
Odkaz na zdrojZdroj zaznamenán
Vydavatel
marktechpost.com
Odkaz na zdroj
marktechpost.comhttps://www.marktechpost.com/2026/09/12/cognition-releases-swe-2-a-kimi-k3-post-trained-coding-model-that-matches-fable-5-1-on-frontiercode-at-64-lower-cost/amp/
Typ zdroje
Propojený zdroj — stav primárního zdroje nebyl stanoven.
KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

API (Application Programming Interface)
Strukturovaný způsob, jak jeden softwarový systém posílat požadavky a přijímat odpovědi z jiného systému.
Posílení učení
Trénink pomocí signálů odměn, kdy se agent učí akce, které maximalizují dlouhodobou návratnost.
Kvantování
Konverze modelových vah do formátů s nižší přesností, jako je 8bitový nebo 4bitový.
Otestujte seKvíz s vysvětlením modelů umělé inteligence

Co se stalo

MarkTechPost uvádí, že společnost Cognition vydala SWE-2, model kódování vytrénovaný z Moonshot AI Kimi K3. Model je dostupný pouze v rámci Devinu, zpočátku prostřednictvím jeho produktů Desktop a CLI. Přístup k Devin Web a Fusion se údajně zavádí. MarkTechPost říká, že Cognition uvádí výsledky benchmarků a nákladů, ale tato srovnání nebyla nezávisle potvrzena.

MarkTechPost uvádí, že společnost Cognition, která stojí za Devinem, vydala SWE-2 jako svůj dosud nejschopnější model kódování. Podle výstupu společnost Cognition následně trénovala Moonshot AI K3 Kimi K3, který je popsán jako otevřený model s 2,8 biliony parametrů, pomocí učení posílení. MarkTechPost říká, že Cognition oznámilo 50,0% skóre na FrontierCode 1.1 Main, v rámci jednoho procentního bodu od Fable 5.1 při o 64% nižších nákladech. Tyto výsledky jsou hlášeny společností; zdroj neposkytuje nezávislé ověření.

Model není nabízen jako verze s otevřenou váhou nebo jako samostatné API. MarkTechPost říká, že SWE-2 běží pouze v Devinu, přičemž v době hlášení a spuštění Devin Web a Fusion je k dispozici přístup k ploše a CLI. Zdroj neuvádí cenu, požadavky na způsobilost, geografické limity ani datum obecné dostupnosti.

Ústřední změnou je volitelné uvažování. MarkTechPost uvádí, že Cognition trénoval tři úrovně úsilí v jediném běhu posilování a učení a přiřadil každé úrovni jinou cenovou penalizaci. Outlet také popisuje nárokovaná vylepšení oproti SWE-1.7, včetně menšího počtu otáček před provedením počáteční úpravy a nižších hlášených nákladů na FrontierCode. Cognition říká, že model zlepšil pokrytí testů, vynalézavost při používání nástrojů a chování při ověřování, ale tato tvrzení o chování nejsou nezávisle stanovena zdrojem.

Podrobnosti o zdroji: marktechpost.com ↗

Proč na tom záleží

SWE-2 představuje smysluplnou změnu produktu, protože dává uživatelům Devinu více možností uvažování a úsilí a údajně zlepšuje výkon kódování a zároveň snižuje náklady a zbytečné zkoumání. Jeho praktický dosah je však omezený: uživatelé nemohou model nasadit na vlastní infrastrukturu nebo jej volat prostřednictvím samostatného rozhraní API a cena není zdokumentována ve zdroji.

Ohlášené vydání je důležité, protože přesouvá kontrolu nad uvažováním na úrovni modelu do produktu kódovacího agenta. Pokud se nahlášené rozdíly v nákladech a výkonu drží mimo hodnocení Cognition, mohli by vývojáři zvolit rychlejší nebo promyšlenější chování podle obtížnosti úkolu namísto použití jednoho pevného nastavení.

Přístupový model také omezuje bezprostřední význam vydání. Organizace, které vyžadují vlastní hostování, přímou integraci API nebo kontrolu nad váhami modelů, nemohou na základě dostupných informací používat SWE-2 za těchto podmínek. Zdroj neuvádí, zda se plánuje budoucí API nebo širší možnost nasazení.

Důležitý je kontext hodnocení. MarkTechPost říká, že FrontierCode je vlastním měřítkem společnosti Cognition a že konkurenční skóre ve srovnání pochází z hodnocení společnosti Cognition. Zdroj také zaznamenal podstatnou slabinu na Terminal-Bench 4, kde SWE-2 údajně zaostává za ostatními porovnávanými systémy asi o 30 bodů. Díky tomu je vydání důsledkem, ale není důkazem rovnoměrně silnějšího výkonu kódování.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Interaktivní kontrola konceptu+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Na co se dále dívat

Sledujte nezávislé testování SWE-2 na srovnávacích testech kódování, jasnější informace o dostupnosti a cenách a důkazy od uživatelů o tom, zda jeho nastavení úsilí vytváří spolehlivé kompromisy mezi cenou a výkonem ve skutečných softwarových projektech.

Nezávislé výsledky benchmarku by měly objasnit, zda uváděné výhody SWE-2 přetrvávají napříč kódovacími prostředími, repozitáři, jazyky a vyhodnocovacími svazky. Zvláštní pozornost by měla být věnována Terminal-Bench 4 a testům, které měří dokončené, opravné změny spíše než samotné dokončení úkolu.

Uživatelé by měli sledovat dokumentaci potvrzující, kdy Devin Web a Fusion obdrží SWE-2, jaké úrovně úsilí jsou k dispozici v každém produktu a jak je účtováno použití. MarkTechPost neposkytuje ceny ani podrobné zásady přístupu.

Další technické zveřejnění by mohlo pomoci vyhodnotit metody učení se zesílením, kvalitu ověřovače, volby kvantizace a deklarované výsledky bezpečnosti. MarkTechPost uvádí, že Cognition znovu provedla hodnocení důvěryhodnosti, ale zdroj nestanoví, jak reprezentativní jsou tyto testy pro použití produkčního kódování, ani nezávisle reprodukují jejich zjištění.

Související průvodci a kvízy

Vysvětlení modelů AIAgenti AIŠkolení AIPrompt EngineeringOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníkuPostupujte podle sledování vydání modelu AI
Považujete to za užitečné?