กลับไปที่ข่าว
สินค้าAI Understanding บรรยายสรุป

Cognition เปิดตัวโมเดลการเข้ารหัส SWE-2 สำหรับ Devin

MarkTechPost รายงานว่าโมเดลการเข้ารหัส SWE-2 ของ Cognition นั้นมีอยู่ใน Devin โดยมีระดับความพยายามในการให้เหตุผลที่เลือกได้ แต่ไม่มี API แบบสแตนด์อโลนหรือน้ำหนักแบบเปิด

4 min readRead the linked source
Source-provided image accompanying Cognition releases SWE-2 coding model for Devin
แหล่งอ้างอิงแหล่งที่มาบันทึกไว้
สำนักพิมพ์
marktechpost.com
ลิงค์แหล่งที่มา
marktechpost.comhttps://www.marktechpost.com/2026/09/12/cognition-releases-swe-2-a-kimi-k3-post-trained-coding-model-that-matches-fable-5-1-on-frontiercode-at-64-lower-cost/amp/
ประเภทแหล่งที่มา
แหล่งที่มาที่เชื่อมโยง — ยังไม่ได้สร้างสถานะแหล่งที่มาหลัก
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

API (อินเทอร์เฟซการเขียนโปรแกรมแอปพลิเคชัน)
วิธีการที่มีโครงสร้างสำหรับระบบซอฟต์แวร์หนึ่งในการส่งคำขอและรับการตอบกลับจากอีกระบบหนึ่ง
การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
การหาปริมาณ
การแปลงน้ำหนักโมเดลเป็นรูปแบบที่มีความแม่นยำต่ำ เช่น 8 บิตหรือ 4 บิต
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

MarkTechPost รายงานว่า Cognition เปิดตัว SWE-2 ซึ่งเป็นโมเดลการเขียนโค้ดหลังการฝึกอบรมจาก Moonshot AI K3 ของ Moonshot AI โมเดลนี้มีเฉพาะใน Devin โดยเริ่มแรกผ่านผลิตภัณฑ์เดสก์ท็อปและ CLI มีรายงานว่าการเข้าถึง Devin Web และ Fusion กำลังเปิดตัว MarkTechPost กล่าวว่า Cognition รายงานเกณฑ์มาตรฐานและผลลัพธ์ด้านต้นทุน แต่การเปรียบเทียบเหล่านั้นยังไม่ได้รับการยืนยันอย่างเป็นอิสระ

MarkTechPost รายงานว่า Cognition ซึ่งเป็นบริษัทที่อยู่เบื้องหลัง Devin ได้เปิดตัว SWE-2 ซึ่งเป็นโมเดลการเข้ารหัสที่มีความสามารถมากที่สุดจนถึงปัจจุบัน ตามรายงานดังกล่าว Kimi K3 ของ Moonshot AI หลังการฝึกอบรม Cognition อธิบายว่าเป็นโมเดลแบบเปิดที่มีพารามิเตอร์ 2.8 ล้านล้านพารามิเตอร์ โดยใช้การเรียนรู้แบบเสริมกำลัง MarkTechPost กล่าวว่า Cognition รายงานคะแนน 50.0% บน FrontierCode 1.1 Main ภายใน 1 เปอร์เซ็นต์ของ Fable 5.1 โดยมีต้นทุนที่ต่ำกว่า 64% ผลลัพธ์เหล่านี้ได้รับการรายงานโดยบริษัท แหล่งที่มาไม่ได้ให้การตรวจสอบโดยอิสระ

โมเดลนี้ไม่ได้นำเสนอเป็นรุ่น open-weight หรือ API แบบสแตนด์อโลน MarkTechPost กล่าวว่า SWE-2 ทำงานภายใน Devin เท่านั้น โดยมีการเข้าถึงเดสก์ท็อปและ CLI ในขณะที่รายงานและ Devin Web และ Fusion กำลังเปิดตัว แหล่งที่มาไม่ได้บันทึกราคา ข้อกำหนดคุณสมบัติ ข้อจำกัดทางภูมิศาสตร์ หรือวันที่วางจำหน่ายทั่วไป

การเปลี่ยนแปลงที่สำคัญคือความพยายามในการให้เหตุผลแบบเลือกได้ MarkTechPost รายงานว่า Cognition ฝึกฝนระดับความพยายามสามระดับในการวิ่งเสริมและการเรียนรู้เพียงครั้งเดียว และกำหนดค่าปรับค่าใช้จ่ายที่แตกต่างกันในแต่ละระดับ ร้านค้ายังอธิบายการปรับปรุงที่อ้างสิทธิ์เหนือ SWE-1.7 รวมถึงรอบน้อยลงก่อนที่จะทำการแก้ไขครั้งแรกและต้นทุนที่รายงานลดลงใน FrontierCode Cognition กล่าวว่าแบบจำลองนี้ปรับปรุงความครอบคลุมของการทดสอบ ความรอบรู้ในการใช้เครื่องมือ และพฤติกรรมการตรวจสอบ แต่การกล่าวอ้างด้านพฤติกรรมเหล่านี้ไม่ได้กำหนดขึ้นโดยอิสระจากแหล่งที่มา

รายละเอียดที่มา: marktechpost.com ↗

ทำไมมันถึงสำคัญ

SWE-2 แสดงถึงการเปลี่ยนแปลงผลิตภัณฑ์ที่มีความหมาย เนื่องจากทำให้ผู้ใช้ Devin มีทางเลือกในการใช้เหตุผลและความพยายามที่หลากหลาย และมีรายงานว่าปรับปรุงประสิทธิภาพการเขียนโค้ดในขณะที่ลดต้นทุนและการสำรวจที่ไม่จำเป็น อย่างไรก็ตาม การเข้าถึงในทางปฏิบัตินั้นมีจำกัด: ผู้ใช้ไม่สามารถปรับใช้โมเดลบนโครงสร้างพื้นฐานของตนเองหรือเรียกใช้ผ่าน API แบบสแตนด์อโลนได้ และการกำหนดราคาไม่ได้บันทึกไว้ในแหล่งที่มา

การเปิดตัวที่รายงานมีความสำคัญเนื่องจากจะย้ายการควบคุมระดับแบบจำลองเหนือความพยายามในการให้เหตุผลไปเป็นผลิตภัณฑ์ตัวแทนการเข้ารหัส หากความแตกต่างของต้นทุนและประสิทธิภาพที่รายงานอยู่นอกเหนือการประเมินของ Cognition นักพัฒนาสามารถเลือกพฤติกรรมที่เร็วกว่าหรือมีเจตนามากขึ้นตามความยากของงาน แทนที่จะใช้การตั้งค่าคงที่เพียงการตั้งค่าเดียว

โมเดลการเข้าถึงยังจำกัดความสำคัญในทันทีของการเปิดตัวอีกด้วย องค์กรที่ต้องการการโฮสต์ด้วยตนเอง การรวม API โดยตรง หรือการควบคุมน้ำหนักโมเดล ไม่สามารถใช้ SWE-2 กับข้อกำหนดเหล่านั้นโดยอิงจากข้อมูลที่มีอยู่ แหล่งที่มาไม่ได้บอกว่ามีการวางแผน API ในอนาคตหรือตัวเลือกการใช้งานที่กว้างขึ้นหรือไม่

บริบทการประเมินเป็นสิ่งสำคัญ MarkTechPost กล่าวว่า FrontierCode เป็นเกณฑ์มาตรฐานของ Cognition และคะแนนของคู่แข่งในการเปรียบเทียบนั้นมาจากการประเมินของ Cognition แหล่งข่าวยังตั้งข้อสังเกตถึงจุดอ่อนที่สำคัญของ Terminal-Bench 4 โดยมีรายงานว่า SWE-2 ติดตามระบบอื่นๆ ที่เปรียบเทียบได้ประมาณ 30 จุด นั่นทำให้การเปิดตัวเป็นผลสืบเนื่อง แต่ไม่ใช่ข้อพิสูจน์ถึงประสิทธิภาพการเข้ารหัสที่แข็งแกร่งยิ่งขึ้น

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

ติดตามการทดสอบ SWE-2 โดยอิสระเกี่ยวกับเกณฑ์มาตรฐานการเข้ารหัส ความพร้อมใช้งานและข้อมูลราคาที่ชัดเจนยิ่งขึ้น และหลักฐานจากผู้ใช้ว่าการตั้งค่าความพยายามทำให้เกิดการแลกเปลี่ยนต้นทุนและประสิทธิภาพที่เชื่อถือได้ในโครงการซอฟต์แวร์จริงหรือไม่

ผลลัพธ์การวัดประสิทธิภาพที่เป็นอิสระควรชี้แจงว่าข้อได้เปรียบที่รายงานของ SWE-2 ยังคงมีอยู่ในสภาพแวดล้อมการเขียนโค้ด พื้นที่เก็บข้อมูล ภาษา และชุดประเมินผลหรือไม่ ควรให้ความสนใจเป็นพิเศษไปที่ Terminal-Bench 4 และทดสอบการวัดที่เสร็จสมบูรณ์ แก้ไขการเปลี่ยนแปลง แทนที่จะทำงานให้เสร็จสิ้นเพียงอย่างเดียว

ผู้ใช้ควรดูเอกสารที่ยืนยันว่า Devin Web และ Fusion ได้รับ SWE-2 เมื่อใด ระดับความพยายามที่มีอยู่ในแต่ละผลิตภัณฑ์ และวิธีการเรียกเก็บเงินการใช้งาน MarkTechPost ไม่ได้ระบุราคาหรือนโยบายการเข้าถึงโดยละเอียด

การเปิดเผยทางเทคนิคเพิ่มเติมสามารถช่วยประเมินวิธีการเสริมกำลัง-การเรียนรู้ คุณภาพของผู้ตรวจสอบ ตัวเลือกการหาปริมาณ และผลลัพธ์ด้านความปลอดภัยที่อ้างสิทธิ์ MarkTechPost รายงานว่า Cognition ดำเนินการประเมินความน่าเชื่อถืออีกครั้ง แต่แหล่งที่มาไม่ได้กำหนดว่าการทดสอบเหล่านั้นเป็นตัวแทนของการใช้การเข้ารหัสที่ใช้งานจริงหรือทำซ้ำสิ่งที่ค้นพบอย่างอิสระได้อย่างไร

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIตัวแทนเอไอการฝึกอบรมเอไอPrompt Engineeringทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?