เกิดอะไรขึ้น
MarkTechPost รายงานว่า Cognition เปิดตัว SWE-2 ซึ่งเป็นโมเดลการเขียนโค้ดหลังการฝึกอบรมจาก Moonshot AI K3 ของ Moonshot AI โมเดลนี้มีเฉพาะใน Devin โดยเริ่มแรกผ่านผลิตภัณฑ์เดสก์ท็อปและ CLI มีรายงานว่าการเข้าถึง Devin Web และ Fusion กำลังเปิดตัว MarkTechPost กล่าวว่า Cognition รายงานเกณฑ์มาตรฐานและผลลัพธ์ด้านต้นทุน แต่การเปรียบเทียบเหล่านั้นยังไม่ได้รับการยืนยันอย่างเป็นอิสระ
MarkTechPost รายงานว่า Cognition ซึ่งเป็นบริษัทที่อยู่เบื้องหลัง Devin ได้เปิดตัว SWE-2 ซึ่งเป็นโมเดลการเข้ารหัสที่มีความสามารถมากที่สุดจนถึงปัจจุบัน ตามรายงานดังกล่าว Kimi K3 ของ Moonshot AI หลังการฝึกอบรม Cognition อธิบายว่าเป็นโมเดลแบบเปิดที่มีพารามิเตอร์ 2.8 ล้านล้านพารามิเตอร์ โดยใช้การเรียนรู้แบบเสริมกำลัง MarkTechPost กล่าวว่า Cognition รายงานคะแนน 50.0% บน FrontierCode 1.1 Main ภายใน 1 เปอร์เซ็นต์ของ Fable 5.1 โดยมีต้นทุนที่ต่ำกว่า 64% ผลลัพธ์เหล่านี้ได้รับการรายงานโดยบริษัท แหล่งที่มาไม่ได้ให้การตรวจสอบโดยอิสระ
โมเดลนี้ไม่ได้นำเสนอเป็นรุ่น open-weight หรือ API แบบสแตนด์อโลน MarkTechPost กล่าวว่า SWE-2 ทำงานภายใน Devin เท่านั้น โดยมีการเข้าถึงเดสก์ท็อปและ CLI ในขณะที่รายงานและ Devin Web และ Fusion กำลังเปิดตัว แหล่งที่มาไม่ได้บันทึกราคา ข้อกำหนดคุณสมบัติ ข้อจำกัดทางภูมิศาสตร์ หรือวันที่วางจำหน่ายทั่วไป
การเปลี่ยนแปลงที่สำคัญคือความพยายามในการให้เหตุผลแบบเลือกได้ MarkTechPost รายงานว่า Cognition ฝึกฝนระดับความพยายามสามระดับในการวิ่งเสริมและการเรียนรู้เพียงครั้งเดียว และกำหนดค่าปรับค่าใช้จ่ายที่แตกต่างกันในแต่ละระดับ ร้านค้ายังอธิบายการปรับปรุงที่อ้างสิทธิ์เหนือ SWE-1.7 รวมถึงรอบน้อยลงก่อนที่จะทำการแก้ไขครั้งแรกและต้นทุนที่รายงานลดลงใน FrontierCode Cognition กล่าวว่าแบบจำลองนี้ปรับปรุงความครอบคลุมของการทดสอบ ความรอบรู้ในการใช้เครื่องมือ และพฤติกรรมการตรวจสอบ แต่การกล่าวอ้างด้านพฤติกรรมเหล่านี้ไม่ได้กำหนดขึ้นโดยอิสระจากแหล่งที่มา
รายละเอียดที่มา: marktechpost.com ↗
ทำไมมันถึงสำคัญ
SWE-2 แสดงถึงการเปลี่ยนแปลงผลิตภัณฑ์ที่มีความหมาย เนื่องจากทำให้ผู้ใช้ Devin มีทางเลือกในการใช้เหตุผลและความพยายามที่หลากหลาย และมีรายงานว่าปรับปรุงประสิทธิภาพการเขียนโค้ดในขณะที่ลดต้นทุนและการสำรวจที่ไม่จำเป็น อย่างไรก็ตาม การเข้าถึงในทางปฏิบัตินั้นมีจำกัด: ผู้ใช้ไม่สามารถปรับใช้โมเดลบนโครงสร้างพื้นฐานของตนเองหรือเรียกใช้ผ่าน API แบบสแตนด์อโลนได้ และการกำหนดราคาไม่ได้บันทึกไว้ในแหล่งที่มา
การเปิดตัวที่รายงานมีความสำคัญเนื่องจากจะย้ายการควบคุมระดับแบบจำลองเหนือความพยายามในการให้เหตุผลไปเป็นผลิตภัณฑ์ตัวแทนการเข้ารหัส หากความแตกต่างของต้นทุนและประสิทธิภาพที่รายงานอยู่นอกเหนือการประเมินของ Cognition นักพัฒนาสามารถเลือกพฤติกรรมที่เร็วกว่าหรือมีเจตนามากขึ้นตามความยากของงาน แทนที่จะใช้การตั้งค่าคงที่เพียงการตั้งค่าเดียว
โมเดลการเข้าถึงยังจำกัดความสำคัญในทันทีของการเปิดตัวอีกด้วย องค์กรที่ต้องการการโฮสต์ด้วยตนเอง การรวม API โดยตรง หรือการควบคุมน้ำหนักโมเดล ไม่สามารถใช้ SWE-2 กับข้อกำหนดเหล่านั้นโดยอิงจากข้อมูลที่มีอยู่ แหล่งที่มาไม่ได้บอกว่ามีการวางแผน API ในอนาคตหรือตัวเลือกการใช้งานที่กว้างขึ้นหรือไม่
บริบทการประเมินเป็นสิ่งสำคัญ MarkTechPost กล่าวว่า FrontierCode เป็นเกณฑ์มาตรฐานของ Cognition และคะแนนของคู่แข่งในการเปรียบเทียบนั้นมาจากการประเมินของ Cognition แหล่งข่าวยังตั้งข้อสังเกตถึงจุดอ่อนที่สำคัญของ Terminal-Bench 4 โดยมีรายงานว่า SWE-2 ติดตามระบบอื่นๆ ที่เปรียบเทียบได้ประมาณ 30 จุด นั่นทำให้การเปิดตัวเป็นผลสืบเนื่อง แต่ไม่ใช่ข้อพิสูจน์ถึงประสิทธิภาพการเข้ารหัสที่แข็งแกร่งยิ่งขึ้น
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
ติดตามการทดสอบ SWE-2 โดยอิสระเกี่ยวกับเกณฑ์มาตรฐานการเข้ารหัส ความพร้อมใช้งานและข้อมูลราคาที่ชัดเจนยิ่งขึ้น และหลักฐานจากผู้ใช้ว่าการตั้งค่าความพยายามทำให้เกิดการแลกเปลี่ยนต้นทุนและประสิทธิภาพที่เชื่อถือได้ในโครงการซอฟต์แวร์จริงหรือไม่
ผลลัพธ์การวัดประสิทธิภาพที่เป็นอิสระควรชี้แจงว่าข้อได้เปรียบที่รายงานของ SWE-2 ยังคงมีอยู่ในสภาพแวดล้อมการเขียนโค้ด พื้นที่เก็บข้อมูล ภาษา และชุดประเมินผลหรือไม่ ควรให้ความสนใจเป็นพิเศษไปที่ Terminal-Bench 4 และทดสอบการวัดที่เสร็จสมบูรณ์ แก้ไขการเปลี่ยนแปลง แทนที่จะทำงานให้เสร็จสิ้นเพียงอย่างเดียว
ผู้ใช้ควรดูเอกสารที่ยืนยันว่า Devin Web และ Fusion ได้รับ SWE-2 เมื่อใด ระดับความพยายามที่มีอยู่ในแต่ละผลิตภัณฑ์ และวิธีการเรียกเก็บเงินการใช้งาน MarkTechPost ไม่ได้ระบุราคาหรือนโยบายการเข้าถึงโดยละเอียด
การเปิดเผยทางเทคนิคเพิ่มเติมสามารถช่วยประเมินวิธีการเสริมกำลัง-การเรียนรู้ คุณภาพของผู้ตรวจสอบ ตัวเลือกการหาปริมาณ และผลลัพธ์ด้านความปลอดภัยที่อ้างสิทธิ์ MarkTechPost รายงานว่า Cognition ดำเนินการประเมินความน่าเชื่อถืออีกครั้ง แต่แหล่งที่มาไม่ได้กำหนดว่าการทดสอบเหล่านั้นเป็นตัวแทนของการใช้การเข้ารหัสที่ใช้งานจริงหรือทำซ้ำสิ่งที่ค้นพบอย่างอิสระได้อย่างไร