เกิดอะไรขึ้น
MarkTechPost รายงานว่านักวิจัยจาก Meta FAIR, University of Oxford และ University College London ได้แนะนำ AI Research Preference Models หรือ RPMs เพื่อเลือกการทดลองที่ตัวแทนการวิจัย AI ควรดำเนินการ ในการประเมิน AIRS-Bench ที่รายงาน RPM ได้ปรับปรุงคะแนนเฉลี่ยที่เป็นมาตรฐาน และถึงเกณฑ์พื้นฐานของการเลือกแบบสุ่มในเวลาประมาณ 15 ชั่วโมง แทนที่จะเป็น 24 ชั่วโมง
MarkTechPost รายงานว่า RPM จัดอันดับการทดลองที่ยังไม่ได้ดำเนินการ แทนที่จะทำนายคะแนนสัมบูรณ์ ระบบที่รายงานใช้โครงการค้นหาต้นไม้แบบวิวัฒนาการที่เรียกว่า AIRA-dojo ตัวแทนสร้างผู้สมัครย่อย 15 คนพร้อมกัน เปรียบเทียบพวกเขาแบบคู่ในทัวร์นาเมนต์น็อคเอาท์ และดำเนินการเฉพาะผู้ชนะเท่านั้น การเปรียบเทียบใช้โหนดบริบทที่สำรวจก่อนหน้านี้และคะแนนการตรวจสอบความถูกต้อง
บทความนี้จะอธิบายตัวแปรสองแบบ RPM สำหรับการอนุมานเท่านั้นจะตัดสินแผน โค้ด และประวัติการค้นหาของผู้สมัครด้วยโมเดลภาษาที่ได้รับการฝึกล่วงหน้าแบบแช่แข็ง นอกจากนี้ RPM แบบเอเจนต์ยังทำการทดลองนำร่องขนาดเล็กในสภาพแวดล้อมแบบโคลนที่มี H200 GPU หนึ่งตัว โดยใช้ Python, bash และเครื่องมือการส่ง MarkTechPost รายงานว่าตัวเลือกตัวแทนใช้สำหรับขั้นตอนแบบร่างและปรับปรุงเท่านั้น ในขณะที่การเลือกการแก้ไขจุดบกพร่องเปลี่ยนกลับเป็นการสุ่มเนื่องจากนักบินใช้งบประมาณเวลาของตัวแทน
บน AIRS-Bench ซึ่ง MarkTechPost อธิบายว่าประกอบด้วยงานข้อความสาธารณะและแบบตาราง 20 งาน คะแนนมาตรฐานโดยเฉลี่ยที่รายงานคือ 0.684 สำหรับการเลือกแบบสุ่ม 0.711 สำหรับ RPM สำหรับการอนุมานเท่านั้น และ 0.729 สำหรับ RPM แบบเอเจนต์ มีรายงานว่าการตั้งค่าใช้ Qwen3.6-27B สำหรับทั้งผู้ดำเนินการทดสอบและ RPM โดยมี 10 เมล็ดและ 24 ชั่วโมงใน H200 หนึ่งรายการต่องาน
MarkTechPost รายงานว่าตัวแปร RPM ทั้งสองถึงเส้นฐานการเลือกแบบสุ่มในเวลาประมาณ 15 ชั่วโมง: 14.88 ชั่วโมงสำหรับการอนุมานเท่านั้น และ 15.50 ชั่วโมงสำหรับการเลือกแบบตัวแทน บทความนี้ยังรายงานผลลัพธ์ 94.1% ใน WinoGrande และ 95.7% ใน SVAMP โดยอธิบายว่าเป็นผลลัพธ์ที่ล้ำสมัยใหม่ ตัวเลขและการเปรียบเทียบเหล่านี้เป็นการกล่าวอ้างในรายงานที่ให้มา ไม่ใช่ผลลัพธ์ที่ได้รับการยืนยันโดยอิสระ
บทความนี้กล่าวว่าโครง AIRA-dojo และ AIRS-Bench เป็นโอเพ่นซอร์ส และ Qwen3.6-27B มีจำหน่ายในรูปแบบตุ้มน้ำหนักแบบเปิด ไม่มีลิงก์การเข้าถึงโดยตรง เงื่อนไขการอนุญาต บริการโฮสต์ รายละเอียดการสนับสนุนเชิงพาณิชย์ หรือราคา วัสดุที่ให้มาไม่ได้ระบุว่าระบบพร้อมสำหรับการใช้งานการผลิตทั่วไป
รายละเอียดที่มา: marktechpost.com ↗
ทำไมมันถึงสำคัญ
หากรายงานผลยังคงอยู่ การเลือกการทดลองก่อนดำเนินการอาจทำให้การวิจัยที่ได้รับความช่วยเหลือจาก AI มีประสิทธิภาพในการประมวลผลมากขึ้น แนวทางนี้ช่วยแก้ปัญหาคอขวดในทางปฏิบัติ: ตัวแทนการวิจัยสามารถสร้างการทดลองที่มีผู้สมัครได้จำนวนมาก แต่การทดสอบแต่ละรายการมีราคาแพง หลักฐานยังคงจำกัดอยู่ที่เกณฑ์มาตรฐานที่รายงาน และไม่ได้รับการยืนยันอย่างเป็นอิสระในเอกสารที่ให้มา
งานที่รายงานมุ่งเป้าไปที่ปัญหาการจัดสรรทรัพยากรในการวิจัย AI แทนที่จะเพียงปรับปรุงคะแนนมาตรฐานของแบบจำลองเท่านั้น ตัวแทนที่สามารถสร้างแนวคิดได้มากกว่าที่ทีมจะสามารถทดสอบได้นั้นต้องการวิธีที่เชื่อถือได้ในการตัดสินใจว่าการทดลองใดที่สมควรได้รับการคำนวณ ชั้นการคัดเลือกจึงอาจส่งผลต่อปริมาณงานการวิจัย โดยเฉพาะอย่างยิ่งเมื่อการฝึกอบรมหรือการประเมินผลใช้เวลาหลายชั่วโมงหรือหลายวัน
การเปรียบเทียบที่รายงานแสดงให้เห็นว่าประโยชน์บางอย่างมาจากการเลือกระหว่างผู้สมัคร เนื่องจากแกนหลัก Qwen3.6-27B เดียวกันนั้นถูกใช้สำหรับผู้ดำเนินการทดสอบและ RPM MarkTechPost รายงานการเพิ่มขึ้นสัมพัทธ์ 6.0% จาก 0.684 เป็น 0.711 สำหรับการเลือกแบบอนุมานเท่านั้น และเพิ่มขึ้น 6.6% เป็น 0.729 สำหรับการเลือกแบบตัวแทน แต่บทความที่ให้มาไม่ได้ให้รายละเอียดด้านระเบียบวิธีเพียงพอที่จะประเมินความทนทานทางสถิติเกินช่วงความเชื่อมั่นที่ระบุไว้
มีข้อจำกัดที่มีความหมาย AIRS-Bench ครอบคลุมงานข้อความสาธารณะและตาราง 20 งาน และการทดลองใช้การตั้งค่า H200 เพียงครั้งเดียว ดังนั้นการค้นพบจึงไม่สามารถถ่ายโอนไปยังโครงการวิจัยขนาดใหญ่ ฮาร์ดแวร์อื่นๆ หรือโดเมนทางวิทยาศาสตร์ได้ รายงานไม่ได้ให้การจำลองแบบอย่างอิสระ กรณีศึกษาการใช้งาน หรือหลักฐานที่แสดงว่าแนวทางดังกล่าวช่วยปรับปรุงการค้นพบในโลกแห่งความเป็นจริงมากกว่าผลลัพธ์ที่เป็นเกณฑ์มาตรฐาน
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
จะดูอะไรต่อไป.
คอยดูกระดาษ โค้ด และสิ่งประดิษฐ์ด้านการวัดประสิทธิภาพ การจำลองแบบในงานเพิ่มเติม และหลักฐานว่าผลประโยชน์ยังคงมีอยู่ในรุ่น ผู้ปฏิบัติงาน ฮาร์ดแวร์ และโดเมนการวิจัยที่แตกต่างกันหรือไม่ มีการอธิบายการเข้าถึงส่วนประกอบโอเพ่นซอร์สที่รายงาน แต่ไม่มีการระบุราคา ความพร้อมใช้งานของโฮสต์ และการสนับสนุนการผลิต
การตรวจสอบครั้งต่อไปที่มีประโยชน์ที่สุดคือว่าผู้วิจัยเผยแพร่รายงานที่เกี่ยวข้อง บันทึกการใช้งานและการประเมินผลหรือไม่ และทีมภายนอกจะทำซ้ำคะแนนที่รายงานและการประหยัดเวลาหรือไม่ รายงานที่ให้มาชี้ไปที่ส่วนประกอบโอเพ่นซอร์ส แต่ไม่ได้ตรวจสอบความพร้อมใช้งานหรือการใช้งานอย่างอิสระ
การประเมินในอนาคตควรทดสอบโมเดลแกนหลักที่แตกต่างกัน วิธีการสร้างผู้สมัคร ตระกูลงาน และงบประมาณในการประมวลผล การออกแบบตัวแทนที่รายงานยังใช้การทดลองนำร่องระยะสั้นและงบประมาณที่เหลืออยู่เกินจริงโดยเจตนา ตัวเลือกที่อาจมีอิทธิพลต่อผลลัพธ์และสมควรได้รับการทดสอบภายใต้การบัญชีทรัพยากรทั่วไป
ผู้ใช้ที่มีศักยภาพควรถือว่าเครื่องมือที่รายงานเป็นส่วนประกอบในการวิจัย ไม่ใช่เป็นผลิตภัณฑ์เชิงพาณิชย์ที่ได้รับการบันทึกไว้ แหล่งที่มาไม่ได้ให้ราคา ข้อกำหนดระดับบริการ ข้อกำหนดการติดตั้ง หรือคำชี้แจงเกี่ยวกับความพร้อมใช้งานทั่วไป นอกจากนี้ยังไม่ได้แสดงว่า RPM สามารถจัดการการทดสอบที่ความล้มเหลวมีค่าใช้จ่ายสูงหรือเมตริกการตรวจสอบความถูกต้องไม่น่าเชื่อถือได้อย่างปลอดภัยหรือไม่
ผลลัพธ์ของ WinoGrande และ SVAMP ที่รายงานรับประกันการตรวจสอบเทียบกับข้อมูลพื้นฐานที่อ้างถึงก่อนหน้านี้ บทความนี้ไม่ได้ให้การทดสอบโดยหน่วยงานอิสระ การแจกแจงทางสถิติโดยละเอียด หรือข้อมูลที่เพียงพอที่จะพิจารณาว่าผลกำไรเหล่านั้นมีการสรุปในวงกว้างเพียงใด