เกิดอะไรขึ้น
นักวิจัยได้แนะนำ PhysElite ซึ่งเป็นเกณฑ์มาตรฐานหลายรูปแบบสองภาษาที่ออกแบบมาเพื่อทดสอบแบบจำลองภาษาขนาดใหญ่เกี่ยวกับปัญหาฟิสิกส์ระดับโอลิมปิก ชุดข้อมูลประกอบด้วยปัญหา 11,586 รายการ แผนภาพภาพ ที่มาของวิธีแก้ปัญหาภาษาจีน-อังกฤษ และคำตอบสุดท้าย รายงานรายงานผลลัพธ์จากการประเมินแบบจำลองภาษาหลายรูปแบบแบบโอเพ่นซอร์สและแบบปิด 18 รูปแบบ โดยแบบจำลองที่แข็งแกร่งที่สุดมีความแม่นยำในการตอบ 33.7%
บทความนี้นำเสนอ PhysElite เป็นเกณฑ์มาตรฐานสำหรับการใช้เหตุผลทางฟิสิกส์ระดับโอลิมปิกโดยแบบจำลองภาษาขนาดใหญ่หลายรูปแบบ ถูกส่งไปยัง arXiv เมื่อวันที่ 25 สิงหาคม 2026 ผู้เขียนโต้แย้งว่าเกณฑ์มาตรฐานทางฟิสิกส์ที่มีอยู่นั้นมีจำกัด เนื่องจากไม่ได้มีปัญหาที่มีความยากสูงเพียงพอ และไม่ครอบคลุมข้อมูลภาพ ความรู้ด้านฟิสิกส์ และกระบวนการแก้ปัญหาทีละขั้นตอนอย่างครอบคลุม
ตามบทคัดย่อของรายงาน PhysElite มีปัญหาระดับโอลิมปิก 11,586 รายการทั้งภาษาจีนและภาษาอังกฤษ แต่ละปัญหาจะจับคู่กับแผนภาพแบบภาพ การสืบค้นแบบสองภาษาโดยแบ่งออกเป็นขั้นตอน และคำตอบสุดท้าย แหล่งที่มากล่าวว่าชุดข้อมูลได้รับการเผยแพร่แล้ว แม้ว่าข้อความที่ให้มาจะไม่รวมลิงก์ปลายทางหรืออธิบายใบอนุญาต รูปแบบ หรือข้อกำหนดในการเข้าถึง
ผู้เขียนได้ประเมินโมเดลภาษาหลากรูปแบบ 18 รูปแบบ รวมทั้งระบบโอเพ่นซอร์สและโอเพ่นซอร์ส โมเดลที่แข็งแกร่งที่สุดมีความแม่นยำในการตอบ 33.7% นักวิจัยยังได้ดำเนินการประเมินกระบวนการระดับขั้นตอนเพื่อระบุจุดที่แบบจำลองล้มเหลวภายในห่วงโซ่การให้เหตุผล แหล่งที่มาไม่ได้ระบุชื่อของแบบจำลอง จำนวนความพยายามต่อปัญหา กฎการให้คะแนน หรือผลลัพธ์โดยละเอียดตามประเภทของปัญหา
ทำไมมันถึงสำคัญ
ผลที่ได้แสดงให้เห็นว่าประสิทธิภาพที่แข็งแกร่งในฟิสิกส์ที่มีอยู่หรือการทดสอบการใช้เหตุผลทั่วไปอาจไม่แปลไปสู่วิธีแก้ปัญหาที่เชื่อถือได้สำหรับปัญหาฟิสิกส์หลายขั้นตอนที่ยากขึ้นกับแผนภาพ PhysElite มีจุดมุ่งหมายเพื่อทำให้จุดอ่อนเหล่านั้นมองเห็นได้ชัดเจนยิ่งขึ้นโดยการประเมินทั้งคำตอบสุดท้ายและแต่ละขั้นตอนของกระบวนการให้เหตุผลของแบบจำลอง
เกณฑ์มาตรฐานกล่าวถึงจุดอ่อนในทางปฏิบัติในการประเมินระบบการให้เหตุผลของ AI บ่อยครั้ง แบบจำลองสามารถให้คำอธิบายได้อย่างคล่องแคล่วหรือทำงานได้ดีกับคำถามสั้นๆ ในขณะที่ยังคงล้มเหลวเมื่อต้องตีความแผนภาพ เลือกหลักการทางกายภาพที่เกี่ยวข้อง ดำเนินการหักล้างที่เชื่อมโยงหลายรายการ และได้คำตอบที่แน่นอน PhysElite ได้รับการออกแบบโดยคำนึงถึงความท้าทายที่ผสมผสานกัน แทนที่จะมองว่าฟิสิกส์เป็นเพียงการตอบคำถามแบบข้อความเท่านั้น
ผลลัพธ์ที่รายงาน 33.7% เป็นผลสืบเนื่อง เนื่องจากมีการกำหนดขีดจำกัดที่ชัดเจนเกี่ยวกับสิ่งที่ระบบที่ทดสอบแสดงให้เห็นในงานที่มีความยากสูงโดยเฉพาะนี้ ไม่ได้แสดงให้เห็นว่าแบบจำลองภาษาหลายรูปแบบไม่สามารถแก้ฟิสิกส์ของโอลิมปิกได้ และไม่ได้พิสูจน์ว่าแบบจำลองทุกแบบมีประสิทธิภาพในระดับเดียวกัน เอกสารดังกล่าวแสดงให้เห็นว่าแม้แต่ระบบที่ได้รับการประเมินที่แข็งแกร่งที่สุดก็ไม่สามารถแก้ไขปัญหาการวัดประสิทธิภาพส่วนใหญ่ได้อย่างถูกต้อง
การประเมินระดับขั้นตอนอาจมีประโยชน์มากกว่าคะแนนสุดท้ายเพียงคะแนนเดียวสำหรับนักวิจัยและผู้ใช้ หากความล้มเหลวส่วนใหญ่เกิดขึ้นขณะตีความไดอะแกรม การเลือกสมการ การคำนวณ หรือการเชื่อมต่อผลลัพธ์ระดับกลาง นักพัฒนาอาจสามารถกำหนดเป้าหมายจุดอ่อนเหล่านั้นได้แม่นยำยิ่งขึ้น แหล่งที่มาที่ให้มาไม่ได้ระบุว่าขั้นตอนใดทำให้เกิดข้อผิดพลาดมากที่สุด ดังนั้นจึงไม่สามารถประเมินค่าการวินิจฉัยของเกณฑ์มาตรฐานโดยละเอียดได้
สำหรับสาธารณะ การค้นพบนี้เตือนไม่ให้ถือว่าระบบ AI ใช้งานทั่วไปเป็นสิ่งทดแทนที่เชื่อถือได้สำหรับการใช้เหตุผลทางฟิสิกส์ของผู้เชี่ยวชาญ ระบบที่ให้วิธีแก้ปัญหาหลายขั้นตอนที่เป็นไปได้แต่ไม่ถูกต้องอาจเป็นเรื่องยากสำหรับผู้ไม่มีผู้เชี่ยวชาญในการตรวจสอบ การออกแบบสองภาษาและภาพของเกณฑ์มาตรฐานอาจช่วยเปิดเผยข้อจำกัดที่ซ่อนอยู่ในการประเมินที่เน้นไปที่ข้อความภาษาอังกฤษหรือรูปแบบคำตอบสุดท้ายสั้นๆ
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
คำถามหลักคือชุดข้อมูลและโค้ดการประเมินสามารถเข้าถึงได้เพียงพอสำหรับการจำลองแบบอิสระหรือไม่ ประสิทธิภาพแตกต่างกันอย่างไรในหัวข้อทางฟิสิกส์และรูปแบบภาพ และโมเดลในอนาคตจะปรับปรุงเกณฑ์มาตรฐานโดยไม่ต้องอาศัยโซลูชันที่จดจำหรือไม่ แหล่งที่มาไม่ได้ระบุโมเดลที่ทดสอบหรือแจกแจงการประเมิน ดังนั้นจึงไม่ควรใช้ 33.7% ที่รายงานเพื่อจัดอันดับระบบเฉพาะ
การจำลองแบบอิสระคือการทดสอบทันที นักวิจัยจะต้องตรวจสอบปัญหา แผนภาพ วิธีแก้ไข และขั้นตอนการให้คะแนนที่เผยแพร่ เพื่อตรวจสอบว่าเกณฑ์มาตรฐานไม่มีความคลุมเครือ รายการที่ซ้ำกัน หรือปัจจัยอื่นๆ ที่อาจส่งผลต่อผลลัพธ์หรือไม่ แหล่งที่มายืนยันการเปิดตัวชุดข้อมูลแต่ไม่ได้ให้ข้อมูลเพียงพอที่จะประเมินความสามารถในการเข้าถึงหรือความสามารถในการทำซ้ำ
การรายงานข่าวในอนาคตควรแสดงให้เห็นว่าตัวเลข 33.7% แบ่งตามวิชาฟิสิกส์ ระดับความยาก ประเภทแผนภาพ ภาษา และรูปแบบคำตอบอย่างไร สิ่งสำคัญคือต้องทราบว่าโมเดลได้รับข้อความแจ้งเดียวกันหรือไม่ อนุญาตให้ใช้เครื่องมือ เช่น เครื่องคิดเลขได้หรือไม่ และวิธีจัดการเครดิตบางส่วน ไม่มีรายละเอียดใดปรากฏในแหล่งที่ให้มา
เกณฑ์มาตรฐานอาจมีข้อมูลมากขึ้นหากการประเมินในภายหลังเปรียบเทียบเวอร์ชันของโมเดลเมื่อเวลาผ่านไป และรายงานทั้งความแม่นยำของคำตอบสุดท้ายและความน่าเชื่อถือระดับขั้นตอน นักวิจัยควรตรวจสอบด้วยว่าแบบจำลองสามารถรับรู้ถึงความไม่แน่นอน ระบุขั้นตอนกลางที่ไม่ถูกต้อง หรือขอคำชี้แจงเมื่อแผนภาพไม่ชัดเจน บทคัดย่อของรายงานไม่ได้รายงานพฤติกรรมเหล่านั้น
สิ่งที่สำคัญที่สุดที่ไม่มีใครทราบก็คือ PhysElite ที่เป็นตัวแทนของงานฟิสิกส์จริงได้อย่างไร ปัญหาโอลิมปิกมีเจตนายากและอาจไม่สะท้อนถึงแบบฝึกหัดในห้องเรียน การวิเคราะห์ในห้องปฏิบัติการ การออกแบบทางวิศวกรรม หรือการปฏิบัติงานวิจัย แหล่งที่มากำหนดขอบเขตของเกณฑ์มาตรฐานและรายงานผล แต่ไม่ได้กำหนดว่าประสิทธิภาพของ PhysElite คาดการณ์ประสิทธิภาพในการตั้งค่าอื่นๆ เหล่านั้นอย่างไร
เมื่อนำมารวมกัน คำอธิบายที่มีอยู่สนับสนุนการตีความผลลัพธ์ที่จำกัด ตัวเลข 33.7% เป็นของการประเมินความแม่นยำของคำตอบที่รายงานของแบบจำลองภาษาหลายรูปแบบที่ทดสอบแล้ว 18 แบบในเกณฑ์มาตรฐานนี้ ควรอ่านควบคู่ไปกับปัญหาสองภาษา แผนภาพภาพ การสืบค้น และคำตอบสุดท้ายของชุดข้อมูล รวมถึงการประเมินกระบวนการระดับขั้นตอนที่แยกต่างหาก เนื่องจากแหล่งที่มาที่ให้มาไม่รวมถึงชื่อโมเดล กฎการให้คะแนน จำนวนความพยายาม การแบ่งหัวข้อ หรือโค้ดการประเมิน ผู้อ่านจึงไม่สามารถใช้นามธรรมเพียงอย่างเดียวเพื่อสร้างการเปรียบเทียบขึ้นใหม่ หรือกำหนดว่าส่วนใดของงานเป็นตัวขับเคลื่อนผลลัพธ์ รายละเอียดที่ขาดหายไปเหล่านั้นจึงเป็นศูนย์กลางในการทำความเข้าใจรายงานที่ตามมาเกี่ยวกับ PhysElite