กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

รายงานของ PhysElite รายงานว่า LLM ชั้นนำหลายรูปแบบสามารถแก้ไขปัญหาฟิสิกส์ระดับโอลิมปิกได้ 33.7%

เกณฑ์มาตรฐานใหม่ของปัญหาฟิสิกส์ตามแผนภาพสองภาษา 11,586 รายการรายงานว่าโมเดลภาษาหลากรูปแบบที่แข็งแกร่งที่สุดจากการทดสอบ 18 รูปแบบได้รับความแม่นยำในการตอบเพียง 33.7% เท่านั้น

5 min readRead the primary source
Primary-source image accompanying PhysElite paper reports that leading multimodal LLM solved 33.7% of Olympiad-level physics problems
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.25097
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
ชุดข้อมูล
คอลเลกชันของตัวอย่างที่มีโครงสร้างหรือไม่มีโครงสร้างที่ใช้สำหรับการฝึกอบรม การตรวจสอบ หรือการทดสอบ
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยได้แนะนำ PhysElite ซึ่งเป็นเกณฑ์มาตรฐานหลายรูปแบบสองภาษาที่ออกแบบมาเพื่อทดสอบแบบจำลองภาษาขนาดใหญ่เกี่ยวกับปัญหาฟิสิกส์ระดับโอลิมปิก ชุดข้อมูลประกอบด้วยปัญหา 11,586 รายการ แผนภาพภาพ ที่มาของวิธีแก้ปัญหาภาษาจีน-อังกฤษ และคำตอบสุดท้าย รายงานรายงานผลลัพธ์จากการประเมินแบบจำลองภาษาหลายรูปแบบแบบโอเพ่นซอร์สและแบบปิด 18 รูปแบบ โดยแบบจำลองที่แข็งแกร่งที่สุดมีความแม่นยำในการตอบ 33.7%

บทความนี้นำเสนอ PhysElite เป็นเกณฑ์มาตรฐานสำหรับการใช้เหตุผลทางฟิสิกส์ระดับโอลิมปิกโดยแบบจำลองภาษาขนาดใหญ่หลายรูปแบบ ถูกส่งไปยัง arXiv เมื่อวันที่ 25 สิงหาคม 2026 ผู้เขียนโต้แย้งว่าเกณฑ์มาตรฐานทางฟิสิกส์ที่มีอยู่นั้นมีจำกัด เนื่องจากไม่ได้มีปัญหาที่มีความยากสูงเพียงพอ และไม่ครอบคลุมข้อมูลภาพ ความรู้ด้านฟิสิกส์ และกระบวนการแก้ปัญหาทีละขั้นตอนอย่างครอบคลุม

ตามบทคัดย่อของรายงาน PhysElite มีปัญหาระดับโอลิมปิก 11,586 รายการทั้งภาษาจีนและภาษาอังกฤษ แต่ละปัญหาจะจับคู่กับแผนภาพแบบภาพ การสืบค้นแบบสองภาษาโดยแบ่งออกเป็นขั้นตอน และคำตอบสุดท้าย แหล่งที่มากล่าวว่าชุดข้อมูลได้รับการเผยแพร่แล้ว แม้ว่าข้อความที่ให้มาจะไม่รวมลิงก์ปลายทางหรืออธิบายใบอนุญาต รูปแบบ หรือข้อกำหนดในการเข้าถึง

ผู้เขียนได้ประเมินโมเดลภาษาหลากรูปแบบ 18 รูปแบบ รวมทั้งระบบโอเพ่นซอร์สและโอเพ่นซอร์ส โมเดลที่แข็งแกร่งที่สุดมีความแม่นยำในการตอบ 33.7% นักวิจัยยังได้ดำเนินการประเมินกระบวนการระดับขั้นตอนเพื่อระบุจุดที่แบบจำลองล้มเหลวภายในห่วงโซ่การให้เหตุผล แหล่งที่มาไม่ได้ระบุชื่อของแบบจำลอง จำนวนความพยายามต่อปัญหา กฎการให้คะแนน หรือผลลัพธ์โดยละเอียดตามประเภทของปัญหา

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ผลที่ได้แสดงให้เห็นว่าประสิทธิภาพที่แข็งแกร่งในฟิสิกส์ที่มีอยู่หรือการทดสอบการใช้เหตุผลทั่วไปอาจไม่แปลไปสู่วิธีแก้ปัญหาที่เชื่อถือได้สำหรับปัญหาฟิสิกส์หลายขั้นตอนที่ยากขึ้นกับแผนภาพ PhysElite มีจุดมุ่งหมายเพื่อทำให้จุดอ่อนเหล่านั้นมองเห็นได้ชัดเจนยิ่งขึ้นโดยการประเมินทั้งคำตอบสุดท้ายและแต่ละขั้นตอนของกระบวนการให้เหตุผลของแบบจำลอง

เกณฑ์มาตรฐานกล่าวถึงจุดอ่อนในทางปฏิบัติในการประเมินระบบการให้เหตุผลของ AI บ่อยครั้ง แบบจำลองสามารถให้คำอธิบายได้อย่างคล่องแคล่วหรือทำงานได้ดีกับคำถามสั้นๆ ในขณะที่ยังคงล้มเหลวเมื่อต้องตีความแผนภาพ เลือกหลักการทางกายภาพที่เกี่ยวข้อง ดำเนินการหักล้างที่เชื่อมโยงหลายรายการ และได้คำตอบที่แน่นอน PhysElite ได้รับการออกแบบโดยคำนึงถึงความท้าทายที่ผสมผสานกัน แทนที่จะมองว่าฟิสิกส์เป็นเพียงการตอบคำถามแบบข้อความเท่านั้น

ผลลัพธ์ที่รายงาน 33.7% เป็นผลสืบเนื่อง เนื่องจากมีการกำหนดขีดจำกัดที่ชัดเจนเกี่ยวกับสิ่งที่ระบบที่ทดสอบแสดงให้เห็นในงานที่มีความยากสูงโดยเฉพาะนี้ ไม่ได้แสดงให้เห็นว่าแบบจำลองภาษาหลายรูปแบบไม่สามารถแก้ฟิสิกส์ของโอลิมปิกได้ และไม่ได้พิสูจน์ว่าแบบจำลองทุกแบบมีประสิทธิภาพในระดับเดียวกัน เอกสารดังกล่าวแสดงให้เห็นว่าแม้แต่ระบบที่ได้รับการประเมินที่แข็งแกร่งที่สุดก็ไม่สามารถแก้ไขปัญหาการวัดประสิทธิภาพส่วนใหญ่ได้อย่างถูกต้อง

การประเมินระดับขั้นตอนอาจมีประโยชน์มากกว่าคะแนนสุดท้ายเพียงคะแนนเดียวสำหรับนักวิจัยและผู้ใช้ หากความล้มเหลวส่วนใหญ่เกิดขึ้นขณะตีความไดอะแกรม การเลือกสมการ การคำนวณ หรือการเชื่อมต่อผลลัพธ์ระดับกลาง นักพัฒนาอาจสามารถกำหนดเป้าหมายจุดอ่อนเหล่านั้นได้แม่นยำยิ่งขึ้น แหล่งที่มาที่ให้มาไม่ได้ระบุว่าขั้นตอนใดทำให้เกิดข้อผิดพลาดมากที่สุด ดังนั้นจึงไม่สามารถประเมินค่าการวินิจฉัยของเกณฑ์มาตรฐานโดยละเอียดได้

สำหรับสาธารณะ การค้นพบนี้เตือนไม่ให้ถือว่าระบบ AI ใช้งานทั่วไปเป็นสิ่งทดแทนที่เชื่อถือได้สำหรับการใช้เหตุผลทางฟิสิกส์ของผู้เชี่ยวชาญ ระบบที่ให้วิธีแก้ปัญหาหลายขั้นตอนที่เป็นไปได้แต่ไม่ถูกต้องอาจเป็นเรื่องยากสำหรับผู้ไม่มีผู้เชี่ยวชาญในการตรวจสอบ การออกแบบสองภาษาและภาพของเกณฑ์มาตรฐานอาจช่วยเปิดเผยข้อจำกัดที่ซ่อนอยู่ในการประเมินที่เน้นไปที่ข้อความภาษาอังกฤษหรือรูปแบบคำตอบสุดท้ายสั้นๆ

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามหลักคือชุดข้อมูลและโค้ดการประเมินสามารถเข้าถึงได้เพียงพอสำหรับการจำลองแบบอิสระหรือไม่ ประสิทธิภาพแตกต่างกันอย่างไรในหัวข้อทางฟิสิกส์และรูปแบบภาพ และโมเดลในอนาคตจะปรับปรุงเกณฑ์มาตรฐานโดยไม่ต้องอาศัยโซลูชันที่จดจำหรือไม่ แหล่งที่มาไม่ได้ระบุโมเดลที่ทดสอบหรือแจกแจงการประเมิน ดังนั้นจึงไม่ควรใช้ 33.7% ที่รายงานเพื่อจัดอันดับระบบเฉพาะ

การจำลองแบบอิสระคือการทดสอบทันที นักวิจัยจะต้องตรวจสอบปัญหา แผนภาพ วิธีแก้ไข และขั้นตอนการให้คะแนนที่เผยแพร่ เพื่อตรวจสอบว่าเกณฑ์มาตรฐานไม่มีความคลุมเครือ รายการที่ซ้ำกัน หรือปัจจัยอื่นๆ ที่อาจส่งผลต่อผลลัพธ์หรือไม่ แหล่งที่มายืนยันการเปิดตัวชุดข้อมูลแต่ไม่ได้ให้ข้อมูลเพียงพอที่จะประเมินความสามารถในการเข้าถึงหรือความสามารถในการทำซ้ำ

การรายงานข่าวในอนาคตควรแสดงให้เห็นว่าตัวเลข 33.7% แบ่งตามวิชาฟิสิกส์ ระดับความยาก ประเภทแผนภาพ ภาษา และรูปแบบคำตอบอย่างไร สิ่งสำคัญคือต้องทราบว่าโมเดลได้รับข้อความแจ้งเดียวกันหรือไม่ อนุญาตให้ใช้เครื่องมือ เช่น เครื่องคิดเลขได้หรือไม่ และวิธีจัดการเครดิตบางส่วน ไม่มีรายละเอียดใดปรากฏในแหล่งที่ให้มา

เกณฑ์มาตรฐานอาจมีข้อมูลมากขึ้นหากการประเมินในภายหลังเปรียบเทียบเวอร์ชันของโมเดลเมื่อเวลาผ่านไป และรายงานทั้งความแม่นยำของคำตอบสุดท้ายและความน่าเชื่อถือระดับขั้นตอน นักวิจัยควรตรวจสอบด้วยว่าแบบจำลองสามารถรับรู้ถึงความไม่แน่นอน ระบุขั้นตอนกลางที่ไม่ถูกต้อง หรือขอคำชี้แจงเมื่อแผนภาพไม่ชัดเจน บทคัดย่อของรายงานไม่ได้รายงานพฤติกรรมเหล่านั้น

สิ่งที่สำคัญที่สุดที่ไม่มีใครทราบก็คือ PhysElite ที่เป็นตัวแทนของงานฟิสิกส์จริงได้อย่างไร ปัญหาโอลิมปิกมีเจตนายากและอาจไม่สะท้อนถึงแบบฝึกหัดในห้องเรียน การวิเคราะห์ในห้องปฏิบัติการ การออกแบบทางวิศวกรรม หรือการปฏิบัติงานวิจัย แหล่งที่มากำหนดขอบเขตของเกณฑ์มาตรฐานและรายงานผล แต่ไม่ได้กำหนดว่าประสิทธิภาพของ PhysElite คาดการณ์ประสิทธิภาพในการตั้งค่าอื่นๆ เหล่านั้นอย่างไร

เมื่อนำมารวมกัน คำอธิบายที่มีอยู่สนับสนุนการตีความผลลัพธ์ที่จำกัด ตัวเลข 33.7% เป็นของการประเมินความแม่นยำของคำตอบที่รายงานของแบบจำลองภาษาหลายรูปแบบที่ทดสอบแล้ว 18 แบบในเกณฑ์มาตรฐานนี้ ควรอ่านควบคู่ไปกับปัญหาสองภาษา แผนภาพภาพ การสืบค้น และคำตอบสุดท้ายของชุดข้อมูล รวมถึงการประเมินกระบวนการระดับขั้นตอนที่แยกต่างหาก เนื่องจากแหล่งที่มาที่ให้มาไม่รวมถึงชื่อโมเดล กฎการให้คะแนน จำนวนความพยายาม การแบ่งหัวข้อ หรือโค้ดการประเมิน ผู้อ่านจึงไม่สามารถใช้นามธรรมเพียงอย่างเดียวเพื่อสร้างการเปรียบเทียบขึ้นใหม่ หรือกำหนดว่าส่วนใดของงานเป็นตัวขับเคลื่อนผลลัพธ์ รายละเอียดที่ขาดหายไปเหล่านั้นจึงเป็นศูนย์กลางในการทำความเข้าใจรายงานที่ตามมาเกี่ยวกับ PhysElite

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIหม้อแปลงไฟฟ้าการฝึกอบรมเอไอจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?