เกิดอะไรขึ้น
นักวิจัยเสนอ DirEAG ซึ่งเป็นวิธีการรวมหลักฐานของ Dirichlet สำหรับปรับเทียบความมั่นใจทางวาจาจากแบบจำลองภาษาในการแก้ปัญหาทางคณิตศาสตร์ รายงานฉบับนี้รายงานการสอบเทียบได้ดีกว่าการหาค่าเฉลี่ยโดยตรงและการรวมตัวของการศึกษาสำนึกในชุดข้อมูลสามชุดและตระกูลแบบจำลองสามตระกูล ในขณะที่ยังคงเลือกคำตอบที่แข่งขันได้
บทความที่โพสต์ไปที่ arXiv เมื่อวันที่ 21 สิงหาคม 2026 เสนอ DirEAG ซึ่งย่อมาจาก Dirichlet Evidence Aggregation ประเด็นนี้เป็นจุดอ่อนเฉพาะในแบบจำลองภาษาขนาดใหญ่ที่ใช้สำหรับการให้เหตุผลทางคณิตศาสตร์ การถามแบบจำลองว่ามีความมั่นใจเพียงใดจะไม่สร้างคะแนนความเชื่อมั่นที่สอดคล้องกับความถูกต้องโดยอัตโนมัติ ผู้เขียนอธิบายว่าความเชื่อมั่นทางวาจาแบบกล่องดำนั้นยากต่อการสอบเทียบ เนื่องจากความหมายเชิงตัวเลขของคำตอบของแบบจำลองสามารถเปลี่ยนแปลงไปตามพร้อมท์ แบบจำลอง หรือชุดข้อมูล
วิธีการนี้ใช้พร้อมท์การควบคุมความมั่นใจหลายรายการในปัญหาเดียวกัน แต่ละพรอมต์จะสร้างการสังเกตความมั่นใจในคำตอบ แทนที่จะเพียงแค่หาค่าเฉลี่ยของค่าความเชื่อมั่นเหล่านั้น DirEAG จะแปลงการสังเกตแต่ละครั้งเป็นหลักฐานอ่อนที่กระจายไปตามคำตอบของผู้สมัครที่สร้างขึ้นในระหว่างกระบวนการ นอกจากนี้ยังเพิ่มสถานะว่างซึ่งแสดงถึงความเป็นไปได้ที่ไม่มีผู้สมัครคนใดถูกต้อง การออกแบบนี้มีความสำคัญเนื่องจากถือว่ารายงานความเชื่อมั่นเป็นหลักฐานเกี่ยวกับคำตอบที่แข่งขันกัน แทนที่จะถือว่าทุกเปอร์เซ็นต์ที่รายงานอยู่ในระดับที่มีความหมายทั่วไปอยู่แล้ว
บทความนี้รายงานการทดลองเกี่ยวกับ GSM8K, SVAMP และ GSM-Hard ซึ่งเป็นชุดข้อมูลการให้เหตุผลทางคณิตศาสตร์สามชุดที่มีชื่ออยู่ในแหล่งที่มา โดยจะทดสอบโมเดลจากตระกูล Qwen, Mistral และ Gemma ตามที่ผู้เขียนกล่าวไว้ DirEAG มักจะสร้างการสอบเทียบได้ดีกว่าการหาค่าเฉลี่ยความเชื่อมั่นโดยตรงและการรวมตัวที่ควบคุมความมั่นใจตามแบบฮิวริสติก ขณะเดียวกันก็รักษาประสิทธิภาพการแข่งขันในการเลือกคำตอบไว้ แหล่งที่มาไม่ได้ระบุคะแนนการสอบเทียบ คะแนนการเลือกคำตอบ เวอร์ชันของแบบจำลอง หรือการตั้งค่าการทดลองที่แน่นอน
ผู้เขียนยังรายงานผลการระเหยด้วย โดยระบุว่าแนวทางสองส่วนนี้แก้ไขปัญหาที่แตกต่างกัน การรวมหลักฐานจะรวมข้อมูลจากการสังเกตความมั่นใจในคำตอบ ในขณะที่ขั้นตอนการสอบเทียบแบบไบนารีขั้นสุดท้ายจะจัดการส่วนอื่นของงานการสอบเทียบ เอกสารนี้มีความยาว 16 หน้า มีตัวเลข 3 หลัก กล่าวว่ามีรหัสอยู่ และได้รับการระบุว่าเป็นที่ยอมรับโดย PRICAI 2026 แหล่งที่มาระบุว่างานเป็นงานพิมพ์ก่อน และไม่ได้อธิบายการจำลองแบบอิสระหรือผลลัพธ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ นอกเหนือจากคำแถลงการยอมรับนั้น
ทำไมมันถึงสำคัญ
ข้อความความเชื่อมั่นของแบบจำลองภาษาอาจตีความได้ยาก โดยเฉพาะอย่างยิ่งเมื่อมีการเปลี่ยนแปลงระดับของความเชื่อมั่นที่รายงานด้วยตนเองของแบบจำลอง วิธีการแยกการเลือกคำตอบจากการประมาณค่าความไม่แน่นอนได้ดีขึ้นสามารถช่วยให้นักพัฒนาระบุได้ว่าคำตอบทางคณิตศาสตร์สมควรได้รับการตรวจสอบเพิ่มเติมเมื่อใด แม้ว่าแหล่งที่มาจะไม่มีหลักฐานการใช้งานนอกเหนือจากการทดลองที่รายงานก็ตาม
ประเด็นในทางปฏิบัติไม่ใช่แค่ว่าแบบจำลองภาษาสามารถสร้างคำตอบทางคณิตศาสตร์ได้หรือไม่ อยู่ที่ว่าผู้ใช้หรือระบบดาวน์สตรีมสามารถตีความความแน่นอนที่ระบุไว้ของโมเดลเมื่อตัดสินใจว่าจะเชื่อถืออะไร หากค่าความเชื่อมั่นเปลี่ยนความหมายในข้อความแจ้ง ตัวเลขที่สูงในการตั้งค่าหนึ่งอาจเทียบไม่ได้กับตัวเลขที่สูงในอีกการตั้งค่าหนึ่ง การสนับสนุนหลักของบทความนี้คือความพยายามที่จะแก้ไขปัญหาความสามารถในการเปรียบเทียบในลักษณะที่มีโครงสร้าง
สถานะว่างของ DirEAG เป็นคุณลักษณะที่มีประโยชน์ของข้อเสนอ เนื่องจากช่วยให้วิธีการแสดงถึงความไม่แน่นอนที่ไม่ได้รับการแก้ไขโดยคำตอบของผู้สมัครที่อยู่ระหว่างการพิจารณา ระบบที่ต้องเลือกระหว่างคำตอบที่ระบุไว้อาจดูมั่นใจมากขึ้นเพียงเพราะไม่มีจุดที่ชัดเจนในการแสดงว่าผู้สมัครที่มีอยู่ทั้งหมดอาจผิด แหล่งที่มานำเสนอสิ่งนี้เป็นส่วนหนึ่งของวิธีการ ไม่ได้แสดงว่าสถานะว่างช่วยปรับปรุงความปลอดภัยหรือการตัดสินใจในระบบที่ปรับใช้หรือไม่
การแยกระหว่างการเลือกคำตอบและการสอบเทียบยังทำให้การวิจัยมีมุมการวินิจฉัยที่เป็นประโยชน์อีกด้วย แบบจำลองสามารถเลือกคำตอบที่ถูกต้องได้ค่อนข้างบ่อยในขณะที่ยังคงแสดงความมั่นใจได้ไม่ดี หรืออาจมีการปรับเทียบความมั่นใจในขณะที่เลือกคำตอบได้อย่างมีประสิทธิภาพน้อยลง รายงานการระเหยชี้ให้เห็นว่าผู้เขียนไม่ได้ถือว่าสิ่งเหล่านั้นเป็นวัตถุประสงค์เดียวกัน ความแตกต่างดังกล่าวอาจเกี่ยวข้องกับนักพัฒนาที่ประเมินระบบที่ต้องการทั้งผลลัพธ์ที่ถูกต้องและสัญญาณที่เชื่อถือได้เมื่อต้องขอรับการตรวจสอบ
หลักฐานยังคงจำกัดอยู่เพียงการทดลองของงานวิจัยเท่านั้น แหล่งที่มารายงานผลลัพธ์เกี่ยวกับเกณฑ์มาตรฐานทางคณิตศาสตร์และกลุ่มโมเดลหลายกลุ่ม แต่ไม่ได้ระบุว่า DirEAG จะปรับปรุงการประมาณค่าความเชื่อมั่นสำหรับการเขียนโค้ด การวิเคราะห์ทางวิทยาศาสตร์ คำถามทางการแพทย์ หรืองานอื่นๆ นอกจากนี้ยังไม่ได้รายงานว่าวิธีการนี้เปรียบเทียบกับวิธีการประมาณค่าความไม่แน่นอนอื่นๆ อย่างไร ไม่ว่าจะเป็นการเพิ่มต้นทุนการคำนวณหรือค่าหน่วงเวลา หรือกำไรที่ได้มากพอที่จะเปลี่ยนแปลงการตัดสินใจในการปฏิบัติงานหรือไม่ ข้อจำกัดเหล่านี้ให้ผลลัพธ์อยู่ในหมวดหมู่ของงานวิจัยที่มีแนวโน้มดี แทนที่จะแสดงให้เห็นถึงความสามารถในการผลิต
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
What is a common training objective for an autoregressive language model?
จะดูอะไรต่อไป.
คำถามสำคัญถัดไปคือ DirEAG สามารถอยู่นอกเกณฑ์มาตรฐานทางคณิตศาสตร์ที่ทดสอบแล้ว ความสามารถในการสอบเทียบที่ได้เพิ่มขึ้นเพียงใด และยังคงมีประโยชน์สำหรับขนาดโมเดล กลยุทธ์ที่พร้อมท์ และการใช้งานจริงหรือไม่ แหล่งที่มาไม่ได้ให้ผลลัพธ์ที่เป็นตัวเลข รายละเอียดการใช้งาน หรือหลักฐานจากระบบปฏิบัติการ
จุดตรวจสอบจุดแรกคือเชิงปริมาณ บทคัดย่อกล่าวว่า DirEAG มักจะบรรลุผลการสอบเทียบที่ดีกว่าและการเลือกคำตอบที่แข่งขันได้ แต่ไม่ได้ระบุขนาด ความสอดคล้อง หรือนัยสำคัญทางสถิติของการได้รับเหล่านั้น ผู้อ่านควรดูรายงานฉบับเต็มและโค้ดที่เผยแพร่เพื่อดูเมตริกการสอบเทียบ ช่วงความเชื่อมั่น เส้นพื้นฐาน การแยกชุดข้อมูล จุดตรวจสอบแบบจำลอง และผลลัพธ์ที่ดำเนินการซ้ำๆ ที่จำเป็นในการประเมินความแข็งแกร่งของการกล่าวอ้าง
คำถามที่สองคือลักษณะทั่วไป GSM8K, SVAMP และ GSM-Hard ล้วนเกี่ยวข้องกับการใช้เหตุผลทางคณิตศาสตร์ ดังนั้น หลักฐานที่รายงานไม่ได้แสดงให้เห็นว่าวิธีการดังกล่าวใช้ได้ผลหรือไม่เมื่อคำตอบเป็นแบบปลายเปิด หลักฐานไม่สมบูรณ์ หรือระบุความถูกต้องได้ยากกว่า การทดสอบข้ามโดเมนเพิ่มเติมจะให้ความกระจ่างว่า DirEAG รวบรวมคุณสมบัติทั่วไปของความเชื่อมั่นของแบบจำลองด้วยวาจาหรือเน้นที่โครงสร้างของการวัดประสิทธิภาพเหล่านี้เป็นหลัก
วิธีการนี้อาจขึ้นอยู่กับวิธีการสร้างคำตอบของผู้สมัครและคำแนะนำเพื่อความมั่นใจ แหล่งที่มาไม่ได้บอกว่ามีการใช้พรอมต์จำนวนเท่าใด วิธีเลือกคำตอบของผู้สมัคร วิธีกำหนดพารามิเตอร์สถานะ null หรือวิธีการฝึกอบรมการสอบเทียบไบนารีขั้นสุดท้าย รายละเอียดเหล่านั้นอาจส่งผลต่อต้นทุน ความสามารถในการทำซ้ำ และประสิทธิภาพ สิ่งสำคัญคือต้องดูว่าแนวทางยังคงมีประสิทธิภาพหรือไม่เมื่อพร้อมท์ เวอร์ชันของโมเดล หรือชุดข้อมูลเปลี่ยนแปลง
สุดท้ายนี้ การทดสอบภาคปฏิบัติที่เกี่ยวข้องคือว่าความเชื่อมั่นที่สอบเทียบแล้วช่วยปรับปรุงการตัดสินใจมากกว่าการวัดประสิทธิภาพเพียงอย่างเดียวหรือไม่ แหล่งที่มาไม่รายงานการใช้งาน การศึกษาผู้ใช้ ผลลัพธ์การตรวจสอบโดยมนุษย์ หรือการผสานรวมกับเครื่องมือทางคณิตศาสตร์ การทำงานเพิ่มเติมควรตรวจสอบว่า DirEAG ช่วยให้ผู้คนระบุคำตอบที่ไม่ถูกต้อง จัดสรรความพยายามในการตรวจสอบ หรือหลีกเลี่ยงการเชื่อถือโมเดลมากเกินไป ขณะเดียวกันก็วัดความซับซ้อนและกรณีความล้มเหลวที่เพิ่มเข้ามาด้วย