กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

เอกสาร DirEAG เสนอวิธีที่ดีกว่าในการปรับเทียบความมั่นใจของ AI ในคำตอบทางคณิตศาสตร์

เอกสาร arXiv ใหม่แนะนำ DirEAG ซึ่งเป็นวิธีการที่รวมรายงานความเชื่อมั่นจากการแจ้งเตือนหลายรายการให้เป็นหลักฐานที่ปรับเทียบแล้วเกี่ยวกับคำตอบที่เป็นไปได้ รวมถึงความเป็นไปได้ที่ไม่มีคำตอบใดถูกต้อง

5 min readRead the primary source
Primary-source image accompanying DirEAG paper proposes a better way to calibrate AI confidence in math answers
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.20717
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

ลักษณะทั่วไป
แบบจำลองทำงานได้ดีเพียงใดกับข้อมูลใหม่ที่มองไม่เห็นนอกชุดการฝึก
การสอบเทียบ
คะแนนความเชื่อมั่นของแบบจำลองตรงกับความน่าจะเป็นที่ถูกต้องตามจริงเพียงใด
เกณฑ์มาตรฐาน
การทดสอบหรือชุดข้อมูลที่เป็นมาตรฐานที่ใช้ในการวัดและเปรียบเทียบประสิทธิภาพของโมเดล
ทดสอบตัวเองChatGPT และแบบทดสอบ LLM

เกิดอะไรขึ้น

นักวิจัยเสนอ DirEAG ซึ่งเป็นวิธีการรวมหลักฐานของ Dirichlet สำหรับปรับเทียบความมั่นใจทางวาจาจากแบบจำลองภาษาในการแก้ปัญหาทางคณิตศาสตร์ รายงานฉบับนี้รายงานการสอบเทียบได้ดีกว่าการหาค่าเฉลี่ยโดยตรงและการรวมตัวของการศึกษาสำนึกในชุดข้อมูลสามชุดและตระกูลแบบจำลองสามตระกูล ในขณะที่ยังคงเลือกคำตอบที่แข่งขันได้

บทความที่โพสต์ไปที่ arXiv เมื่อวันที่ 21 สิงหาคม 2026 เสนอ DirEAG ซึ่งย่อมาจาก Dirichlet Evidence Aggregation ประเด็นนี้เป็นจุดอ่อนเฉพาะในแบบจำลองภาษาขนาดใหญ่ที่ใช้สำหรับการให้เหตุผลทางคณิตศาสตร์ การถามแบบจำลองว่ามีความมั่นใจเพียงใดจะไม่สร้างคะแนนความเชื่อมั่นที่สอดคล้องกับความถูกต้องโดยอัตโนมัติ ผู้เขียนอธิบายว่าความเชื่อมั่นทางวาจาแบบกล่องดำนั้นยากต่อการสอบเทียบ เนื่องจากความหมายเชิงตัวเลขของคำตอบของแบบจำลองสามารถเปลี่ยนแปลงไปตามพร้อมท์ แบบจำลอง หรือชุดข้อมูล

วิธีการนี้ใช้พร้อมท์การควบคุมความมั่นใจหลายรายการในปัญหาเดียวกัน แต่ละพรอมต์จะสร้างการสังเกตความมั่นใจในคำตอบ แทนที่จะเพียงแค่หาค่าเฉลี่ยของค่าความเชื่อมั่นเหล่านั้น DirEAG จะแปลงการสังเกตแต่ละครั้งเป็นหลักฐานอ่อนที่กระจายไปตามคำตอบของผู้สมัครที่สร้างขึ้นในระหว่างกระบวนการ นอกจากนี้ยังเพิ่มสถานะว่างซึ่งแสดงถึงความเป็นไปได้ที่ไม่มีผู้สมัครคนใดถูกต้อง การออกแบบนี้มีความสำคัญเนื่องจากถือว่ารายงานความเชื่อมั่นเป็นหลักฐานเกี่ยวกับคำตอบที่แข่งขันกัน แทนที่จะถือว่าทุกเปอร์เซ็นต์ที่รายงานอยู่ในระดับที่มีความหมายทั่วไปอยู่แล้ว

บทความนี้รายงานการทดลองเกี่ยวกับ GSM8K, SVAMP และ GSM-Hard ซึ่งเป็นชุดข้อมูลการให้เหตุผลทางคณิตศาสตร์สามชุดที่มีชื่ออยู่ในแหล่งที่มา โดยจะทดสอบโมเดลจากตระกูล Qwen, Mistral และ Gemma ตามที่ผู้เขียนกล่าวไว้ DirEAG มักจะสร้างการสอบเทียบได้ดีกว่าการหาค่าเฉลี่ยความเชื่อมั่นโดยตรงและการรวมตัวที่ควบคุมความมั่นใจตามแบบฮิวริสติก ขณะเดียวกันก็รักษาประสิทธิภาพการแข่งขันในการเลือกคำตอบไว้ แหล่งที่มาไม่ได้ระบุคะแนนการสอบเทียบ คะแนนการเลือกคำตอบ เวอร์ชันของแบบจำลอง หรือการตั้งค่าการทดลองที่แน่นอน

ผู้เขียนยังรายงานผลการระเหยด้วย โดยระบุว่าแนวทางสองส่วนนี้แก้ไขปัญหาที่แตกต่างกัน การรวมหลักฐานจะรวมข้อมูลจากการสังเกตความมั่นใจในคำตอบ ในขณะที่ขั้นตอนการสอบเทียบแบบไบนารีขั้นสุดท้ายจะจัดการส่วนอื่นของงานการสอบเทียบ เอกสารนี้มีความยาว 16 หน้า มีตัวเลข 3 หลัก กล่าวว่ามีรหัสอยู่ และได้รับการระบุว่าเป็นที่ยอมรับโดย PRICAI 2026 แหล่งที่มาระบุว่างานเป็นงานพิมพ์ก่อน และไม่ได้อธิบายการจำลองแบบอิสระหรือผลลัพธ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ นอกเหนือจากคำแถลงการยอมรับนั้น

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ข้อความความเชื่อมั่นของแบบจำลองภาษาอาจตีความได้ยาก โดยเฉพาะอย่างยิ่งเมื่อมีการเปลี่ยนแปลงระดับของความเชื่อมั่นที่รายงานด้วยตนเองของแบบจำลอง วิธีการแยกการเลือกคำตอบจากการประมาณค่าความไม่แน่นอนได้ดีขึ้นสามารถช่วยให้นักพัฒนาระบุได้ว่าคำตอบทางคณิตศาสตร์สมควรได้รับการตรวจสอบเพิ่มเติมเมื่อใด แม้ว่าแหล่งที่มาจะไม่มีหลักฐานการใช้งานนอกเหนือจากการทดลองที่รายงานก็ตาม

ประเด็นในทางปฏิบัติไม่ใช่แค่ว่าแบบจำลองภาษาสามารถสร้างคำตอบทางคณิตศาสตร์ได้หรือไม่ อยู่ที่ว่าผู้ใช้หรือระบบดาวน์สตรีมสามารถตีความความแน่นอนที่ระบุไว้ของโมเดลเมื่อตัดสินใจว่าจะเชื่อถืออะไร หากค่าความเชื่อมั่นเปลี่ยนความหมายในข้อความแจ้ง ตัวเลขที่สูงในการตั้งค่าหนึ่งอาจเทียบไม่ได้กับตัวเลขที่สูงในอีกการตั้งค่าหนึ่ง การสนับสนุนหลักของบทความนี้คือความพยายามที่จะแก้ไขปัญหาความสามารถในการเปรียบเทียบในลักษณะที่มีโครงสร้าง

สถานะว่างของ DirEAG เป็นคุณลักษณะที่มีประโยชน์ของข้อเสนอ เนื่องจากช่วยให้วิธีการแสดงถึงความไม่แน่นอนที่ไม่ได้รับการแก้ไขโดยคำตอบของผู้สมัครที่อยู่ระหว่างการพิจารณา ระบบที่ต้องเลือกระหว่างคำตอบที่ระบุไว้อาจดูมั่นใจมากขึ้นเพียงเพราะไม่มีจุดที่ชัดเจนในการแสดงว่าผู้สมัครที่มีอยู่ทั้งหมดอาจผิด แหล่งที่มานำเสนอสิ่งนี้เป็นส่วนหนึ่งของวิธีการ ไม่ได้แสดงว่าสถานะว่างช่วยปรับปรุงความปลอดภัยหรือการตัดสินใจในระบบที่ปรับใช้หรือไม่

การแยกระหว่างการเลือกคำตอบและการสอบเทียบยังทำให้การวิจัยมีมุมการวินิจฉัยที่เป็นประโยชน์อีกด้วย แบบจำลองสามารถเลือกคำตอบที่ถูกต้องได้ค่อนข้างบ่อยในขณะที่ยังคงแสดงความมั่นใจได้ไม่ดี หรืออาจมีการปรับเทียบความมั่นใจในขณะที่เลือกคำตอบได้อย่างมีประสิทธิภาพน้อยลง รายงานการระเหยชี้ให้เห็นว่าผู้เขียนไม่ได้ถือว่าสิ่งเหล่านั้นเป็นวัตถุประสงค์เดียวกัน ความแตกต่างดังกล่าวอาจเกี่ยวข้องกับนักพัฒนาที่ประเมินระบบที่ต้องการทั้งผลลัพธ์ที่ถูกต้องและสัญญาณที่เชื่อถือได้เมื่อต้องขอรับการตรวจสอบ

หลักฐานยังคงจำกัดอยู่เพียงการทดลองของงานวิจัยเท่านั้น แหล่งที่มารายงานผลลัพธ์เกี่ยวกับเกณฑ์มาตรฐานทางคณิตศาสตร์และกลุ่มโมเดลหลายกลุ่ม แต่ไม่ได้ระบุว่า DirEAG จะปรับปรุงการประมาณค่าความเชื่อมั่นสำหรับการเขียนโค้ด การวิเคราะห์ทางวิทยาศาสตร์ คำถามทางการแพทย์ หรืองานอื่นๆ นอกจากนี้ยังไม่ได้รายงานว่าวิธีการนี้เปรียบเทียบกับวิธีการประมาณค่าความไม่แน่นอนอื่นๆ อย่างไร ไม่ว่าจะเป็นการเพิ่มต้นทุนการคำนวณหรือค่าหน่วงเวลา หรือกำไรที่ได้มากพอที่จะเปลี่ยนแปลงการตัดสินใจในการปฏิบัติงานหรือไม่ ข้อจำกัดเหล่านี้ให้ผลลัพธ์อยู่ในหมวดหมู่ของงานวิจัยที่มีแนวโน้มดี แทนที่จะแสดงให้เห็นถึงความสามารถในการผลิต

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

จะดูอะไรต่อไป.

คำถามสำคัญถัดไปคือ DirEAG สามารถอยู่นอกเกณฑ์มาตรฐานทางคณิตศาสตร์ที่ทดสอบแล้ว ความสามารถในการสอบเทียบที่ได้เพิ่มขึ้นเพียงใด และยังคงมีประโยชน์สำหรับขนาดโมเดล กลยุทธ์ที่พร้อมท์ และการใช้งานจริงหรือไม่ แหล่งที่มาไม่ได้ให้ผลลัพธ์ที่เป็นตัวเลข รายละเอียดการใช้งาน หรือหลักฐานจากระบบปฏิบัติการ

จุดตรวจสอบจุดแรกคือเชิงปริมาณ บทคัดย่อกล่าวว่า DirEAG มักจะบรรลุผลการสอบเทียบที่ดีกว่าและการเลือกคำตอบที่แข่งขันได้ แต่ไม่ได้ระบุขนาด ความสอดคล้อง หรือนัยสำคัญทางสถิติของการได้รับเหล่านั้น ผู้อ่านควรดูรายงานฉบับเต็มและโค้ดที่เผยแพร่เพื่อดูเมตริกการสอบเทียบ ช่วงความเชื่อมั่น เส้นพื้นฐาน การแยกชุดข้อมูล จุดตรวจสอบแบบจำลอง และผลลัพธ์ที่ดำเนินการซ้ำๆ ที่จำเป็นในการประเมินความแข็งแกร่งของการกล่าวอ้าง

คำถามที่สองคือลักษณะทั่วไป GSM8K, SVAMP และ GSM-Hard ล้วนเกี่ยวข้องกับการใช้เหตุผลทางคณิตศาสตร์ ดังนั้น หลักฐานที่รายงานไม่ได้แสดงให้เห็นว่าวิธีการดังกล่าวใช้ได้ผลหรือไม่เมื่อคำตอบเป็นแบบปลายเปิด หลักฐานไม่สมบูรณ์ หรือระบุความถูกต้องได้ยากกว่า การทดสอบข้ามโดเมนเพิ่มเติมจะให้ความกระจ่างว่า DirEAG รวบรวมคุณสมบัติทั่วไปของความเชื่อมั่นของแบบจำลองด้วยวาจาหรือเน้นที่โครงสร้างของการวัดประสิทธิภาพเหล่านี้เป็นหลัก

วิธีการนี้อาจขึ้นอยู่กับวิธีการสร้างคำตอบของผู้สมัครและคำแนะนำเพื่อความมั่นใจ แหล่งที่มาไม่ได้บอกว่ามีการใช้พรอมต์จำนวนเท่าใด วิธีเลือกคำตอบของผู้สมัคร วิธีกำหนดพารามิเตอร์สถานะ null หรือวิธีการฝึกอบรมการสอบเทียบไบนารีขั้นสุดท้าย รายละเอียดเหล่านั้นอาจส่งผลต่อต้นทุน ความสามารถในการทำซ้ำ และประสิทธิภาพ สิ่งสำคัญคือต้องดูว่าแนวทางยังคงมีประสิทธิภาพหรือไม่เมื่อพร้อมท์ เวอร์ชันของโมเดล หรือชุดข้อมูลเปลี่ยนแปลง

สุดท้ายนี้ การทดสอบภาคปฏิบัติที่เกี่ยวข้องคือว่าความเชื่อมั่นที่สอบเทียบแล้วช่วยปรับปรุงการตัดสินใจมากกว่าการวัดประสิทธิภาพเพียงอย่างเดียวหรือไม่ แหล่งที่มาไม่รายงานการใช้งาน การศึกษาผู้ใช้ ผลลัพธ์การตรวจสอบโดยมนุษย์ หรือการผสานรวมกับเครื่องมือทางคณิตศาสตร์ การทำงานเพิ่มเติมควรตรวจสอบว่า DirEAG ช่วยให้ผู้คนระบุคำตอบที่ไม่ถูกต้อง จัดสรรความพยายามในการตรวจสอบ หรือหลีกเลี่ยงการเชื่อถือโมเดลมากเกินไป ขณะเดียวกันก็วัดความซับซ้อนและกรณีความล้มเหลวที่เพิ่มเข้ามาด้วย

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

ChatGPT และ LLMอธิบายโมเดล AIการฝึกอบรมเอไอจริยธรรม AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?