กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

การศึกษาพบว่าการใช้เหตุผลเชิงโครงสร้างช่วยให้โมเดลภาษาอยู่เหนือเกณฑ์โทเค็นได้

การศึกษาของ arXiv รายงานว่าการวางแผน การตรวจสอบ และการซ่อมแซมสร้างความเสียหายให้กับโมเดลภาษาด้วยงบประมาณเอาท์พุตที่น้อยมาก แต่มีประสิทธิภาพเหนือกว่าระบบการโทรครั้งเดียวเมื่องบประมาณถึงประมาณ 1,500 โทเค็นเทียบเท่าเอาท์พุต

5 min readRead the primary source
Source-page capture accompanying Study finds structured reasoning helps language models above a token threshold
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.27506
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

โทเค็น
กลุ่มข้อความที่ประมวลผลโดยโมเดลภาษา เช่น ชิ้นส่วนคำหรือสัญลักษณ์
การอนุมาน
ระยะรันไทม์ที่โมเดลที่ได้รับการฝึกสร้างการคาดการณ์หรือเอาต์พุต
การใช้เครื่องมือ
ความสามารถของโมเดลในการเรียกเครื่องมือภายนอก เช่น การค้นหา เครื่องคิดเลข หรือ API
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

เอกสาร arXiv จะประเมินว่าการเพิ่มการวางแผน การตรวจสอบการปิดฉลาก และการซ่อมแซมเวิร์กโฟลว์โมเดลภาษาช่วยปรับปรุงการให้เหตุผลทางการเงินเพียงพอที่จะพิสูจน์ให้เห็นถึงต้นทุนโทเค็นเพิ่มเติมหรือไม่ การใช้ GPT-5.4 mini บน FinQA และ TAT-QA นักวิจัยได้เปรียบเทียบระบบเสาหินแบบการโทรครั้งเดียวกับสถาปัตยกรรมการค้นหาที่ได้รับการตรวจสอบแล้วในงบประมาณ 14 งบประมาณ ตั้งแต่ 250 ถึง 42,000 โทเค็นเทียบเท่าเอาต์พุต แหล่งข่าวรายงานว่าระบบที่มีโครงสร้างตามหลังอยู่ที่ 1,000 โทเค็น แต่เหนือกว่าเสาหินตั้งแต่ 1,500 โทเค็นเป็นต้นไป โดยมีความแม่นยำประมาณ 44% ที่ระดับสูงสุด เทียบกับประมาณ 40%

บทความเรื่อง "Thinking Costs Tokens: When More Structure is Worth the Price" ถูกส่งไปยัง arXiv เมื่อวันที่ 27 สิงหาคม 2026 คำถามหลักคือ โครงสร้างการอนุมานสร้างเกณฑ์งบประมาณหรือไม่ โดยต่ำกว่าจุดนั้น การวางแผนและการตรวจสอบใช้งบประมาณการสร้างที่มีอยู่มากเกินไป ข้างต้น ขั้นตอนเหล่านั้นจะปรับปรุงคำตอบสุดท้าย แหล่งที่มากำหนดกรอบปัญหาว่าเป็นการแข่งขันระหว่างค่าใช้จ่ายในการให้เหตุผลเพิ่มเติมกับประโยชน์ของการค้นหา การตรวจสอบ และการแก้ไขคำตอบ

นักวิจัยเปรียบเทียบสองระบบ ประการแรกคือหินใหญ่ก้อนเดียวที่ประกอบด้วยการเรียกโมเดลภาษาขนาดใหญ่เพียงตัวเดียว ประการที่สองคือสถาปัตยกรรมการค้นหาที่ได้รับการตรวจสอบแล้ว ซึ่งเพิ่มความสามารถในการวางแผน การตรวจสอบการปิดฉลาก และการซ่อมแซม ทั้งสองระบบใช้ GPT-5.4 mini และได้รับการทดสอบบน FinQA และ TAT-QA ซึ่งแหล่งที่มาอธิบายว่าเป็นงานการให้เหตุผลทางการเงิน การประเมินครอบคลุมงบประมาณโทเค็นเทียบเท่าเอาต์พุต 14 รายการ ตั้งแต่ 250 ถึง 42,000 โทเค็น

แหล่งที่มารายงานเคส 1,000 เคสและเซลล์ที่เสร็จสมบูรณ์ทั้งหมด 28,000 เซลล์ ที่ระดับงบประมาณต่ำสุดสองระดับ ทั้งสองระบบจะให้คะแนน 0% เนื่องจากทั้งสองระบบไม่สามารถตอบสนองข้อความแจ้งได้ครบถ้วน ด้วยโทเค็น 1,000 โทเค็น ระบบเสาหินมีความแม่นยำ 18% ในขณะที่คะแนนการค้นหาที่ยืนยันแล้วเกือบ 0% คุณลักษณะของกระดาษที่ส่งผลให้การวางแผนต้นทุนเหลือพื้นที่ไม่เพียงพอสำหรับคำตอบ จาก 1,500 โทเค็นเป็นต้นไป ระบบที่มีโครงสร้างจะเหนือกว่าเสาหินและรักษาความได้เปรียบที่สอดคล้องกัน ตามนามธรรม

ที่ระดับสูงสุด การค้นหาที่ได้รับการยืนยันจะมีความแม่นยำประมาณ 44% และการค้นหาแบบเสาหินประมาณ 40% ครอสโอเวอร์ที่รายงานอยู่ระหว่าง 1,000 ถึง 1,500 โทเค็นเทียบเท่าเอาต์พุต ผู้เขียนกล่าวว่าการทดสอบการแยกสหภาพที่เข้มงวดยืนยันการครอสโอเวอร์ที่จุดปลายทั้งสองด้วย p ≤ 0.001 สิ่งเหล่านี้คือผลการทดลองที่มีการรายงานของการศึกษา ไม่ใช่ผลลัพธ์ด้านประสิทธิภาพที่สร้างขึ้นโดยอิสระในแบบจำลองภาษาโดยทั่วไป

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

การศึกษานี้นำเสนอบทเรียนการออกแบบที่เป็นรูปธรรมสำหรับระบบ AI ที่ใช้การคำนวณเพิ่มเติมในการให้เหตุผล โครงสร้างอาจมีประโยชน์ก็ต่อเมื่องบประมาณผลผลิตมีมากพอที่จะดูดซับค่าใช้จ่ายแล้วเท่านั้น การแลกเปลี่ยนนั้นสำคัญสำหรับนักพัฒนาในการตัดสินใจว่าเมื่อใดควรใช้เหตุผลหลายขั้นตอน การตรวจสอบ หรือการซ่อมแซม แม้ว่าหลักฐานจะจำกัดอยู่เพียงแบบจำลองเดียวและชุดข้อมูลตอบคำถามทางการเงินสองชุด

การมีส่วนร่วมในทางปฏิบัติเป็นเกณฑ์ที่สามารถวัดได้สำหรับปัญหาระบบที่คุ้นเคย เวิร์กโฟลว์ที่วางแผน ตรวจสอบ และซ่อมแซมไม่ได้ดีขึ้นโดยอัตโนมัติเพียงเพราะทำตามขั้นตอนการให้เหตุผลมากกว่า เมื่องบประมาณที่มีอยู่น้อยเกินไป ขั้นตอนเหล่านั้นอาจทำให้คำตอบหมดไป ผลลัพธ์ที่รายงานชี้ให้เห็นว่าผู้ออกแบบระบบอาจจำเป็นต้องมีนโยบายที่คำนึงถึงงบประมาณเพื่อตัดสินใจว่าเมื่อใดการอนุมานแบบมีโครงสร้างจึงคุ้มค่า

ความแตกต่างนี้มีความสำคัญสำหรับแอปพลิเคชันที่สร้างความสมดุลระหว่างความแม่นยำกับค่าหน่วงเวลาหรือต้นทุนการใช้งาน การเรียกโมเดลเดียวอาจดีกว่าสำหรับคำขอที่มีงบประมาณสั้น หากการประสานใช้พื้นที่การสร้างที่มีอยู่ส่วนใหญ่ เมื่อมีงบประมาณเพิ่มขึ้น การศึกษาจะรายงานว่าการอนุมานแบบมีโครงสร้างสามารถให้ผลลัพธ์ที่ดีขึ้นกับงานที่ทดสอบ การค้นพบนี้จึงพูดถึงการจัดสรรการคำนวณ ไม่ใช่การกล่าวอ้างทั่วไปว่าสถาปัตยกรรมแบบใดแบบหนึ่งมีความชาญฉลาดในระดับสากลมากกว่า

ผลลัพธ์ยังทำให้การประเมินมีข้อมูลมากกว่าคะแนนพาดหัวเดียว ทั้งสองระบบได้รับการรายงานว่าเปลี่ยนตำแหน่งสัมพัทธ์เมื่องบประมาณเปลี่ยนแปลง: เสาหินขนาดใหญ่นำไปสู่ ​​1,000 โทเค็น ในขณะที่การค้นหาที่ได้รับการยืนยันจาก 1,500 โทเค็นเป็นต้นไป ระบบที่ได้รับการประเมินด้วยงบประมาณเดียวจึงสามารถปกปิดข้อดีข้อเสียในการปฏิบัติงานที่สำคัญได้ สำหรับองค์กรที่ใช้ AI คำถามที่เกี่ยวข้องอาจเป็นประสิทธิภาพต่อหน่วยการคำนวณที่ได้รับอนุญาต มากกว่าความแม่นยำเพียงอย่างเดียว

หลักฐานยังคงแคบ แหล่งที่มาตั้งชื่อโมเดลหนึ่งรุ่น คือ GPT-5.4 mini และชุดข้อมูลการให้เหตุผลทางการเงินสองชุด ไม่ได้กำหนดว่าเกณฑ์เดียวกันนี้ใช้กับโมเดลที่ใหญ่กว่าหรือเล็กกว่า งานสนทนา การเขียนโค้ด งานทางวิทยาศาสตร์ อินพุตต่อเนื่องหลายรูปแบบ หรือเวิร์กโฟลว์ตัวแทน บทคัดย่อยังไม่ได้แจกแจงรายละเอียดทั้งหมดตามชุดข้อมูล ระดับงบประมาณ หรือส่วนประกอบ ดังนั้นผู้อ่านจึงไม่สามารถระบุได้จากแหล่งที่มาที่ให้มาว่าส่วนใดของสถาปัตยกรรมที่มีโครงสร้างที่สร้างผลกำไรที่รายงาน

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามสำคัญก็คือว่าครอสโอเวอร์ที่รายงานสามารถใช้ได้กับรุ่น งาน และการตั้งค่าต้นทุนอื่นๆ หรือไม่ การจำลองแบบควรตรวจสอบว่าเกณฑ์เปลี่ยนแปลงอย่างไรตามระยะเวลาที่แจ้ง การใช้เครื่องมือ คุณภาพการตรวจสอบ และเวลาแฝง และช่องว่างความแม่นยำที่มีงบประมาณสูงเล็กน้อยยังคงอยู่หรือไม่เมื่อมีการวัดต้นทุนทางการเงินหรือเวลาจริง แทนที่จะเป็นโทเค็นเทียบเท่ากับเอาต์พุต

การจำลองแบบควรทดสอบว่าครอสโอเวอร์ 1,000 ถึง 1,500 โทเค็นมีเสถียรภาพหรือเฉพาะเจาะจงกับรูปแบบพร้อมต์และงานที่ใช้ในที่นี้ แหล่งที่มาไม่ได้ระบุว่ามีการกระจายความยาวที่รวดเร็ว ความยาวคำตอบ หรือความยากของงานอย่างไรในแต่ละกรณี และปัจจัยเหล่านั้นอาจส่งผลต่อจำนวนงบประมาณที่เหลืออยู่หลังจากการวางแผนและตรวจสอบ เกณฑ์ที่สังเกตในการตอบคำถามทางการเงินไม่ควรถือเป็นกฎของระบบสากลหากไม่มีการทดสอบในวงกว้าง

การประเมินในอนาคตควรแยกต้นทุนของแต่ละส่วนประกอบออก การวางแผนกลุ่มนามธรรม การตรวจสอบและซ่อมแซมการปกปิดฉลากภายในระบบการค้นหาที่ได้รับการยืนยัน แต่ไม่ได้รายงานการระเหยที่แสดงว่าเกิดอะไรขึ้นเมื่อส่วนประกอบหนึ่งถูกถอดออก การทดสอบดังกล่าวจะให้ความกระจ่างว่าข้อได้เปรียบนั้นมาจากการค้นหา การตรวจสอบ การซ่อมแซม หรือการโต้ตอบ และแต่ละส่วนประกอบยังคงมีประโยชน์ในงบประมาณเท่าเดิมหรือไม่

เอกสารนี้วัดระดับโทเค็นที่เทียบเท่ากับเอาต์พุต แต่แหล่งที่มาที่ให้มาไม่ได้อธิบายว่าระดับเหล่านั้นจับคู่กับเวลาแฝงของนาฬิกาแขวน ค่าใช้จ่ายในการอนุมานจริง การเรียกใช้เครื่องมือ หรือการใช้พลังงานอย่างไร มาตรการเหล่านั้นอาจเปลี่ยนแปลงการตัดสินใจในการปรับใช้ ระบบที่มีโครงสร้างอาจปรับปรุงความแม่นยำในขณะที่กำหนดต้นทุนที่ไม่สามารถยอมรับได้สำหรับแอปพลิเคชันเฉพาะ หรืออาจเป็นสิ่งที่น่าสนใจเมื่อความถูกต้องมีความสำคัญมากกว่าความเร็วในการตอบสนอง

ความได้เปรียบด้านงบประมาณสูงที่รายงานคือประมาณสี่เปอร์เซ็นต์ จากประมาณ 40% ถึงประมาณ 44% ความแตกต่างดังกล่าวอาจมีประโยชน์ แต่ความสำคัญในทางปฏิบัติขึ้นอยู่กับการจำลองแบบ ช่วงความไม่แน่นอน และการกระจายของข้อผิดพลาด บทคัดย่อให้ผลลัพธ์ที่มีนัยสำคัญที่รายงานสำหรับครอสโอเวอร์ แต่ไม่ได้ให้รายละเอียดเพียงพอที่จะประเมินขนาดและความเสถียรของการเปรียบเทียบระดับงบประมาณทุกครั้ง

แหล่งที่มายังเปิดทิ้งไว้ว่าระบบที่ทดสอบสามารถรับรู้เมื่อจำเป็นต้องมีโครงสร้างเพิ่มเติมหรือไม่ ขั้นตอนต่อไปที่เป็นประโยชน์คือการกำหนดเส้นทางแบบปรับเปลี่ยนได้ซึ่งใช้การเรียกแบบธรรมดาสำหรับกรณีที่มีความซับซ้อนต่ำ และสำรองการค้นหาที่ได้รับการยืนยันสำหรับกรณีที่ค่าใช้จ่ายน่าจะคุ้มค่า ความเป็นไปได้นั้นเป็นนัยของการแลกเปลี่ยนงบประมาณที่อธิบายไว้ในรายงาน ไม่ใช่ความสามารถที่แสดงโดยการศึกษาครั้งนี้

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIChatGPT และ LLMการฝึกอบรมเอไอPrompt Engineeringทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?