เกิดอะไรขึ้น
เอกสาร arXiv จะประเมินว่าการเพิ่มการวางแผน การตรวจสอบการปิดฉลาก และการซ่อมแซมเวิร์กโฟลว์โมเดลภาษาช่วยปรับปรุงการให้เหตุผลทางการเงินเพียงพอที่จะพิสูจน์ให้เห็นถึงต้นทุนโทเค็นเพิ่มเติมหรือไม่ การใช้ GPT-5.4 mini บน FinQA และ TAT-QA นักวิจัยได้เปรียบเทียบระบบเสาหินแบบการโทรครั้งเดียวกับสถาปัตยกรรมการค้นหาที่ได้รับการตรวจสอบแล้วในงบประมาณ 14 งบประมาณ ตั้งแต่ 250 ถึง 42,000 โทเค็นเทียบเท่าเอาต์พุต แหล่งข่าวรายงานว่าระบบที่มีโครงสร้างตามหลังอยู่ที่ 1,000 โทเค็น แต่เหนือกว่าเสาหินตั้งแต่ 1,500 โทเค็นเป็นต้นไป โดยมีความแม่นยำประมาณ 44% ที่ระดับสูงสุด เทียบกับประมาณ 40%
บทความเรื่อง "Thinking Costs Tokens: When More Structure is Worth the Price" ถูกส่งไปยัง arXiv เมื่อวันที่ 27 สิงหาคม 2026 คำถามหลักคือ โครงสร้างการอนุมานสร้างเกณฑ์งบประมาณหรือไม่ โดยต่ำกว่าจุดนั้น การวางแผนและการตรวจสอบใช้งบประมาณการสร้างที่มีอยู่มากเกินไป ข้างต้น ขั้นตอนเหล่านั้นจะปรับปรุงคำตอบสุดท้าย แหล่งที่มากำหนดกรอบปัญหาว่าเป็นการแข่งขันระหว่างค่าใช้จ่ายในการให้เหตุผลเพิ่มเติมกับประโยชน์ของการค้นหา การตรวจสอบ และการแก้ไขคำตอบ
นักวิจัยเปรียบเทียบสองระบบ ประการแรกคือหินใหญ่ก้อนเดียวที่ประกอบด้วยการเรียกโมเดลภาษาขนาดใหญ่เพียงตัวเดียว ประการที่สองคือสถาปัตยกรรมการค้นหาที่ได้รับการตรวจสอบแล้ว ซึ่งเพิ่มความสามารถในการวางแผน การตรวจสอบการปิดฉลาก และการซ่อมแซม ทั้งสองระบบใช้ GPT-5.4 mini และได้รับการทดสอบบน FinQA และ TAT-QA ซึ่งแหล่งที่มาอธิบายว่าเป็นงานการให้เหตุผลทางการเงิน การประเมินครอบคลุมงบประมาณโทเค็นเทียบเท่าเอาต์พุต 14 รายการ ตั้งแต่ 250 ถึง 42,000 โทเค็น
แหล่งที่มารายงานเคส 1,000 เคสและเซลล์ที่เสร็จสมบูรณ์ทั้งหมด 28,000 เซลล์ ที่ระดับงบประมาณต่ำสุดสองระดับ ทั้งสองระบบจะให้คะแนน 0% เนื่องจากทั้งสองระบบไม่สามารถตอบสนองข้อความแจ้งได้ครบถ้วน ด้วยโทเค็น 1,000 โทเค็น ระบบเสาหินมีความแม่นยำ 18% ในขณะที่คะแนนการค้นหาที่ยืนยันแล้วเกือบ 0% คุณลักษณะของกระดาษที่ส่งผลให้การวางแผนต้นทุนเหลือพื้นที่ไม่เพียงพอสำหรับคำตอบ จาก 1,500 โทเค็นเป็นต้นไป ระบบที่มีโครงสร้างจะเหนือกว่าเสาหินและรักษาความได้เปรียบที่สอดคล้องกัน ตามนามธรรม
ที่ระดับสูงสุด การค้นหาที่ได้รับการยืนยันจะมีความแม่นยำประมาณ 44% และการค้นหาแบบเสาหินประมาณ 40% ครอสโอเวอร์ที่รายงานอยู่ระหว่าง 1,000 ถึง 1,500 โทเค็นเทียบเท่าเอาต์พุต ผู้เขียนกล่าวว่าการทดสอบการแยกสหภาพที่เข้มงวดยืนยันการครอสโอเวอร์ที่จุดปลายทั้งสองด้วย p ≤ 0.001 สิ่งเหล่านี้คือผลการทดลองที่มีการรายงานของการศึกษา ไม่ใช่ผลลัพธ์ด้านประสิทธิภาพที่สร้างขึ้นโดยอิสระในแบบจำลองภาษาโดยทั่วไป
ทำไมมันถึงสำคัญ
การศึกษานี้นำเสนอบทเรียนการออกแบบที่เป็นรูปธรรมสำหรับระบบ AI ที่ใช้การคำนวณเพิ่มเติมในการให้เหตุผล โครงสร้างอาจมีประโยชน์ก็ต่อเมื่องบประมาณผลผลิตมีมากพอที่จะดูดซับค่าใช้จ่ายแล้วเท่านั้น การแลกเปลี่ยนนั้นสำคัญสำหรับนักพัฒนาในการตัดสินใจว่าเมื่อใดควรใช้เหตุผลหลายขั้นตอน การตรวจสอบ หรือการซ่อมแซม แม้ว่าหลักฐานจะจำกัดอยู่เพียงแบบจำลองเดียวและชุดข้อมูลตอบคำถามทางการเงินสองชุด
การมีส่วนร่วมในทางปฏิบัติเป็นเกณฑ์ที่สามารถวัดได้สำหรับปัญหาระบบที่คุ้นเคย เวิร์กโฟลว์ที่วางแผน ตรวจสอบ และซ่อมแซมไม่ได้ดีขึ้นโดยอัตโนมัติเพียงเพราะทำตามขั้นตอนการให้เหตุผลมากกว่า เมื่องบประมาณที่มีอยู่น้อยเกินไป ขั้นตอนเหล่านั้นอาจทำให้คำตอบหมดไป ผลลัพธ์ที่รายงานชี้ให้เห็นว่าผู้ออกแบบระบบอาจจำเป็นต้องมีนโยบายที่คำนึงถึงงบประมาณเพื่อตัดสินใจว่าเมื่อใดการอนุมานแบบมีโครงสร้างจึงคุ้มค่า
ความแตกต่างนี้มีความสำคัญสำหรับแอปพลิเคชันที่สร้างความสมดุลระหว่างความแม่นยำกับค่าหน่วงเวลาหรือต้นทุนการใช้งาน การเรียกโมเดลเดียวอาจดีกว่าสำหรับคำขอที่มีงบประมาณสั้น หากการประสานใช้พื้นที่การสร้างที่มีอยู่ส่วนใหญ่ เมื่อมีงบประมาณเพิ่มขึ้น การศึกษาจะรายงานว่าการอนุมานแบบมีโครงสร้างสามารถให้ผลลัพธ์ที่ดีขึ้นกับงานที่ทดสอบ การค้นพบนี้จึงพูดถึงการจัดสรรการคำนวณ ไม่ใช่การกล่าวอ้างทั่วไปว่าสถาปัตยกรรมแบบใดแบบหนึ่งมีความชาญฉลาดในระดับสากลมากกว่า
ผลลัพธ์ยังทำให้การประเมินมีข้อมูลมากกว่าคะแนนพาดหัวเดียว ทั้งสองระบบได้รับการรายงานว่าเปลี่ยนตำแหน่งสัมพัทธ์เมื่องบประมาณเปลี่ยนแปลง: เสาหินขนาดใหญ่นำไปสู่ 1,000 โทเค็น ในขณะที่การค้นหาที่ได้รับการยืนยันจาก 1,500 โทเค็นเป็นต้นไป ระบบที่ได้รับการประเมินด้วยงบประมาณเดียวจึงสามารถปกปิดข้อดีข้อเสียในการปฏิบัติงานที่สำคัญได้ สำหรับองค์กรที่ใช้ AI คำถามที่เกี่ยวข้องอาจเป็นประสิทธิภาพต่อหน่วยการคำนวณที่ได้รับอนุญาต มากกว่าความแม่นยำเพียงอย่างเดียว
หลักฐานยังคงแคบ แหล่งที่มาตั้งชื่อโมเดลหนึ่งรุ่น คือ GPT-5.4 mini และชุดข้อมูลการให้เหตุผลทางการเงินสองชุด ไม่ได้กำหนดว่าเกณฑ์เดียวกันนี้ใช้กับโมเดลที่ใหญ่กว่าหรือเล็กกว่า งานสนทนา การเขียนโค้ด งานทางวิทยาศาสตร์ อินพุตต่อเนื่องหลายรูปแบบ หรือเวิร์กโฟลว์ตัวแทน บทคัดย่อยังไม่ได้แจกแจงรายละเอียดทั้งหมดตามชุดข้อมูล ระดับงบประมาณ หรือส่วนประกอบ ดังนั้นผู้อ่านจึงไม่สามารถระบุได้จากแหล่งที่มาที่ให้มาว่าส่วนใดของสถาปัตยกรรมที่มีโครงสร้างที่สร้างผลกำไรที่รายงาน
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
คำถามสำคัญก็คือว่าครอสโอเวอร์ที่รายงานสามารถใช้ได้กับรุ่น งาน และการตั้งค่าต้นทุนอื่นๆ หรือไม่ การจำลองแบบควรตรวจสอบว่าเกณฑ์เปลี่ยนแปลงอย่างไรตามระยะเวลาที่แจ้ง การใช้เครื่องมือ คุณภาพการตรวจสอบ และเวลาแฝง และช่องว่างความแม่นยำที่มีงบประมาณสูงเล็กน้อยยังคงอยู่หรือไม่เมื่อมีการวัดต้นทุนทางการเงินหรือเวลาจริง แทนที่จะเป็นโทเค็นเทียบเท่ากับเอาต์พุต
การจำลองแบบควรทดสอบว่าครอสโอเวอร์ 1,000 ถึง 1,500 โทเค็นมีเสถียรภาพหรือเฉพาะเจาะจงกับรูปแบบพร้อมต์และงานที่ใช้ในที่นี้ แหล่งที่มาไม่ได้ระบุว่ามีการกระจายความยาวที่รวดเร็ว ความยาวคำตอบ หรือความยากของงานอย่างไรในแต่ละกรณี และปัจจัยเหล่านั้นอาจส่งผลต่อจำนวนงบประมาณที่เหลืออยู่หลังจากการวางแผนและตรวจสอบ เกณฑ์ที่สังเกตในการตอบคำถามทางการเงินไม่ควรถือเป็นกฎของระบบสากลหากไม่มีการทดสอบในวงกว้าง
การประเมินในอนาคตควรแยกต้นทุนของแต่ละส่วนประกอบออก การวางแผนกลุ่มนามธรรม การตรวจสอบและซ่อมแซมการปกปิดฉลากภายในระบบการค้นหาที่ได้รับการยืนยัน แต่ไม่ได้รายงานการระเหยที่แสดงว่าเกิดอะไรขึ้นเมื่อส่วนประกอบหนึ่งถูกถอดออก การทดสอบดังกล่าวจะให้ความกระจ่างว่าข้อได้เปรียบนั้นมาจากการค้นหา การตรวจสอบ การซ่อมแซม หรือการโต้ตอบ และแต่ละส่วนประกอบยังคงมีประโยชน์ในงบประมาณเท่าเดิมหรือไม่
เอกสารนี้วัดระดับโทเค็นที่เทียบเท่ากับเอาต์พุต แต่แหล่งที่มาที่ให้มาไม่ได้อธิบายว่าระดับเหล่านั้นจับคู่กับเวลาแฝงของนาฬิกาแขวน ค่าใช้จ่ายในการอนุมานจริง การเรียกใช้เครื่องมือ หรือการใช้พลังงานอย่างไร มาตรการเหล่านั้นอาจเปลี่ยนแปลงการตัดสินใจในการปรับใช้ ระบบที่มีโครงสร้างอาจปรับปรุงความแม่นยำในขณะที่กำหนดต้นทุนที่ไม่สามารถยอมรับได้สำหรับแอปพลิเคชันเฉพาะ หรืออาจเป็นสิ่งที่น่าสนใจเมื่อความถูกต้องมีความสำคัญมากกว่าความเร็วในการตอบสนอง
ความได้เปรียบด้านงบประมาณสูงที่รายงานคือประมาณสี่เปอร์เซ็นต์ จากประมาณ 40% ถึงประมาณ 44% ความแตกต่างดังกล่าวอาจมีประโยชน์ แต่ความสำคัญในทางปฏิบัติขึ้นอยู่กับการจำลองแบบ ช่วงความไม่แน่นอน และการกระจายของข้อผิดพลาด บทคัดย่อให้ผลลัพธ์ที่มีนัยสำคัญที่รายงานสำหรับครอสโอเวอร์ แต่ไม่ได้ให้รายละเอียดเพียงพอที่จะประเมินขนาดและความเสถียรของการเปรียบเทียบระดับงบประมาณทุกครั้ง
แหล่งที่มายังเปิดทิ้งไว้ว่าระบบที่ทดสอบสามารถรับรู้เมื่อจำเป็นต้องมีโครงสร้างเพิ่มเติมหรือไม่ ขั้นตอนต่อไปที่เป็นประโยชน์คือการกำหนดเส้นทางแบบปรับเปลี่ยนได้ซึ่งใช้การเรียกแบบธรรมดาสำหรับกรณีที่มีความซับซ้อนต่ำ และสำรองการค้นหาที่ได้รับการยืนยันสำหรับกรณีที่ค่าใช้จ่ายน่าจะคุ้มค่า ความเป็นไปได้นั้นเป็นนัยของการแลกเปลี่ยนงบประมาณที่อธิบายไว้ในรายงาน ไม่ใช่ความสามารถที่แสดงโดยการศึกษาครั้งนี้