กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

RecurSE เสนอการประเมินตนเองแบบมีขอบเขตสำหรับผู้ตัดสิน LLM

เอกสาร arXiv ใหม่เสนอโมเดลภาษาการฝึกอบรมเพื่อประเมินการตัดสินของตนเองโดยไม่ต้องใช้ฉลากทองภายนอก ขณะเดียวกันก็ใช้การตรวจสอบความถูกต้องเพื่อระบุเมื่อควรหยุดการปรับปรุงแบบเรียกซ้ำ

7 min readRead the primary source
Primary-source image accompanying RecurSE proposes bounded self-evaluation for LLM judges
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.24231
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
ลักษณะทั่วไป
แบบจำลองทำงานได้ดีเพียงใดกับข้อมูลใหม่ที่มองไม่เห็นนอกชุดการฝึก
หลังการฝึกอบรม
ขั้นตอนการฝึกอบรมที่ใช้หลังจากการฝึกล่วงหน้า เช่น การปรับคำสั่ง การเพิ่มประสิทธิภาพการตั้งค่า และการปรับความปลอดภัย
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยได้แนะนำ RecurSE ซึ่งเป็นวิธีการปรับปรุงระบบ LLM-as-judge แบบวนซ้ำโดยไม่มีการควบคุมดูแลจากภายนอกในรางวัลการเรียนรู้แบบเสริมกำลัง วิธีการนี้ใช้ผู้พิพากษาที่สามารถฝึกได้ ตัวตรวจสอบแบบซิงโครไนซ์ และเครื่องตรวจสอบความถูกต้องเพื่อจำกัดและประเมินกระบวนการ

บทความนี้นำเสนอ RecurSE ย่อมาจาก Recursive Self-Evaling ซึ่งเป็นรูปแบบขอบเขตของการพัฒนาตนเองแบบเรียกซ้ำสำหรับระบบ LLM ในฐานะผู้ตัดสิน ระบบเหล่านี้จะประเมินข้อความปลายเปิด เช่น คำตอบของผู้สมัคร โดยเทียบกับเกณฑ์และยังช่วยชี้แนะหลังการฝึกอบรมอีกด้วย นักวิจัยตั้งกรอบปัญหาหลักคือการปรับปรุงการตัดสินโดยไม่ต้องอาศัยฉลากทองภายนอก แบบจำลองการให้รางวัล หรือการกลั่นกรองจากครูที่แข็งแกร่งกว่า วงจรการฝึกอบรมที่นำเสนอของพวกเขาแทนที่จะใช้ความสามารถในการประเมินของแบบจำลองเพื่อสร้างสัญญาณการเรียนรู้สำหรับการเพิ่มประสิทธิภาพ แหล่งที่มาอธิบายว่านี่เป็นแนวทางแบบวงปิด แต่ไม่ได้อ้างว่าแบบจำลองได้รับการปรับปรุงโดยไม่มีโครงสร้างการประเมินหรือการกำกับดูแล วิธีการนี้ประกอบด้วยรูบริก ตัวตรวจสอบ และขั้นตอนการตรวจสอบ

ระบบที่นำเสนอมีสองรอบ ใน Pass 1 ผู้ตัดสินที่สามารถฝึกอบรมได้จะประเมินคำตอบของผู้สมัครภายใต้รูบริกต่อกฎและจัดทำคำตัดสิน ใน Pass 2 ตัวตรวจสอบสำเนานโยบายที่ซิงโครไนซ์จะตรวจสอบเหตุผลของผู้พิพากษาเทียบกับเมตารูบริก และให้รางวัลกระบวนการสเกลาร์ นักวิจัยระบุโหมดความล้มเหลวที่ผู้พิพากษาสามารถคัดลอกหรือใช้ประโยชน์จากโทเค็นคำตัดสินเพื่อเพิ่มรางวัลให้สูงเกินจริง เพื่อจัดการกับความเสี่ยงนั้น RecurSE ใช้การแยกอินเทอร์เฟซ: คะแนนสเกลาร์ของผู้ตรวจสอบจะถูกแยกออกจากโทเค็นคำตัดสินของผู้พิพากษา สิ่งนี้มีจุดประสงค์เพื่อลบทางลัดการคัดลอกโทเค็นที่เสื่อมลง และทำให้รางวัลที่สร้างขึ้นเองมีความหมายมากขึ้น บทความนี้ยังแย้งว่าการเรียนรู้แบบเรียกซ้ำโดยไม่มีจุดยึดภายนอกนั้นมีขอบเขตโดยเนื้อแท้ โดยแนะนำการจับคู่ความได้เปรียบแบบคู่ (Pairwise Advantage Validity หรือ PAV) เป็นตัวตรวจสอบการตรวจสอบที่ร่วมกันติดตามความแม่นยำของผู้พิพากษาและความเที่ยงตรงของผู้ตรวจสอบ วัตถุประสงค์ที่ระบุไว้คือการระบุกรอบเวลาการหยุดก่อนเวลาที่เหมาะสม แทนที่จะปล่อยให้ดำเนินต่อไปอย่างไม่มีกำหนด

บทคัดย่อรายงานการทดลองที่เกี่ยวข้องกับ Qwen3.5-9B, Gemma-4-E4B-it และ Qwen3.6-27B โดยกล่าวว่าวิธีการนี้ให้ข้อดีแบบทั่วไปที่สม่ำเสมอจากเกณฑ์มาตรฐานทางการแพทย์ แบบคู่ การสรุป และแบบมืออาชีพ และการศึกษาการผ่าตัดด้วยการผ่าตัดพบว่าวิวัฒนาการร่วมของผู้ตัดสินและผู้ตรวจสอบแบบซิงโครไนซ์นั้นแข็งแกร่งกว่าตัวตรวจสอบแบบแช่แข็ง ผู้ตัดสินเมตาภายนอก ความสม่ำเสมอในตนเอง และการกลั่นแบบครูตามขนาด แหล่งที่มาไม่ได้ให้ขนาดตัวเลขของกำไรเหล่านั้นในข้อความที่ให้ไว้ นักวิจัยรายงานเพิ่มเติมว่าคู่ความชอบที่ดูแลโดยผู้พิพากษาช่วยปรับปรุงการจัดแนวนโยบายขั้นปลายน้ำ สิ่งนี้ขยายวิธีการนอกเหนือจากการประเมินการตอบสนอง: ผลลัพธ์ของผู้พิพากษาจะถูกนำเสนอเป็นข้อมูลการฝึกอบรมที่เป็นประโยชน์สำหรับการปรับนโยบายอื่น ข้อสรุปแบบมีเงื่อนไขของบทความนี้คือ การพัฒนาตนเองแบบเรียกซ้ำแบบมีขอบเขตสำหรับผู้ตัดสิน LLM นั้นจะทำงานได้เมื่อความถูกต้องของรางวัลที่ผลิตเองนั้นแยกจากกันและตรวจสอบอย่างชัดเจน เนื่องจากเป็นการส่ง arXiv แทนที่จะเป็นสิ่งพิมพ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ การกล่าวอ้างคือผลลัพธ์และข้อเสนอที่ผู้เขียนรายงาน ไม่ใช่การค้นพบที่จัดตั้งขึ้นโดยอิสระ

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ผู้ตัดสิน LLM มีการใช้มากขึ้นในการประเมินคำตอบปลายเปิดและชี้แนะโมเดลหลังการฝึกอบรม แต่การปรับปรุงผู้ตัดสินเหล่านั้นอาจต้องใช้คำอธิบายประกอบของมนุษย์ซึ่งมีค่าใช้จ่ายสูงหรือโมเดลครูที่แข็งแกร่งกว่า RecurSE นำเสนอเส้นทางที่มีการดูแลในระดับต่ำกว่าที่เป็นไปได้ ขณะเดียวกันก็แสดงให้เห็นว่าเหตุใดการพัฒนาตนเองจึงจำเป็นต้องมีการป้องกันผลตอบแทนแบบวงกลมหรือที่ทำให้เข้าใจผิด

ความสำคัญของงานอยู่ที่ต้นทุนและขนาดของการประเมินแบบจำลอง ผู้ตรวจสอบที่เป็นมนุษย์อาจมีราคาแพงและช้า ในขณะที่โมเดลครูที่แข็งแกร่งกว่าหรือโมเดลรางวัลที่ได้รับการฝึกอบรมแยกกันจะเพิ่มโครงสร้างพื้นฐานและการพึ่งพา หากแบบจำลองสามารถสร้างสัญญาณการเรียนรู้ที่เป็นประโยชน์สำหรับการปรับปรุงผู้ประเมิน นักพัฒนาอาจขยายขั้นตอนการประเมินผลหรือขั้นตอนหลังการฝึกอบรมโดยใช้คำอธิบายประกอบจากภายนอกน้อยลง แหล่งที่มาสนับสนุนเฉพาะการกล่าวอ้างที่แคบกว่าซึ่งผู้เขียนได้ทดสอบวิธีการและรายงานผลกำไรในการตั้งค่าที่เลือก ไม่ได้กำหนดว่าโดยทั่วไปแล้วการควบคุมดูแลภายนอกสามารถถูกกำจัดได้ หรือ RecurSE มีราคาถูกกว่าในทุกการใช้งาน เอกสารนี้ยังกล่าวถึงปัญหาความน่าเชื่อถือส่วนกลางในการประเมิน AI: ระบบอาจดูเหมือนว่าจะดีขึ้นเนื่องจากได้เรียนรู้ที่จะตอบสนองผู้ประเมินมากกว่าที่จะตัดสินได้ดีขึ้น

การแยกข้อเสนอระหว่างรางวัลสเกลาร์ของผู้ตรวจสอบและโทเค็นคำตัดสินของผู้พิพากษาได้รับการออกแบบมาเพื่อลดทางลัดเฉพาะหนึ่งรายการ เครื่องตรวจวัด PAV มีจุดมุ่งหมายเพื่อระบุเมื่อการฝึกแบบเรียกซ้ำยังคงปรับปรุงการประเมินที่ถูกต้อง แทนที่จะเคลื่อนไปสู่การเสริมกำลังตนเอง สิ่งนี้ทำให้งานไม่เพียงเกี่ยวข้องกับประสิทธิภาพเท่านั้น แต่ยังรวมถึงความน่าเชื่อถือของการประเมินอัตโนมัติที่ใช้ในการพัฒนาแบบจำลองด้วย ความครอบคลุมเกณฑ์มาตรฐานที่รายงานครอบคลุมงานทางการแพทย์ งานคู่ งานสรุป และงานวิชาชีพ แทนที่จะเป็นการทดสอบแคบๆ เพียงครั้งเดียว การประเมินแบบจัดขึ้นตามที่อธิบายไว้ในบทคัดย่อ มีจุดมุ่งหมายเพื่อระบุว่าวิธีการดังกล่าวมีลักษณะทั่วไปนอกเหนือจากตัวอย่างที่ใช้ในระหว่างการฝึกอบรมหรือไม่ อย่างไรก็ตาม แหล่งที่มาไม่ได้ให้รายละเอียดที่นี่เกี่ยวกับการสร้างชุดข้อมูลเหล่านั้น เกณฑ์การประเมิน ค่าพื้นฐาน ขนาดของชุดทดสอบ หรือขนาดและความแปรปรวนของการปรับปรุง หากไม่มีรายละเอียดเหล่านั้น ผู้อ่านจะไม่สามารถระบุได้ว่าผลกำไรที่รายงานนั้นมีขนาดใหญ่ แข็งแกร่ง หรือมีนัยสำคัญในทางปฏิบัติเพียงใด

การอ้างการจัดตำแหน่งดาวน์สตรีมอาจมีความสำคัญหากคู่การตั้งค่าที่ตัดสินโดยผู้ตัดสินจะลดแรงงานที่เกี่ยวข้องในการสร้างข้อมูลการฝึกอบรม แต่ผู้พิพากษาที่ปรับปรุงการจับคู่รูบริกของตนเองจะไม่ใช่ผู้พิพากษาที่ยึดตามความชอบของมนุษย์ มาตรฐานโดเมน หรือข้อกำหนดด้านความปลอดภัยโดยอัตโนมัติ แหล่งที่มากล่าวว่าการตั้งค่าจับคู่การจัดแนวนโยบายดาวน์สตรีมที่ปรับปรุงแล้ว แต่ไม่ได้ระบุว่าการตั้งค่าของใครกำหนดการจัดตำแหน่ง วิธีวัดการจัดตำแหน่ง หรือผู้ตรวจสอบที่เป็นมนุษย์ยืนยันการเปลี่ยนแปลงผลลัพธ์หรือไม่ ความแตกต่างดังกล่าวเป็นสิ่งสำคัญสำหรับทุกคนที่พิจารณาวิธีการในการใช้งานที่มีความละเอียดอ่อนหรือมีผลกระทบสูง พูดกว้างๆ ก็คือ RecurSE นำเสนอตัวอย่างที่เป็นรูปธรรมของข้อจำกัดของการพัฒนาตนเอง การออกแบบถือว่ารางวัลที่ผลิตเองสามารถนำไปใช้ประโยชน์ได้ผ่านการแยกและติดตามโครงสร้าง ไม่ได้ขจัดความจำเป็นในการกำหนดรูบริก เมตารูบริก หรือเป้าหมายการตรวจสอบความถูกต้อง ดังนั้นการมีส่วนร่วมจึงเป็นที่เข้าใจดีที่สุดว่าเป็นกรอบการฝึกอบรมและการควบคุมที่นำเสนอสำหรับผู้ประเมิน LLM ระดับใดระดับหนึ่ง คุณค่าสาธารณะจะขึ้นอยู่กับว่างานในภายหลังยืนยันว่าการป้องกันยังคงมีผลหรือไม่ เมื่อแบบจำลอง งาน รูบริก หรือสิ่งจูงใจเปลี่ยนแปลงไป

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

รายงานแหล่งที่มามีโมเดลและประเภทการวัดประสิทธิภาพหลายแบบ แต่ไม่มีขนาดผลกระทบ ขนาดชุดข้อมูล นัยสำคัญทางสถิติ หรือรายละเอียดการจำลองแบบอิสระในบทคัดย่อ การตรวจสอบเพิ่มเติมควรทดสอบว่าวิธีการยังคงเชื่อถือได้อยู่นอกการตั้งค่าที่รายงานหรือไม่ และตัวติดตามการหยุดสามารถตรวจจับการพัฒนาตนเองที่ทำให้เข้าใจผิดได้หรือไม่

คำถามแรกคือการปรับปรุงที่รายงานจะรอดจากการจำลองแบบอิสระหรือไม่ แหล่งที่มาที่ให้มาจะระบุกลุ่มโมเดลหรือเวอร์ชันสามกลุ่ม และหมวดหมู่เกณฑ์มาตรฐานหลายประเภท แต่ไม่ได้ระบุจำนวนงาน การสุ่มตัวอย่าง การฝึกซ้อม หรือการทดสอบทางสถิติ การประเมินในอนาคตควรรายงานรายละเอียดเหล่านั้นและเปรียบเทียบ RecurSE กับเส้นฐานเดียวกันภายใต้เงื่อนไขการประมวลผล ข้อมูล และการฝึกอบรมที่ตรงกัน นั่นจะชี้แจงว่ากำไรมาจากการออกแบบแบบเรียกซ้ำ การเพิ่มประสิทธิภาพเพิ่มเติม ตัวเลือกเฉพาะของเกณฑ์มาตรฐาน หรือความแตกต่างอื่นๆ ในการตั้งค่าการทดลอง

ประเด็นที่สองคือ PAV สามารถระบุจุดที่การพัฒนาตนเองควรหยุดได้อย่างน่าเชื่อถือหรือไม่ บทคัดย่ออธิบายว่า PAV เป็นผู้ตรวจสอบการตรวจสอบความถูกต้องที่เป็นกลาง โดยร่วมกันติดตามความถูกต้องของผู้พิพากษาและความเที่ยงตรงของผู้ตรวจสอบ แต่ไม่ได้อธิบายโครงสร้างของจอภาพหรือแสดงหลักฐานการสอบเทียบ นักวิจัยและผู้ใช้ควรตรวจสอบกรณีที่ผู้พิพากษาและผู้ตรวจสอบเห็นด้วยด้วยเหตุผลที่ไม่ถูกต้อง โดยที่ทั้งคู่สืบทอดจุดบอดเดียวกัน หรือในกรณีที่ประสิทธิภาพดีขึ้นในรูบริกในขณะที่คุณภาพที่เกี่ยวข้องกับมนุษย์ลดลง การทดสอบดังกล่าวจะตรวจสอบว่ากฎการหยุดที่เสนอตรวจพบความก้าวหน้าที่แท้จริงมากกว่าความสอดคล้องภายในหรือไม่

การพึ่งพารูบริกและเมตารูบริกของเมธอดก็สมควรได้รับความสนใจเช่นกัน แหล่งข่าวกล่าวว่าผู้พิพากษาประเมินคำตอบภายใต้รูบริกต่อกฎ และผู้ตรวจสอบจะตรวจสอบการให้เหตุผลกับเมตารูบริก แต่ไม่ได้อธิบายว่ารูบริกเหล่านี้ถูกเขียน อัปเดต หรือป้องกันจากความคลุมเครืออย่างไร กฎที่ระบุไม่ดีอาจทำให้ลูปแบบเรียกซ้ำมีเป้าหมายที่มั่นคงแต่ไม่เป็นที่ต้องการ งานในอนาคตควรทดสอบเกณฑ์ที่ขัดแย้งกัน คำแนะนำที่ไม่สมบูรณ์ การตอบสนองต่อฝ่ายตรงข้าม และโดเมนที่ความถูกต้องยากจะลดเหลือเป็นรูบริกที่เป็นลายลักษณ์อักษร รวมถึงการตั้งค่าทางการแพทย์และวิชาชีพที่รายงาน

การใช้คู่การตั้งค่าที่ตัดสินโดยผู้ตัดสินเป็นอีกพื้นที่หนึ่งสำหรับการตรวจสอบ แหล่งที่มารายงานการปรับปรุงการจัดแนวนโยบาย แต่การใช้งานที่มีความหมายจะต้องมีหลักฐานเกี่ยวกับคุณภาพที่ต้องการ ไม่เห็นด้วยกับผู้ประเมินที่เป็นมนุษย์ และความล้มเหลวที่เกิดจากกระบวนการดูแลจัดการ ยังไม่ทราบว่าวิธีการดังกล่าวถ่ายโอนไปยังขนาดโมเดล ภาษา โดเมน และวัตถุประสงค์ในการประเมินหรือไม่ หรือความเที่ยงตรงของผู้ตรวจสอบลดลงหรือไม่เมื่อผู้พิพากษาพบกับงานที่ไม่คุ้นเคย สิ่งที่ไม่ทราบเหล่านี้จำกัดขอบเขตของการสรุปข้อสรุปของบทคัดย่อ

สุดท้ายนี้ เอกสารนี้เป็นฉบับพิมพ์ล่วงหน้าของ arXiv ที่ส่งเมื่อวันที่ 25 สิงหาคม 2026 และแหล่งข้อมูลที่ให้มามีเพียงหน้าบทคัดย่อและบรรณานุกรมเท่านั้น บทความฉบับเต็มอาจมีรายละเอียดการทดลองที่ขาดหายไป แต่ไม่สามารถสรุปได้ที่นี่ ผู้อ่านควรมองหาวิธีการที่สมบูรณ์ รหัสหรือข้อมูลที่เผยแพร่ ผลการผ่าตัด การวิเคราะห์ข้อผิดพลาด และการศึกษาติดตามผลที่เป็นอิสระ ก่อนหน้านั้น RecurSE เป็นหลักฐานของทิศทางการวิจัยที่เฉพาะเจาะจงและรายงานของผู้เขียนเกี่ยวกับผลลัพธ์ที่น่าหวัง ไม่ใช่ข้อพิสูจน์ว่าผู้ตัดสิน LLM สามารถปรับปรุงตนเองโดยทั่วไปได้อย่างปลอดภัยหรือเชื่อถือได้

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIการฝึกอบรมเอไอจริยธรรม AIหม้อแปลงไฟฟ้าทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?