กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

การมอบหมายหน่วยกิตที่คำนึงถึงสถาปัตยกรรมช่วยปรับปรุงการเรียนรู้เสริมสำหรับโมเดลภาษา

การพิมพ์ล่วงหน้าของ arXiv จะแนะนำ CompPO ซึ่งเป็นวิธีการเสริมการเรียนรู้ที่ใช้รูปแบบความสนใจของโมเดลภาษาเพื่อมอบหมายเครดิตการฝึกอบรมให้กับโทเค็น ผู้เขียนรายงานความแม่นยำที่ค้างอยู่สูงกว่าและความเสถียรมากกว่า GRPO ที่ปรับแล้วในการทดลองกับ Qwen3-4B และ Llama-3.1-8B-Instruct

6 min readRead the primary source
Source-page capture accompanying Architecture-aware credit assignment improves reinforcement learning for language models
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.21501
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
โมเดลภาษาขนาดใหญ่ (LLM)
โมเดลภาษาที่ได้รับการฝึกเกี่ยวกับคลังข้อความขนาดใหญ่เพื่อสร้างและวิเคราะห์ข้อความ
หน่วยความจำ (หน่วยความจำตัวแทน)
บริบทที่จัดเก็บไว้ซึ่งตัวแทน AI ใช้ในขั้นตอนหรือเซสชันเพื่อปรับปรุงความต่อเนื่อง
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

นักวิจัยได้แนะนำการขนส่งเครดิตที่มีเงื่อนไขด้วยการคำนวณ ซึ่งเป็นวิธีมอบหมายเครดิตการเรียนรู้แบบเสริมกำลังให้กับโทเค็นแต่ละรายการตามการคำนวณที่ดำเนินการโดยแบบจำลองภาษาระหว่างการตอบสนอง การนำไปปฏิบัติ CompPO ใช้การมุ่งความสนใจเพื่อสร้างประตูการเก็บรักษาต่อโทเค็น และรวมเข้ากับนักวิจารณ์ที่นำสถานะที่ซ่อนอยู่ของนักแสดงและข้อมูลการกำหนดเส้นทางกลับมาใช้ใหม่

การพิมพ์ล่วงหน้าที่ส่งไปยัง arXiv เมื่อวันที่ 21 สิงหาคม เสนอวิธีใหม่ในการกำหนดหน่วยกิตระหว่างการเรียนรู้เสริมสำหรับโมเดลภาษาขนาดใหญ่ เอกสารนี้แบ่งการกำหนดเครดิตออกเป็นสามส่วน ได้แก่ หลักฐานว่าการเปิดตัวประสบความสำเร็จหรือไม่ ผู้ดำเนินการขนส่งที่แปลงหลักฐานดังกล่าวเป็นข้อได้เปรียบระดับโทเค็น และเรขาคณิตการอัปเดตที่เปลี่ยนข้อดีเหล่านั้นให้เป็นการเปลี่ยนแปลงนโยบาย ผู้เขียนยืนยันว่างานล่าสุดได้ปรับปรุงส่วนที่หนึ่งและสาม ในขณะที่กฎการขนส่งที่ใช้กันทั่วไปส่วนใหญ่ยังคงไม่ขึ้นอยู่กับสถาปัตยกรรมแบบจำลอง

กรอบการทำงานที่นำเสนอ เรียกว่าการขนส่งเครดิตที่มีเงื่อนไขด้วยการคำนวณ ใช้สถิติที่แยกออกจากการคำนวณภายในของนโยบายพฤติกรรม เพื่อกำหนดพารามิเตอร์ว่าค่าดาวน์สตรีมจะถูกส่งผ่านการเปิดตัวอย่างไร CompPO อัลกอริธึมที่เป็นรูปธรรมจะแปลงความเข้มข้นของความสนใจดั้งเดิมเป็นประตูกักเก็บแบบมีขอบเขตสำหรับแต่ละโทเค็น เกตนั้นใช้ทั้งสำหรับการบูตสแตรปในขั้นตอนเดียวและสำหรับการติดตามข้อดีทั่วไปที่ขึ้นกับพาธที่เรียกว่า Comp-GAE ผู้เขียนระบุว่าเกตคงที่ลดวิธีการประมาณค่าความได้เปรียบทั่วไปแบบสัมประสิทธิ์คงที่ โดยให้ลิงก์ไปยังข้อมูลพื้นฐานมาตรฐาน

CompPO ยังรวมถึงนักวิจารณ์ที่สอดคล้องกับการขนส่งหรือ TAC แทนที่จะเพิ่ม Transformer ตัวที่สองที่มีขนาดเท่ากัน TAC จะนำสถานะที่ซ่อนไว้และข้อมูลเส้นทางของนักแสดงกลับมาใช้ใหม่ บทความนี้ระบุว่ารางวัลของงานและวัตถุประสงค์ของนโยบาย PPO ที่ถูกตัดไว้ยังคงไม่เปลี่ยนแปลง การเปลี่ยนแปลงที่อ้างสิทธิ์คือวิธีการขนส่งเครดิต และวิธีที่นักวิจารณ์สอดคล้องกับการขนส่งนั้น ในการทดลองโดยใช้เมล็ด Qwen3-4B จำนวน 5 เมล็ด ผู้เขียนรายงานความแม่นยำในการค้างครั้งสุดท้าย 61.4% โดยมีช่วงความเชื่อมั่น 95% ที่ 60.8% ถึง 62.0% เทียบกับ 53.8% โดยมีช่วง 52.9% ถึง 54.7% สำหรับ GRPO ที่ปรับแล้ว

ผลการระเหยของกระดาษถือว่าผลลัพธ์มาจากการรวมกันของส่วนประกอบต่างๆ Comp-GAE จับคู่กับนักวิจารณ์มาตรฐานถึง 55.2% ในขณะที่ TAC จับคู่กับประตูคงที่ถึง 56.4%; ไม่ตรงกับระบบทั้งหมด ผู้เขียนรายงานผลปฏิสัมพันธ์ที่ 2.4 คะแนน โดยมีช่วงความเชื่อมั่น 95% ที่ 1.9 ถึง 2.9 คะแนน มีการรายงานการควบคุมการสับเปลี่ยนและตำแหน่งเพื่อรองรับการจัดตำแหน่งเฉพาะวิถี CompPO มีความเสถียรในการรัน PPO-grid 10 จาก 12 ครั้ง เทียบกับ 3 จาก 12 ครั้งสำหรับการตั้งค่าการเปรียบเทียบ ในการประเมินแบบแช่แข็ง ผู้เขียนรายงานการปรับปรุง GRPO ของจุดมาโคร 4.3 และ 3.9 greedy pass@1 บน Qwen3-4B และ Llama-3.1-8B-Instruct ตามลำดับ

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

ผลลัพธ์ที่ได้กล่าวถึงปัญหาคอขวดในทางปฏิบัติในการเรียนรู้แบบเสริมกำลังสำหรับโมเดลภาษาขนาดใหญ่: การตัดสินใจว่าส่วนใดของการตอบสนองที่ยาวนานสมควรได้รับเครดิตหรือตำหนิสำหรับผลลัพธ์สุดท้าย ผู้เขียนรายงานการปรับปรุง GRPO ที่ปรับแต่งแล้ว แต่หลักฐานมาจากการพิมพ์ล่วงหน้าและชุดการทดลองที่จำกัด ดังนั้นวิธีทั่วไปและต้นทุนการดำเนินงานยังคงไม่แน่นอน

การเรียนรู้แบบเสริมกำลังสำหรับโมเดลภาษาต้องเชื่อมโยงรางวัลสุดท้ายเข้ากับโทเค็นส่วนบุคคลและการตัดสินใจระดับกลางจำนวนมาก การตอบสนองอาจมีขั้นตอนที่เป็นประโยชน์และไม่เป็นประโยชน์ แต่วิธีการที่เผยแพร่สถิติผลลัพธ์เดียวกันทั่วทั้งการตอบสนองทั้งหมดอาจให้แนวทางที่อ่อนแอ คำกล่าวอ้างกลางของรายงานคือการคำนวณของโมเดลเองสามารถให้สัญญาณที่เฉพาะเจาะจงมากขึ้นในการตัดสินใจว่าเครดิตควรคงอยู่มากเพียงใดจากโทเค็นหนึ่งไปยังอีกโทเค็นหนึ่ง

หากผลที่รายงานยังคงอยู่ในสภาพแวดล้อมที่กว้างขึ้น การขนส่งเครดิตที่คำนึงถึงสถาปัตยกรรมอาจทำให้การอัปเดตการเรียนรู้แบบเสริมกำลังตรงเป้าหมายมากขึ้น โดยไม่ต้องให้คำจำกัดความรางวัลหรือวัตถุประสงค์นโยบายอื่น นั่นเป็นสิ่งสำคัญเนื่องจากการเปลี่ยนแปลงการกำหนดเครดิตสามารถรวมเข้ากับขั้นตอนการฝึกอบรมแบบ PPO ที่มีอยู่ได้ การเปรียบเทียบที่รายงานกับ GRPO มีความเกี่ยวข้องอย่างยิ่งกับการฝึกปฏิบัติการเรียนรู้การเสริมกำลัง LLM ในปัจจุบัน เนื่องจากกำหนดกรอบวิธีการที่เสนอเป็นการเปลี่ยนแปลงสัญญาณการฝึกอบรม แทนที่จะเป็นตระกูลโมเดลใหม่หรือผลิตภัณฑ์ที่ผู้ใช้ต้องเผชิญ

การระเหยที่รายงานนั้นมีประโยชน์เนื่องจากแนะนำว่าผลลัพธ์ไม่ได้ถูกอธิบายโดยผู้สนใจหรือผู้วิจารณ์ที่นำกลับมาใช้ใหม่เพียงอย่างเดียว วิธีการแบบสมบูรณ์ทำงานได้ดีกว่าทั้งสองแบบในผลลัพธ์ที่ให้มา และผู้เขียนกล่าวว่าการควบคุมแบบสับเปลี่ยนและตำแหน่งสนับสนุนแนวคิดที่ว่าการจัดตำแหน่งเฉพาะวิถีมีความสำคัญ การเปรียบเทียบความเสถียรยังชี้ให้เห็นถึงประโยชน์ในทางปฏิบัติที่เป็นไปได้: การวิ่งที่ไม่เสถียรน้อยลงสามารถลดความพยายามในการฝึกที่สูญเปล่า แม้ว่าแหล่งที่มาจะไม่ได้ให้การคำนวณหรือการวัดต้นทุนก็ตาม

หลักฐานควรยังคงอ่านเป็นผลการวิจัยเบื้องต้น แหล่งที่มาคือการพิมพ์ล่วงหน้าของ arXiv ไม่ใช่สิ่งพิมพ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ และบทคัดย่อไม่ได้อธิบายงานพื้นฐาน ขนาดชุดข้อมูล รายละเอียดการใช้งานพื้นฐาน งบประมาณการฝึกอบรม หรือขั้นตอนทางสถิติที่อยู่นอกเหนือช่วงความเชื่อมั่นที่รายงาน นอกจากนี้ยังไม่ได้กำหนดว่าการได้รับนั้นมาพร้อมกับหน่วยความจำเพิ่มเติม เวลาแฝง ความซับซ้อนทางวิศวกรรม หรือความไวต่อรูปแบบความสนใจ ดังนั้นผลกระทบต่อสาธารณะของวิธีการจึงขึ้นอยู่กับว่านักวิจัยอิสระสามารถสร้างผลลัพธ์ซ้ำได้หรือไม่ และแนวทางดังกล่าวจะถ่ายโอนไปยังแบบจำลองที่ใหญ่กว่าและวัตถุประสงค์การเรียนรู้เสริมกำลังที่แตกต่างกันหรือไม่

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

การทดสอบถัดไปที่สำคัญคือการจำลองแบบอิสระ โมเดลที่กว้างขึ้นและความครอบคลุมของงาน และการเปรียบเทียบซึ่งรวมถึงต้นทุนการฝึกอบรม การใช้หน่วยความจำ และรันไทม์ แหล่งที่มาไม่ได้ระบุว่า CompPO ทำงานได้อย่างน่าเชื่อถือเกินกว่าการประเมิน Qwen3-4B และ Llama-3.1-8B-Instruct ที่รายงานหรือไม่ หรือสัญญาณตามความสนใจยังคงมีประโยชน์ในสถาปัตยกรรมโมเดลต่างๆ หรือไม่

สิ่งสำคัญอันดับแรกคือการจำลองแบบนอกเหนือจากเมล็ด Qwen3-4B ห้าเมล็ดและการประเมินแช่แข็งที่รายงาน กลุ่มอิสระควรทดสอบวิธีการกับขนาดโมเดล งานฝึกอบรม โครงสร้างรางวัล และสถาปัตยกรรมโมเดลภาษาเพิ่มเติม แหล่งที่มาชื่อ Qwen3-4B และ Llama-3.1-8B-Instruct แต่ไม่ได้บอกว่าวิธีการนี้ได้รับการประเมินในรุ่นต่างๆ ที่กว้างขึ้นหรือไม่ หรือสัญญาณความสนใจทำงานคล้ายกันในสถาปัตยกรรมที่มีการกำหนดเส้นทางหรือการออกแบบความสนใจที่แตกต่างกันหรือไม่

นักวิจัยควรวัดข้อดีข้อเสียของการฝึกอบรมทั้งหมดด้วย รายงานระบุว่า TAC นำสถานะที่ซ่อนอยู่ของนักแสดงและข้อมูลการกำหนดเส้นทางกลับมาใช้ใหม่โดยไม่มี Transformer ขนาดเดียวกันตัวที่สอง แต่แหล่งที่มาไม่ได้ระบุปริมาณการใช้หน่วยความจำ เวลาฝึกฝนนาฬิกาแขวน ความต้องการฮาร์ดแวร์ หรือการคำนวณทั้งหมด การวัดเหล่านี้จะกำหนดว่าความแม่นยำและความเสถียรที่รายงานเพิ่มขึ้นนั้นนำไปใช้ได้จริงสำหรับองค์กรที่ใช้ไปป์ไลน์การเรียนรู้การเสริมกำลังที่มีราคาแพงอยู่แล้วหรือไม่

การทำงานเพิ่มเติมควรตรวจสอบว่า Retention Gate ที่ได้รับจากความสนใจมีความแข็งแกร่งเพียงใด การควบคุมการสับเปลี่ยนและตำแหน่งที่รายงานสนับสนุนการจัดตำแหน่งวิถีเฉพาะภายในการทดลอง แต่แหล่งที่มาไม่ได้แสดงให้เห็นว่าประตูตอบสนองต่อบริบทที่ยาวอย่างไร ร่องรอยการให้เหตุผลที่ผิดปกติ รางวัลที่กระจัดกระจายหรือมีเสียงดัง หรือการเปลี่ยนแปลงในการกระตุ้นเตือนและการสุ่มตัวอย่าง ยังไม่ทราบว่าความเข้มข้นของความสนใจเป็นพร็อกซีที่เชื่อถือได้สำหรับความสำคัญในการคำนวณหรือเป็นเพียงสัญญาณที่มีประโยชน์สำหรับโมเดลและงานที่ทดสอบโดยเฉพาะ

สุดท้ายนี้ สถานะของวิธีการในฐานะการพิมพ์ล่วงหน้ามีความสำคัญ แหล่งที่มาไม่รายงานการตรวจสอบโดยหน่วยงานอิสระ การใช้งานจริง ความพร้อมใช้งานของโค้ด หรือผลลัพธ์จากการตรวจสอบโดยผู้ทรงคุณวุฒิ การละเว้นเหล่านั้นไม่ได้ทำให้การค้นพบนี้เป็นโมฆะ แต่จะทิ้งคำถามสำคัญไว้โดยไม่มีคำตอบเกี่ยวกับการทำซ้ำและลักษณะทั่วไป กรณีที่แข็งแกร่งกว่านี้จะต้องมีรายละเอียดการดำเนินการที่เผยแพร่ พื้นฐานต้นทุนที่ตรงกัน ผลลัพธ์ของสถาปัตยกรรมเพิ่มเติม และหลักฐานที่แสดงว่าการปรับปรุงยังคงมีอยู่นอกการตั้งค่าการประเมินของผู้เขียน

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIการฝึกอบรมเอไอหม้อแปลงไฟฟ้าอนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?