เกิดอะไรขึ้น
นักวิจัยได้แนะนำการขนส่งเครดิตที่มีเงื่อนไขด้วยการคำนวณ ซึ่งเป็นวิธีมอบหมายเครดิตการเรียนรู้แบบเสริมกำลังให้กับโทเค็นแต่ละรายการตามการคำนวณที่ดำเนินการโดยแบบจำลองภาษาระหว่างการตอบสนอง การนำไปปฏิบัติ CompPO ใช้การมุ่งความสนใจเพื่อสร้างประตูการเก็บรักษาต่อโทเค็น และรวมเข้ากับนักวิจารณ์ที่นำสถานะที่ซ่อนอยู่ของนักแสดงและข้อมูลการกำหนดเส้นทางกลับมาใช้ใหม่
การพิมพ์ล่วงหน้าที่ส่งไปยัง arXiv เมื่อวันที่ 21 สิงหาคม เสนอวิธีใหม่ในการกำหนดหน่วยกิตระหว่างการเรียนรู้เสริมสำหรับโมเดลภาษาขนาดใหญ่ เอกสารนี้แบ่งการกำหนดเครดิตออกเป็นสามส่วน ได้แก่ หลักฐานว่าการเปิดตัวประสบความสำเร็จหรือไม่ ผู้ดำเนินการขนส่งที่แปลงหลักฐานดังกล่าวเป็นข้อได้เปรียบระดับโทเค็น และเรขาคณิตการอัปเดตที่เปลี่ยนข้อดีเหล่านั้นให้เป็นการเปลี่ยนแปลงนโยบาย ผู้เขียนยืนยันว่างานล่าสุดได้ปรับปรุงส่วนที่หนึ่งและสาม ในขณะที่กฎการขนส่งที่ใช้กันทั่วไปส่วนใหญ่ยังคงไม่ขึ้นอยู่กับสถาปัตยกรรมแบบจำลอง
กรอบการทำงานที่นำเสนอ เรียกว่าการขนส่งเครดิตที่มีเงื่อนไขด้วยการคำนวณ ใช้สถิติที่แยกออกจากการคำนวณภายในของนโยบายพฤติกรรม เพื่อกำหนดพารามิเตอร์ว่าค่าดาวน์สตรีมจะถูกส่งผ่านการเปิดตัวอย่างไร CompPO อัลกอริธึมที่เป็นรูปธรรมจะแปลงความเข้มข้นของความสนใจดั้งเดิมเป็นประตูกักเก็บแบบมีขอบเขตสำหรับแต่ละโทเค็น เกตนั้นใช้ทั้งสำหรับการบูตสแตรปในขั้นตอนเดียวและสำหรับการติดตามข้อดีทั่วไปที่ขึ้นกับพาธที่เรียกว่า Comp-GAE ผู้เขียนระบุว่าเกตคงที่ลดวิธีการประมาณค่าความได้เปรียบทั่วไปแบบสัมประสิทธิ์คงที่ โดยให้ลิงก์ไปยังข้อมูลพื้นฐานมาตรฐาน
CompPO ยังรวมถึงนักวิจารณ์ที่สอดคล้องกับการขนส่งหรือ TAC แทนที่จะเพิ่ม Transformer ตัวที่สองที่มีขนาดเท่ากัน TAC จะนำสถานะที่ซ่อนไว้และข้อมูลเส้นทางของนักแสดงกลับมาใช้ใหม่ บทความนี้ระบุว่ารางวัลของงานและวัตถุประสงค์ของนโยบาย PPO ที่ถูกตัดไว้ยังคงไม่เปลี่ยนแปลง การเปลี่ยนแปลงที่อ้างสิทธิ์คือวิธีการขนส่งเครดิต และวิธีที่นักวิจารณ์สอดคล้องกับการขนส่งนั้น ในการทดลองโดยใช้เมล็ด Qwen3-4B จำนวน 5 เมล็ด ผู้เขียนรายงานความแม่นยำในการค้างครั้งสุดท้าย 61.4% โดยมีช่วงความเชื่อมั่น 95% ที่ 60.8% ถึง 62.0% เทียบกับ 53.8% โดยมีช่วง 52.9% ถึง 54.7% สำหรับ GRPO ที่ปรับแล้ว
ผลการระเหยของกระดาษถือว่าผลลัพธ์มาจากการรวมกันของส่วนประกอบต่างๆ Comp-GAE จับคู่กับนักวิจารณ์มาตรฐานถึง 55.2% ในขณะที่ TAC จับคู่กับประตูคงที่ถึง 56.4%; ไม่ตรงกับระบบทั้งหมด ผู้เขียนรายงานผลปฏิสัมพันธ์ที่ 2.4 คะแนน โดยมีช่วงความเชื่อมั่น 95% ที่ 1.9 ถึง 2.9 คะแนน มีการรายงานการควบคุมการสับเปลี่ยนและตำแหน่งเพื่อรองรับการจัดตำแหน่งเฉพาะวิถี CompPO มีความเสถียรในการรัน PPO-grid 10 จาก 12 ครั้ง เทียบกับ 3 จาก 12 ครั้งสำหรับการตั้งค่าการเปรียบเทียบ ในการประเมินแบบแช่แข็ง ผู้เขียนรายงานการปรับปรุง GRPO ของจุดมาโคร 4.3 และ 3.9 greedy pass@1 บน Qwen3-4B และ Llama-3.1-8B-Instruct ตามลำดับ
ทำไมมันถึงสำคัญ
ผลลัพธ์ที่ได้กล่าวถึงปัญหาคอขวดในทางปฏิบัติในการเรียนรู้แบบเสริมกำลังสำหรับโมเดลภาษาขนาดใหญ่: การตัดสินใจว่าส่วนใดของการตอบสนองที่ยาวนานสมควรได้รับเครดิตหรือตำหนิสำหรับผลลัพธ์สุดท้าย ผู้เขียนรายงานการปรับปรุง GRPO ที่ปรับแต่งแล้ว แต่หลักฐานมาจากการพิมพ์ล่วงหน้าและชุดการทดลองที่จำกัด ดังนั้นวิธีทั่วไปและต้นทุนการดำเนินงานยังคงไม่แน่นอน
การเรียนรู้แบบเสริมกำลังสำหรับโมเดลภาษาต้องเชื่อมโยงรางวัลสุดท้ายเข้ากับโทเค็นส่วนบุคคลและการตัดสินใจระดับกลางจำนวนมาก การตอบสนองอาจมีขั้นตอนที่เป็นประโยชน์และไม่เป็นประโยชน์ แต่วิธีการที่เผยแพร่สถิติผลลัพธ์เดียวกันทั่วทั้งการตอบสนองทั้งหมดอาจให้แนวทางที่อ่อนแอ คำกล่าวอ้างกลางของรายงานคือการคำนวณของโมเดลเองสามารถให้สัญญาณที่เฉพาะเจาะจงมากขึ้นในการตัดสินใจว่าเครดิตควรคงอยู่มากเพียงใดจากโทเค็นหนึ่งไปยังอีกโทเค็นหนึ่ง
หากผลที่รายงานยังคงอยู่ในสภาพแวดล้อมที่กว้างขึ้น การขนส่งเครดิตที่คำนึงถึงสถาปัตยกรรมอาจทำให้การอัปเดตการเรียนรู้แบบเสริมกำลังตรงเป้าหมายมากขึ้น โดยไม่ต้องให้คำจำกัดความรางวัลหรือวัตถุประสงค์นโยบายอื่น นั่นเป็นสิ่งสำคัญเนื่องจากการเปลี่ยนแปลงการกำหนดเครดิตสามารถรวมเข้ากับขั้นตอนการฝึกอบรมแบบ PPO ที่มีอยู่ได้ การเปรียบเทียบที่รายงานกับ GRPO มีความเกี่ยวข้องอย่างยิ่งกับการฝึกปฏิบัติการเรียนรู้การเสริมกำลัง LLM ในปัจจุบัน เนื่องจากกำหนดกรอบวิธีการที่เสนอเป็นการเปลี่ยนแปลงสัญญาณการฝึกอบรม แทนที่จะเป็นตระกูลโมเดลใหม่หรือผลิตภัณฑ์ที่ผู้ใช้ต้องเผชิญ
การระเหยที่รายงานนั้นมีประโยชน์เนื่องจากแนะนำว่าผลลัพธ์ไม่ได้ถูกอธิบายโดยผู้สนใจหรือผู้วิจารณ์ที่นำกลับมาใช้ใหม่เพียงอย่างเดียว วิธีการแบบสมบูรณ์ทำงานได้ดีกว่าทั้งสองแบบในผลลัพธ์ที่ให้มา และผู้เขียนกล่าวว่าการควบคุมแบบสับเปลี่ยนและตำแหน่งสนับสนุนแนวคิดที่ว่าการจัดตำแหน่งเฉพาะวิถีมีความสำคัญ การเปรียบเทียบความเสถียรยังชี้ให้เห็นถึงประโยชน์ในทางปฏิบัติที่เป็นไปได้: การวิ่งที่ไม่เสถียรน้อยลงสามารถลดความพยายามในการฝึกที่สูญเปล่า แม้ว่าแหล่งที่มาจะไม่ได้ให้การคำนวณหรือการวัดต้นทุนก็ตาม
หลักฐานควรยังคงอ่านเป็นผลการวิจัยเบื้องต้น แหล่งที่มาคือการพิมพ์ล่วงหน้าของ arXiv ไม่ใช่สิ่งพิมพ์ที่ได้รับการตรวจสอบโดยผู้ทรงคุณวุฒิ และบทคัดย่อไม่ได้อธิบายงานพื้นฐาน ขนาดชุดข้อมูล รายละเอียดการใช้งานพื้นฐาน งบประมาณการฝึกอบรม หรือขั้นตอนทางสถิติที่อยู่นอกเหนือช่วงความเชื่อมั่นที่รายงาน นอกจากนี้ยังไม่ได้กำหนดว่าการได้รับนั้นมาพร้อมกับหน่วยความจำเพิ่มเติม เวลาแฝง ความซับซ้อนทางวิศวกรรม หรือความไวต่อรูปแบบความสนใจ ดังนั้นผลกระทบต่อสาธารณะของวิธีการจึงขึ้นอยู่กับว่านักวิจัยอิสระสามารถสร้างผลลัพธ์ซ้ำได้หรือไม่ และแนวทางดังกล่าวจะถ่ายโอนไปยังแบบจำลองที่ใหญ่กว่าและวัตถุประสงค์การเรียนรู้เสริมกำลังที่แตกต่างกันหรือไม่
กลไกเชิงโต้ตอบ: มันทำงานอย่างไร
สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ
Which component of an AI application is the machine-learning model itself?
จะดูอะไรต่อไป.
การทดสอบถัดไปที่สำคัญคือการจำลองแบบอิสระ โมเดลที่กว้างขึ้นและความครอบคลุมของงาน และการเปรียบเทียบซึ่งรวมถึงต้นทุนการฝึกอบรม การใช้หน่วยความจำ และรันไทม์ แหล่งที่มาไม่ได้ระบุว่า CompPO ทำงานได้อย่างน่าเชื่อถือเกินกว่าการประเมิน Qwen3-4B และ Llama-3.1-8B-Instruct ที่รายงานหรือไม่ หรือสัญญาณตามความสนใจยังคงมีประโยชน์ในสถาปัตยกรรมโมเดลต่างๆ หรือไม่
สิ่งสำคัญอันดับแรกคือการจำลองแบบนอกเหนือจากเมล็ด Qwen3-4B ห้าเมล็ดและการประเมินแช่แข็งที่รายงาน กลุ่มอิสระควรทดสอบวิธีการกับขนาดโมเดล งานฝึกอบรม โครงสร้างรางวัล และสถาปัตยกรรมโมเดลภาษาเพิ่มเติม แหล่งที่มาชื่อ Qwen3-4B และ Llama-3.1-8B-Instruct แต่ไม่ได้บอกว่าวิธีการนี้ได้รับการประเมินในรุ่นต่างๆ ที่กว้างขึ้นหรือไม่ หรือสัญญาณความสนใจทำงานคล้ายกันในสถาปัตยกรรมที่มีการกำหนดเส้นทางหรือการออกแบบความสนใจที่แตกต่างกันหรือไม่
นักวิจัยควรวัดข้อดีข้อเสียของการฝึกอบรมทั้งหมดด้วย รายงานระบุว่า TAC นำสถานะที่ซ่อนอยู่ของนักแสดงและข้อมูลการกำหนดเส้นทางกลับมาใช้ใหม่โดยไม่มี Transformer ขนาดเดียวกันตัวที่สอง แต่แหล่งที่มาไม่ได้ระบุปริมาณการใช้หน่วยความจำ เวลาฝึกฝนนาฬิกาแขวน ความต้องการฮาร์ดแวร์ หรือการคำนวณทั้งหมด การวัดเหล่านี้จะกำหนดว่าความแม่นยำและความเสถียรที่รายงานเพิ่มขึ้นนั้นนำไปใช้ได้จริงสำหรับองค์กรที่ใช้ไปป์ไลน์การเรียนรู้การเสริมกำลังที่มีราคาแพงอยู่แล้วหรือไม่
การทำงานเพิ่มเติมควรตรวจสอบว่า Retention Gate ที่ได้รับจากความสนใจมีความแข็งแกร่งเพียงใด การควบคุมการสับเปลี่ยนและตำแหน่งที่รายงานสนับสนุนการจัดตำแหน่งวิถีเฉพาะภายในการทดลอง แต่แหล่งที่มาไม่ได้แสดงให้เห็นว่าประตูตอบสนองต่อบริบทที่ยาวอย่างไร ร่องรอยการให้เหตุผลที่ผิดปกติ รางวัลที่กระจัดกระจายหรือมีเสียงดัง หรือการเปลี่ยนแปลงในการกระตุ้นเตือนและการสุ่มตัวอย่าง ยังไม่ทราบว่าความเข้มข้นของความสนใจเป็นพร็อกซีที่เชื่อถือได้สำหรับความสำคัญในการคำนวณหรือเป็นเพียงสัญญาณที่มีประโยชน์สำหรับโมเดลและงานที่ทดสอบโดยเฉพาะ
สุดท้ายนี้ สถานะของวิธีการในฐานะการพิมพ์ล่วงหน้ามีความสำคัญ แหล่งที่มาไม่รายงานการตรวจสอบโดยหน่วยงานอิสระ การใช้งานจริง ความพร้อมใช้งานของโค้ด หรือผลลัพธ์จากการตรวจสอบโดยผู้ทรงคุณวุฒิ การละเว้นเหล่านั้นไม่ได้ทำให้การค้นพบนี้เป็นโมฆะ แต่จะทิ้งคำถามสำคัญไว้โดยไม่มีคำตอบเกี่ยวกับการทำซ้ำและลักษณะทั่วไป กรณีที่แข็งแกร่งกว่านี้จะต้องมีรายละเอียดการดำเนินการที่เผยแพร่ พื้นฐานต้นทุนที่ตรงกัน ผลลัพธ์ของสถาปัตยกรรมเพิ่มเติม และหลักฐานที่แสดงว่าการปรับปรุงยังคงมีอยู่นอกการตั้งค่าการประเมินของผู้เขียน