กลับไปที่ข่าว
นวัตกรรมAI Understanding บรรยายสรุป

Paper เสนอการจับคู่ความเร็วเพื่อปรับขนาดรางวัลอย่างละเอียดสำหรับแบบจำลองการแพร่กระจาย

นักวิจัยเสนอการจับคู่ความเร็วตามรางวัล ซึ่งเป็นวิธีการที่ปราศจากวิถีโคจรซึ่งจะอัปเดตฟิลด์ความเร็วของแบบจำลองการแพร่กระจายโดยตรง และรายงานว่าได้ผลลัพธ์ที่เทียบเคียงหรือดีกว่าวิธีการตามความน่าจะเป็นด้วยต้นทุนการฝึกอบรมที่ต่ำกว่า

5 min readRead the primary source
Primary-source image accompanying Paper proposes velocity matching to scale reward fine-tuning for diffusion models
เอกสารต้นทางหลักแหล่งที่มาบันทึกไว้
สำนักพิมพ์
arxiv.org
ลิงค์แหล่งที่มา
arxiv.orghttps://arxiv.org/abs/2608.23664
ประเภทแหล่งที่มา
เอกสารหลัก — ประกาศอย่างเป็นทางการ เอกสาร เอกสาร หรือหน้าแรกที่เราอ่านโดยตรง
บริบทเข้าใจสิ่งนี้ใน 60 วินาที

เริ่มที่นี่

เงื่อนไขสำคัญ

การปรับแต่งแบบละเอียด
การฝึกอบรมอย่างต่อเนื่องเกี่ยวกับข้อมูลเฉพาะโดเมนเพื่อปรับโมเดลที่ได้รับการฝึกอบรมล่วงหน้าให้เข้ากับงานเฉพาะ
การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
แบบจำลองการแพร่กระจาย
สถาปัตยกรรมเชิงกำเนิดที่เรียนรู้ที่จะย้อนกลับสัญญาณรบกวนเพื่อสังเคราะห์ภาพ เสียง หรือเนื้อหาอื่นๆ
ทดสอบตัวเองแบบทดสอบอธิบายโมเดล AI

เกิดอะไรขึ้น

ทีมนักวิจัยเจ็ดคนส่งเอกสาร arXiv ที่เสนอการจับคู่ความเร็วตามรางวัล (RVM) ซึ่งเป็นวิธีการในการปรับแต่งโมเดลการแพร่กระจายอย่างละเอียดตามความต้องการของมนุษย์หรือเป้าหมายเฉพาะงาน RVM อัปเดตฟิลด์ความเร็วของโมเดลโดยตรง แทนที่จะสร้างความเป็นไปได้ใหม่จากการลดสัญญาณรบกวนหรือประมาณความน่าจะเป็นของจุดสิ้นสุด

แหล่งที่มาคือการส่ง arXiv ลงวันที่ 24 สิงหาคม 2026 ในหัวข้อ "Scaling for Diffusion Models via Velocity Matching" ผู้เขียนนำเสนอการปรับรางวัลอย่างละเอียดเพื่อเป็นแนวทางในการปรับโมเดลการแพร่กระจายให้เข้ากับความชอบของมนุษย์และวัตถุประสงค์เฉพาะงาน ข้อเรียกร้องหลักของพวกเขาคือแนวทางที่มีอยู่ยืมกลไกการไล่ระดับนโยบายที่ออกแบบมาสำหรับแบบจำลองการถดถอยอัตโนมัติ ซึ่งสร้างความซับซ้อนเพิ่มเติมเนื่องจากแบบจำลองการแพร่กระจายไม่ได้ให้ความเป็นไปได้ที่ดึงข้อมูลได้สำหรับตัวอย่างที่สร้างขึ้น

วิธีการที่เสนอคือการจับคู่ความเร็วตามรางวัล อธิบายว่าไม่มีวิถีโคจร แทนที่จะสร้างความน่าจะเป็นจากการเปลี่ยนการสุ่ม denoising หรือการประมาณความน่าจะเป็นของจุดสิ้นสุดด้วยหลักฐานขอบเขตล่าง RVM ทำหน้าที่โดยตรงกับสนามความเร็ว ตามบทคัดย่อของรายงาน การอัปเดตจะตอกย้ำทิศทางที่เกี่ยวข้องกับรุ่นที่ได้รับรางวัลสูงและระงับทิศทางที่เกี่ยวข้องกับรุ่นที่ได้รับรางวัลต่ำ

RVM มีคำพุกเผื่อเลือกซึ่งมีไว้เพื่อควบคุมการเคลื่อนตัวจากความเร็วอ้างอิง ผู้เขียนยังกล่าวอีกว่าเฟรมเวิร์กสามารถกู้คืนวิธีการปรับแต่งล่าสุด รวมถึง RAM และ DiffusionNFT เป็นกรณีพิเศษ นั่นทำให้ข้อเสนอเป็นสูตรที่รวมเป็นหนึ่งเดียวรวมถึงกฎการอัปเดตใหม่ แม้ว่าแหล่งที่มาที่ให้มาจะไม่ได้อธิบายที่มาที่แน่ชัดหรือเงื่อนไขภายใต้ความเท่าเทียมกันเหล่านั้น

นักวิจัยรายงานการทดสอบในงานปรับแต่งรางวัลและการปรับแต่งรางวัลแบบจำลองการแพร่กระจายขนาดใหญ่ต่างๆ พวกเขากล่าวว่า RVM สามารถแข่งขันหรือทำได้ดีกว่าวิธีการไล่ระดับนโยบายตามวิถีโคจร ในขณะที่ต้องการต้นทุนการฝึกอบรมที่น้อยกว่ามาก สำหรับการสร้างวิดีโอ พวกเขารายงานว่ารางวัลตามความชอบมาตรฐานสามารถสร้างเอาต์พุตที่ดูสะอาดตาแต่เกือบจะคงที่ พวกเขาแนะนำรางวัลการติดตามแบบไดนามิกและบอกว่ามันปรับปรุงการเคลื่อนไหวในขณะเดียวกันก็ปรับปรุงประสิทธิภาพ VBench โดยรวมด้วย ไม่มีคะแนนตัวเลข ชื่อรุ่น งบประมาณการฝึกอบรม หรือตารางเปรียบเทียบรวมอยู่ในแหล่งที่มาที่ให้มา

รายละเอียดที่มา: arxiv.org ↗

ทำไมมันถึงสำคัญ

บทความนี้ระบุว่าการอัปเดตความเร็วโดยตรงสามารถลดความซับซ้อนและลดต้นทุนในการปรับแต่งรางวัลสำหรับระบบการแพร่กระจายภาพและวิดีโอขนาดใหญ่ การทดลองทางวิดีโอยังระบุถึงข้อดีข้อเสียของรางวัลการตั้งค่ามาตรฐาน: อาจชอบเอาต์พุตที่ดูสะอาดตาและมีการเคลื่อนไหวเพียงเล็กน้อย

หากการกล่าวอ้างของบทความนี้เป็นภาพรวม การเพิ่มประสิทธิภาพการแสดงความเร็วดั้งเดิมของแบบจำลองการแพร่กระจายโดยตรงอาจทำให้การปรับรางวัลแบบละเอียดง่ายขึ้น ความสำคัญเชิงปฏิบัติไม่ได้เป็นเพียงฟังก์ชันการสูญเสียใหม่เท่านั้น แต่ยังกำหนดเป้าหมายไปที่ค่าใช้จ่ายด้านการคำนวณและอัลกอริธึมที่เกี่ยวข้องกับการปรับนโยบายตามโอกาสให้เหมาะสม ค่าใช้จ่ายในการฝึกอบรมที่ลดลงอาจทำให้ทีมที่ทำงานกับเครื่องสร้างภาพและวิดีโอขนาดใหญ่สามารถเข้าถึงการตั้งค่าหรือการปรับเปลี่ยนเฉพาะงานได้มากขึ้น

บทความนี้ยังเน้นความสนใจไปที่การออกแบบของรางวัลนั่นเอง ในการทดลองทางวิดีโอของผู้แต่ง มีรายงานว่ารางวัลที่เน้นความสะอาดของการมองเห็นมักชอบผลงานที่มีการเคลื่อนไหวเพียงเล็กน้อย รางวัลการติดตามแบบไดนามิกของพวกเขาถูกนำเสนอเป็นวิธีการวัดการเคลื่อนไหวได้อย่างมีประสิทธิภาพมากขึ้น ในขณะที่ยังคงปรับปรุงผลลัพธ์ VBench โดยรวมของรายงาน นี่แสดงให้เห็นว่าการปรับปรุงระบบกำเนิดไม่เพียงขึ้นอยู่กับกฎการอัปเดตเท่านั้น แต่ยังขึ้นอยู่กับสิ่งที่กระบวนการปรับให้เหมาะสมถูกขอให้คำนึงถึงคุณค่าด้วย

คำยึดที่เป็นทางเลือกมีความสำคัญเนื่องจากการเพิ่มประสิทธิภาพการให้รางวัลสามารถย้ายแบบจำลองออกไปจากพฤติกรรมการอ้างอิงได้ แหล่งข่าวกล่าวว่าตัวควบคุมจุดยึดเบี่ยงเบนไปจากความเร็วอ้างอิง แต่ไม่ได้ระบุว่าการควบคุมนั้นส่งผลต่อคุณภาพ ความหลากหลาย ความเสถียร หรือความเสี่ยงที่จะเกินรางวัลอย่างไร รายละเอียดเหล่านี้จะเป็นตัวกำหนดว่า RVM มีประโยชน์สำหรับการปรับตัวแบบควบคุมหรือไม่ ไม่ใช่แค่สำหรับการเพิ่มประสิทธิภาพเกณฑ์มาตรฐานเท่านั้น

ผลลัพธ์ยังคงเป็นข้ออ้างการวิจัยจากรายงาน arXiv ฉบับเดียว ไม่ใช่หลักฐานว่าการฝึกอบรมแบบจำลองการแพร่กระจายมีการเปลี่ยนแปลงในวงกว้าง บทคัดย่อที่ให้มาไม่ได้ระบุแบบจำลอง ชุดข้อมูล ขนาดรางวัล การประหยัดในการคำนวณ ความแปรผันทางสถิติ หรือกรณีความล้มเหลว นอกจากนี้ยังไม่ได้กำหนดว่าวิธีการนี้จะทำงานได้ดีพอๆ กันสำหรับรูปภาพ วิดีโอ และแอปพลิเคชันการแพร่กระจายอื่นๆ หรือไม่ หรือข้อดีของมันขึ้นอยู่กับการออกแบบรางวัลเฉพาะหรือไม่

Interactive Mechanism

กลไกเชิงโต้ตอบ: มันทำงานอย่างไร

สำรวจเทคโนโลยีเบื้องหลังการพัฒนานี้แบบโต้ตอบ

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
การตรวจสอบแนวคิดแบบโต้ตอบ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

จะดูอะไรต่อไป.

คำถามหลักคือข้อได้เปรียบด้านต้นทุนและคุณภาพของรายงานของ RVM มีผลกับการทดลองที่ทำซ้ำอย่างอิสระ ฟังก์ชันการให้รางวัล ขนาดแบบจำลอง และงานการสร้างหรือไม่ และวิธีดังกล่าวสามารถหลีกเลี่ยงการปรับให้เหมาะสมเพื่อให้ได้รางวัลที่แคบหรือทำให้เข้าใจผิดได้หรือไม่ แหล่งที่มาที่ให้มาไม่ได้ให้ผลลัพธ์ที่เป็นตัวเลข รายละเอียดการใช้งาน งบประมาณในการคำนวณ หรือหลักฐานการตรวจสอบจากภายนอก

การสืบพันธุ์ควรเน้นที่การเปรียบเทียบบทความวิจัยกับวิธีการไล่ระดับนโยบายตามวิถีโคจรเป็นอันดับแรก การตรวจสอบที่เป็นประโยชน์จะรวมโมเดลและงานเดียวกันภายใต้งบประมาณการประมวลผลที่ตรงกัน เนื่องจาก “ต้นทุนการฝึกอบรมที่ลดลงอย่างมาก” จะมีความหมายเฉพาะเมื่อการบัญชีรวมการฝึกอบรมและงานประเมินผลที่เกี่ยวข้องทั้งหมดเท่านั้น แหล่งที่มาที่ให้มาไม่ได้ให้อัตราส่วนต้นทุนที่เป็นตัวเลข ดังนั้นจึงไม่ทราบขนาดของข้อได้เปรียบที่อ้างสิทธิ์

การออกแบบรางวัลสมควรได้รับการประเมินแยกจากการอัปเดตความเร็ว ผู้เขียนกล่าวว่า เมื่อการอัปเดตความเร็วง่ายขึ้น ตัวแปรการสูญเสียนั้นมีความสำคัญน้อยกว่ารางวัลและการออกแบบจุดยึด คำกล่าวอ้างดังกล่าวชี้ให้เห็นว่าการปรับปรุงอาจขึ้นอยู่กับการติดป้ายกำกับหรือให้คะแนนรุ่นที่ได้รับรางวัลสูงและต่ำ การทดสอบอิสระจึงควรเปลี่ยนแปลงฟังก์ชันการให้รางวัลและวัดว่ากำไรยังคงอยู่เกินวัตถุประสงค์ที่เลือกไว้ในรายงานหรือไม่

สำหรับการสร้างวิดีโอ ผู้สังเกตการณ์ควรตรวจสอบว่ารางวัลการติดตามแบบไดนามิกช่วยปรับปรุงการเคลื่อนไหวที่มีความหมายหรือเพียงเพิ่มการเปลี่ยนแปลงที่มองเห็นได้ แหล่งที่มารายงานการเคลื่อนไหวที่ดีขึ้นและผลลัพธ์ VBench โดยรวมที่ได้รับการปรับปรุง แต่ไม่ได้ให้ตัวชี้วัดพื้นฐานหรืออธิบายโหมดความล้มเหลว การประเมินควรตรวจสอบคุณภาพของการมองเห็น ความสอดคล้องชั่วคราว และความหลากหลายร่วมกัน รวมถึงกรณีที่การเคลื่อนไหวไม่เป็นที่พึงปรารถนาหรือขัดแย้งกับเนื้อหาที่ตั้งใจไว้

ความสำคัญที่กว้างขึ้นของบทความนี้จะขึ้นอยู่กับรายละเอียดการนำไปปฏิบัติและการตรวจสอบความถูกต้องซึ่งไม่มีอยู่ในแหล่งที่ให้มา สิ่งที่ไม่ทราบที่สำคัญ ได้แก่ การกำหนดพารามิเตอร์ความเร็วที่แน่นอน การตั้งค่าจุดยึด ความครอบคลุมของโมเดลและชุดข้อมูล ระยะเวลาการฝึกอบรม ความสามารถในการทำซ้ำของการเปรียบเทียบที่รายงาน และ RVM ยังคงมีเสถียรภาพหรือไม่เมื่อวัตถุประสงค์การให้รางวัลเปลี่ยนไป เอกสารติดตามผล โค้ดที่เผยแพร่ และการจำลองแบบอิสระจะช่วยระบุว่าข้อเสนอนี้เป็นวิธีการปรับขนาดทั่วไปหรือผลลัพธ์ที่เชื่อมโยงกับการทดลองโดยเฉพาะ

คำแนะนำและแบบทดสอบที่เกี่ยวข้อง

อธิบายโมเดล AIการฝึกอบรมเอไอหม้อแปลงไฟฟ้าอนาคตของ AIทดสอบสิ่งที่คุณรู้ — ลองแบบทดสอบ AI ฟรีค้นหาคำศัพท์ AI ในอภิธานศัพท์ของเราติดตามตัวติดตามการเปิดตัวโมเดล AI
พบว่าสิ่งนี้มีประโยชน์หรือไม่?