คู่มือ AI ภาษา

การปรับแต่งการสุ่มตัวอย่างการปฏิเสธ

การปรับแต่งแบบละเอียดของการสุ่มตัวอย่างการปฏิเสธ (RFT) จะสร้างคำตอบของผู้สมัครจำนวนมาก เก็บเฉพาะคำตอบที่ให้คะแนนดีที่สุดเท่านั้น และฝึกแบบจำลองของผู้ชนะเหล่านั้นอีกครั้ง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

เจาะลึก

การปรับแต่งแบบละเอียดของการสุ่มตัวอย่างการปฏิเสธ ซึ่งบางครั้งเรียกว่าการปรับแต่งแบบละเอียดแบบ Best-of-N เป็นองค์ประกอบสำคัญในการจัดวางโมเดลอย่าง Llama 2 และ Llama 3 ของ Meta สูตรนั้นง่ายมาก: สำหรับแต่ละพรอมต์ ให้สุ่มตัวอย่างคำตอบหลายรายการ (เช่น 4 ถึง 64) จากโมเดลปัจจุบัน ให้คะแนนแต่ละรายการด้วยโมเดลรางวัลหรือเครื่องตรวจสอบอัตโนมัติ จากนั้นทิ้ง ('ปฏิเสธ') ทั้งหมด ยกเว้นเอาต์พุตที่มีอันดับสูงสุด ตัวอย่างคุณภาพสูงที่ยังหลงเหลืออยู่จะกลายเป็นชุดข้อมูลที่ได้รับการปรับแต่งอย่างละเอียดใหม่ และแบบจำลองจะได้รับการฝึกกับตัวอย่างเหล่านั้นโดยสูญเสียโทเค็นถัดไปตามปกติ การทำซ้ำลูปนี้ซ้ำๆ จะเป็นการดันแบบจำลองไปสู่การสร้างคำตอบที่ดีขึ้นด้วยตัวมันเอง เนื่องจากโมเดลเรียนรู้จากเอาต์พุตที่ถูกกรองของตัวเอง RFT จึงหลีกเลี่ยงความไม่เสถียรและการปรับแก้อาการปวดหัวของ RL แบบไล่ระดับนโยบาย ในขณะที่ยังคงใช้ประโยชน์จากสัญญาณรางวัล

ข้อมูลเชิงลึกทางเทคนิค

RFT ใช้ประโยชน์จากความจริงที่ว่าการสุ่มตัวอย่างหลายครั้งและการรักษาการตอบสนองที่ให้รางวัลสูงสุดนั้นใกล้เคียงกับการเลือกจากการกระจายที่คมชัดและมีคุณภาพสูงกว่า การฝึกอบรมผู้ชนะเหล่านั้นผ่านเอนโทรปีข้ามมาตรฐานจะกลั่นกรองพฤติกรรมที่ดีที่สุดของ N กลับไปสู่ผลลัพธ์ตัวอย่างเดียวของแบบจำลองได้อย่างมีประสิทธิภาพ สำหรับโดเมนที่ตรวจสอบได้ เช่น คณิตศาสตร์หรือโค้ด 'รางวัล' อาจเป็นเพียงแค่ว่าคำตอบสุดท้ายหรือการทดสอบหน่วยผ่านไป โดยไม่จำเป็นต้องมีโมเดลรางวัลที่เรียนรู้เลย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการปรับแต่งการสุ่มตัวอย่างแบบคัดแยก

RFT เป็นศูนย์กลางของการฝึกหลังการฝึกอบรมสมัยใหม่ ซึ่งมักใช้ก่อนหรือควบคู่ไปกับวิธี RL เช่น PPO และ DPO ความน่าดึงดูดเพิ่มขึ้นด้วยการอนุมานราคาถูกและเครื่องตรวจสอบอัตโนมัติที่แข็งแกร่ง: เมื่อแบบจำลองสร้างและการตรวจสอบตัวเองได้ดีขึ้น การสุ่มตัวอย่างการปฏิเสธแบบวนซ้ำจะสนับสนุนข้อมูลสังเคราะห์และลูปการปรับปรุงตนเอง คาดหวังการบูรณาการที่เข้มงวดยิ่งขึ้นกับโมเดลการให้เหตุผลที่สร้างห่วงโซ่ความคิดที่ตรวจสอบได้ และการศึกษาอย่างต่อเนื่องเกี่ยวกับวิธีการหลีกเลี่ยงการแฮ็กรางวัลและความหลากหลายล่มสลายเมื่อฝึกฝนซ้ำแล้วซ้ำอีกเกี่ยวกับผลลัพธ์ของโมเดลเอง

การใช้งานจริงในโลกแห่งความเป็นจริง

การจัดแนวโมเดลสไตล์ลามะด้วยการสุ่มตัวอย่างหลายคำตอบต่อข้อความ โดยรักษาคะแนนโมเดลรางวัลสูงสุด จากนั้นจึงเลือก SFT ในคำตอบเหล่านั้น

ปรับปรุงตัวแก้โจทย์คณิตโดยสร้างวิธีแก้ปัญหามากมายและรักษาเฉพาะคำตอบที่ถูกต้องและตรวจสอบได้เท่านั้น

การสร้างโค้ดที่ผู้สมัครจะถูกเก็บไว้เฉพาะในกรณีที่ผ่านการทดสอบหน่วย จากนั้นจึงใช้เป็นข้อมูลการฝึกอบรม

การสร้างชุดข้อมูลคำสั่งสังเคราะห์โดยการกรองการตอบสนองที่ดีที่สุดของโมเดลเองสำหรับรอบการฝึกอบรมถัดไป

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

QLoRA และการปรับแต่งแบบละเอียด 4 บิต

คำถามที่พบบ่อย

What is Rejection Sampling Fine-Tuning?

การปรับแต่งแบบละเอียดของการสุ่มตัวอย่างการปฏิเสธ (RFT) จะสร้างคำตอบของผู้สมัครจำนวนมาก เก็บเฉพาะคำตอบที่ให้คะแนนดีที่สุดเท่านั้น และฝึกแบบจำลองของผู้ชนะเหล่านั้นอีกครั้ง เป็นเรื่องสำคัญเนื่องจากให้ประโยชน์มากมายกับ RLHF โดยใช้การเรียนรู้แบบมีผู้สอนที่ตรงไปตรงมา แทนการเรียนรู้แบบเสริมที่ซับซ้อน

แนวคิดหลักของการปรับแต่งแบบละเอียดของการสุ่มตัวอย่างการปฏิเสธคืออะไร

RFT เก็บตัวอย่างคำตอบหลายรายการ กรองคำตอบที่ได้คะแนนสูงสุด และปรับแต่งแบบจำลองของผู้ชนะเหล่านั้น

ในโดเมนที่ตรวจสอบได้ เช่น คณิตศาสตร์หรือโค้ด อะไรจะทำหน้าที่เป็นรางวัลได้

สำหรับงานที่ตรวจสอบได้ RFT สามารถใช้ความถูกต้องแม่นยำหรือผ่านการทดสอบหน่วย โดยหลีกเลี่ยงโมเดลรางวัลที่เรียนรู้

ตระกูลโมเดลใดที่มีชื่อเสียงในการใช้การสุ่มตัวอย่างการปฏิเสธระหว่างการจัดตำแหน่ง

Meta อธิบายโดยใช้การสุ่มตัวอย่างแบบปฏิเสธซึ่งเป็นส่วนหนึ่งของสูตรหลังการฝึกสำหรับรุ่น Llama 2 และ Llama 3

เหตุใดทีมจึงชอบ RFT มากกว่า RL แบบไล่ระดับนโยบายเช่น PPO

RFT ฝึกใหม่ด้วยการสูญเสียโทเค็นถัดไปแบบมาตรฐานบนตัวอย่างที่ถูกกรอง หลีกเลี่ยงความยากในการปรับแต่งและความไม่เสถียรของวิธีการไล่ระดับนโยบาย

การฝึกอบรมเกี่ยวกับตัวอย่างที่ให้ผลตอบแทนสูงสุดอย่างมีประสิทธิภาพช่วยอะไร?

ด้วยการเรียนรู้จากคำตอบที่ได้รับการกรองขั้นสูง โมเดลจะรวบรวมพฤติกรรมคุณภาพสูงขึ้นภายในเจเนอเรชั่นเดียว