การเรียนรู้การเสริมกำลังจากผลตอบรับของมนุษย์
RLHF เป็นเทคนิคที่เปลี่ยนแบบจำลองภาษาดิบให้กลายเป็นผู้ช่วยที่เป็นประโยชน์และสุภาพโดยการฝึกอบรมตามความชอบของมนุษย์
ภาพรวม
It matters because it aligns model behavior with what people actually want, not just what is statistically likely.
เจาะลึก
แบบจำลองภาษาที่ได้รับการฝึกล่วงหน้าจะคาดเดาข้อความที่น่าเชื่อถือ แต่สิ่งที่เป็นไปได้นั้นไม่เหมือนกับว่ามีประโยชน์ ซื่อสัตย์ หรือปลอดภัย RLHF จะแก้ไขปัญหานี้เป็นระยะ ขั้นแรก การปรับแต่งแบบละเอียดภายใต้การดูแลจะสอนโมเดลให้ปฏิบัติตามคำแนะนำโดยใช้คำตอบตัวอย่างที่เขียนโดยมนุษย์ ถัดไป มนุษย์จะเปรียบเทียบคู่ของการตอบสนองของแบบจำลองกับข้อความแจ้งเดียวกัน และเลือกอันที่ดีกว่า การเปรียบเทียบเหล่านี้ฝึกรูปแบบการให้รางวัลแยกต่างหากซึ่งจะให้คะแนนการตอบสนองใดๆ สุดท้ายนี้ โมเดลภาษาได้รับการปรับให้เหมาะสมด้วยการเรียนรู้แบบเสริมกำลังเพื่อสร้างการตอบกลับที่มีอัตราโมเดลการให้รางวัลในระดับสูง บทลงโทษจะป้องกันไม่ให้ลอยไปไกลจากโมเดลดั้งเดิมมากเกินไป ดังนั้นมันจึงยังคงความคล่องและไม่ใช้ประโยชน์จากลักษณะเฉพาะของโมเดลการให้รางวัล RLHF เป็นศูนย์กลางในการทำให้ผู้ช่วยสไตล์ ChatGPT ใช้งานได้
ข้อมูลเชิงลึกทางเทคนิค
รูปแบบการให้รางวัลมักจะได้รับการฝึกฝนเกี่ยวกับคู่ความชอบที่มีการสูญเสียสไตล์ของแบรดลีย์-เทอร์รี่ โดยเรียนรู้ที่จะให้คะแนนสเกลาร์ที่สูงกว่าให้กับคำตอบที่มนุษย์ต้องการ จากนั้นนโยบายจะได้รับการอัปเดตด้วย PPO (Proximal Policy Optimization) ซึ่งจะให้รางวัลสูงสุด ในขณะที่การลงโทษ KL-divergence เทียบกับโมเดลอ้างอิงจะป้องกันการเพิ่มประสิทธิภาพมากเกินไปและ 'การแฮ็กรางวัล' เนื่องจาก PPO ยุ่งยาก วิธีการใหม่ๆ เช่น DPO (Direct Preference Optimization) จึงข้ามรูปแบบรางวัลที่ชัดเจนและลูปการเสริมแรง โดยปรับนโยบายให้เหมาะสมโดยตรงจากคู่การตั้งค่า
ผลกระทบเชิงกลยุทธ์
ต้นทุนและงบประมาณ
การตัดสินใจด้านสถาปัตยกรรมขับเคลื่อนประสิทธิภาพและต้นทุนการดำเนินงานเป็นเวลาหลายปี
การตัดสินใจที่ชัดเจนยิ่งขึ้น
การศึกษาด้านเทคนิคช่วยให้ทีมเลือกกลุ่มที่เหมาะสม ไม่ใช่แค่กลุ่มใหม่ล่าสุด
การควบคุมคุณภาพ
ตัวเลือกทางวิศวกรรมที่ดีกว่าจะช่วยลดเหตุการณ์ด้านความน่าเชื่อถือในการผลิต
อนาคตของการเรียนรู้การเสริมกำลังจากผลตอบรับของมนุษย์
RLHF กำลังได้รับการปรับปรุงและเป็นอัตโนมัติบางส่วน DPO และวิธีการกำหนดลักษณะโดยตรงที่เกี่ยวข้องกำลังเข้ามาแทนที่ไปป์ไลน์ PPO จำนวนมากสำหรับหลายๆ ทีม และ RLAIF ใช้คำติชมที่สร้างโดย AI (เช่นเดียวกับใน Constitutional AI) เพื่อลดต้นทุนการติดฉลาก การวิจัยกำลังจัดการกับการแฮ็กรางวัล อคติของผู้อธิบาย และความยากลำบากในการตัดสินคำตอบที่ยาวนานหรือโดยผู้เชี่ยวชาญ ด้วยเทคนิคต่างๆ เช่น การควบคุมดูแลกระบวนการและการอภิปราย คาดหวังถึงความสอดคล้องที่จะผสมผสานข้อเสนอแนะของมนุษย์และ AI สัญญาณรางวัลที่สมบูรณ์ยิ่งขึ้นนอกเหนือจากการยกนิ้วโป้งเพียงครั้งเดียว และการตรวจสอบอย่างละเอียดมากขึ้นว่าใครเป็นผู้ให้การตั้งค่าและคุณค่าที่พวกเขาเข้ารหัส
การใช้งานจริงในโลกแห่งความเป็นจริง
ปรับแต่งผู้ช่วยแชทให้ปฏิเสธคำขอที่เป็นอันตรายและให้คำตอบที่เป็นประโยชน์และมีโครงสร้างที่ดี แทนที่จะเป็นเพียงข้อความที่น่าเชื่อถือ
จัดอันดับคู่บทสรุปตามความต้องการของมนุษย์เพื่อฝึกโมเดลที่เขียนสรุปที่ผู้คนพบว่ามีประโยชน์จริง ๆ
การลดผลลัพธ์ที่เป็นพิษหรืออคติโดยการให้รางวัลแก่การตอบสนองที่ผู้ประเมินที่เป็นมนุษย์ตัดสินด้วยความเคารพและปลอดภัย
การใช้ DPO บนชุดข้อมูลของคำตอบที่ต้องการเทียบกับคำตอบที่ถูกปฏิเสธเพื่อจัดตำแหน่งโมเดลโอเพ่นซอร์สโดยไม่ต้องรัน PPO แบบเต็ม
ความเสี่ยงและรั้ว
การเพิ่มประสิทธิภาพเกณฑ์มาตรฐานหนึ่งรายการสามารถซ่อนจุดอ่อนของระบบในวงกว้างได้
ต้นทุนโครงสร้างพื้นฐานและการบำรุงรักษามักถูกประเมินต่ำไป
ช่องว่างด้านความปลอดภัยและความสามารถในการสังเกตสามารถเพิ่มขึ้นได้เมื่อระบบมีความซับซ้อนมากขึ้น
แผนงานการดำเนินงาน
กำหนดเป้าหมายเวลาแฝง คุณภาพ และต้นทุนก่อนนำไปใช้งาน
เกณฑ์มาตรฐานภายใต้สภาวะโหลดและข้อมูลจริง
การตรวจสอบเครื่องมือเพื่อหาข้อผิดพลาด การเบี่ยงเบน และผลกระทบต่อผู้ใช้
เตรียมเส้นทางการย้อนกลับและการตอบสนองต่อเหตุการณ์ก่อนปรับขนาด
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การเรียนรู้แบบเสริมกำลัง
คำถามที่พบบ่อย
What is Reinforcement Learning From Human Feedback?
RLHF เป็นเทคนิคที่เปลี่ยนแบบจำลองภาษาดิบให้กลายเป็นผู้ช่วยที่เป็นประโยชน์และสุภาพโดยการฝึกอบรมตามความชอบของมนุษย์ สิ่งสำคัญเนื่องจากจะปรับพฤติกรรมของแบบจำลองให้สอดคล้องกับสิ่งที่ผู้คนต้องการจริงๆ ไม่ใช่แค่สิ่งที่มีแนวโน้มทางสถิติเท่านั้น
จุดประสงค์หลักของ RLHF สำหรับโมเดลภาษาคืออะไร?
RLHF กำหนดรูปแบบการตอบสนองที่มนุษย์ต้องการ ทำให้เป็นประโยชน์ ซื่อสัตย์ และปลอดภัยมากกว่าที่จะเป็นไปได้
โมเดลการให้รางวัลใน RLHF เรียนรู้ที่ต้องทำจริง ๆ อย่างไร
โมเดลการให้รางวัลได้รับการฝึกอบรมเกี่ยวกับการเปรียบเทียบความชอบของมนุษย์เพื่อให้คะแนนการตอบกลับ โดยให้สัญญาณที่นโยบายปรับให้เหมาะสม
เหตุใดจึงมีการลงโทษ KL-divergence กับรุ่นดั้งเดิมที่ใช้ในระหว่างขั้นตอน RL
บทลงโทษของ KL ช่วยให้นโยบายที่ได้รับการปรับปรุงให้ใกล้เคียงกับโมเดลอ้างอิง ป้องกันการแฮ็กรางวัลและการสูญเสียความคล่อง
โดยทั่วไปแล้วข้อมูลการตั้งค่าสำหรับโมเดลรางวัลจะถูกรวบรวมอย่างไร
ผู้อธิบายประกอบจะเลือกคำตอบที่ต้องการในการเปรียบเทียบแบบคู่ ซึ่งจะฝึกรูปแบบการให้รางวัลผ่านการแพ้แบบแบรดลีย์-เทอร์รี่
DPO (Direct Preference Optimization) มีข้อได้เปรียบเหนือไปป์ไลน์ RLHF แบบคลาสสิกอย่างไร
อ.ส.ค. ได้รับวัตถุประสงค์โดยตรงจากความชอบ โดยหลีกเลี่ยงรูปแบบการให้รางวัลที่แยกจากกันและขั้นตอนการเรียนรู้การเสริมกำลังที่ยุ่งยาก