คำศัพท์อภิธานศัพท์ AI

คืออะไร การเรียนรู้การเสริมกำลังจากผลตอบรับของมนุษย์ (RLHF)?

คำนิยาม

วิธีการฝึกอบรมที่ใช้สัญญาณความชอบของมนุษย์เพื่อกำหนดรูปแบบพฤติกรรมของโมเดล

ข้อกำหนดที่เกี่ยวข้อง

การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
โมเดลรางวัล
แบบจำลองที่ให้คะแนนเอาต์พุตตามสัญญาณการตั้งค่า ซึ่งมักใช้ในไปป์ไลน์ RLHF
อ.ส.ค. (การเพิ่มประสิทธิภาพการตั้งค่าโดยตรง)
วิธีการฝึกอบรมที่ปรับแต่งโมเดลโดยตรงตามคู่ความชอบ โดยไม่ต้องใช้โมเดลรางวัลแยกต่างหาก
การเรียนรู้อย่างต่อเนื่อง
แนวทางการฝึกอบรมที่ช่วยให้โมเดลสามารถเรียนรู้จากข้อมูลใหม่โดยไม่ลืมความรู้เดิม
การเรียนรู้แบบไม่กี่ช็อต
การเรียนรู้หรือปรับพฤติกรรมจากตัวอย่างเพียงเล็กน้อย
โมเดลดริฟท์
ประสิทธิภาพลดลงเมื่อเวลาผ่านไปเนื่องจากเงื่อนไขในโลกแห่งความเป็นจริงแตกต่างจากสมมติฐานในการฝึกอบรม

เรียนรู้เพิ่มเติมในคำแนะนำฟรีของเรา

ดูเพิ่มเติม