ข้ามไปที่เนื้อหา
เรียนรู้
ข่าว
เครื่องมือ
งาน
ภารกิจ
ค้นหา
⌘K
English
บริจาค
เมนู
เริ่มที่นี่
เริ่มเรียนรู้
เรียนรู้
ไปที่ เรียนรู้
หลักสูตร
คู่มือ
ติวเตอร์ AI
ห้องสมุดพร้อมท์
ควิซ
ใบรับรอง
อภิธาน
ข่าว
ไปที่ ข่าว
ข่าวเอไอล่าสุด
เครื่องมือติดตามหัวข้อ
การวิจัยและชุดข้อมูล
Blog
มาตรฐานบรรณาธิการ
การแก้ไขข้อมูล
เครื่องมือ
ไปที่ เครื่องมือ
ไดเรกทอรีเครื่องมือ
รายการที่ดีที่สุด
เปรียบเทียบเครื่องมือ
เครื่องคำนวณต้นทุน
ช่างกลั่นพร้อมท์
ส่งเครื่องมือ
งาน
ไปที่ งาน
เรียกดูงาน AI
ลงประกาศงาน
สปอนเซอร์ AIU
ภารกิจ
ไปที่ ภารกิจ
ภารกิจ
ผลกระทบและสถิติ
ผู้เขียน
ศูนย์ช่วยเหลือ
มีอะไรใหม่
ช่วยเหลือ
บริจาค
บ้าน
/
อภิธานศัพท์
/
การเรียนรู้การเสริมกำลังจากผลตอบรับของมนุษย์ (RLHF)
คำศัพท์อภิธานศัพท์ AI
คืออะไร
การเรียนรู้การเสริมกำลังจากผลตอบรับของมนุษย์ (RLHF)
?
คำนิยาม
วิธีการฝึกอบรมที่ใช้สัญญาณความชอบของมนุษย์เพื่อกำหนดรูปแบบพฤติกรรมของโมเดล
ข้อกำหนดที่เกี่ยวข้อง
การเรียนรู้แบบเสริมกำลัง
การฝึกอบรมโดยให้รางวัลเป็นสัญญาณว่าตัวแทนเรียนรู้การกระทำที่เพิ่มผลตอบแทนในระยะยาวสูงสุด
โมเดลรางวัล
แบบจำลองที่ให้คะแนนเอาต์พุตตามสัญญาณการตั้งค่า ซึ่งมักใช้ในไปป์ไลน์ RLHF
อ.ส.ค. (การเพิ่มประสิทธิภาพการตั้งค่าโดยตรง)
วิธีการฝึกอบรมที่ปรับแต่งโมเดลโดยตรงตามคู่ความชอบ โดยไม่ต้องใช้โมเดลรางวัลแยกต่างหาก
การเรียนรู้อย่างต่อเนื่อง
แนวทางการฝึกอบรมที่ช่วยให้โมเดลสามารถเรียนรู้จากข้อมูลใหม่โดยไม่ลืมความรู้เดิม
การเรียนรู้แบบไม่กี่ช็อต
การเรียนรู้หรือปรับพฤติกรรมจากตัวอย่างเพียงเล็กน้อย
โมเดลดริฟท์
ประสิทธิภาพลดลงเมื่อเวลาผ่านไปเนื่องจากเงื่อนไขในโลกแห่งความเป็นจริงแตกต่างจากสมมติฐานในการฝึกอบรม
เรียนรู้เพิ่มเติมในคำแนะนำฟรีของเรา
Deep Learning
Reinforcement Learning
Machine Learning Basics
Supervised Learning
ดูเพิ่มเติม
Retrieval
Red Teaming
Recommendation System
Robustness
Recall
Safety Filter
RAG (Retrieval-Augmented Generation)
Scaling Law
Previous
Reinforcement Learning
Next
Retrieval
เรียกดูอภิธานศัพท์ AI ฉบับเต็ม
สำรวจคำแนะนำ AI ฟรีทั้งหมด