Pembelajaran Pengukuhan Daripada Maklum Balas Manusia
RLHF ialah teknik yang menjadikan model bahasa mentah menjadi pembantu yang membantu dan sopan dengan melatihnya mengikut keutamaan manusia.
Gambaran keseluruhan
Ia penting kerana ia menyelaraskan tingkah laku model dengan apa yang orang benar-benar mahukan, bukan hanya apa yang secara statistik mungkin.
Menyelam dalam
Model bahasa pralatihan meramalkan teks yang munasabah, tetapi munasabah tidak sama dengan membantu, jujur atau selamat. RLHF membetulkannya secara berperingkat. Pertama, penalaan halus yang diselia mengajar model untuk mengikut arahan menggunakan jawapan contoh tulisan manusia. Seterusnya, manusia membandingkan pasangan respons model dengan gesaan yang sama dan memilih yang lebih baik; perbandingan ini melatih model ganjaran berasingan yang menjaringkan sebarang respons. Akhir sekali, model bahasa dioptimumkan dengan pembelajaran pengukuhan untuk menghasilkan respons dengan kadar model ganjaran yang tinggi. Penalti menghalangnya daripada hanyut terlalu jauh daripada model asal supaya ia kekal fasih dan tidak mengeksploitasi ciri-ciri model ganjaran. RLHF adalah penting untuk menjadikan pembantu gaya ChatGPT boleh digunakan.
Wawasan Teknikal
Model ganjaran biasanya dilatih pada pasangan keutamaan dengan kehilangan gaya Bradley-Terry, belajar untuk memberikan jawapan pilihan manusia skor skalar yang lebih tinggi. Polisi itu kemudiannya dikemas kini dengan PPO (Pengoptimuman Dasar Proksimal), yang memaksimumkan ganjaran manakala penalti KL-divergence terhadap model rujukan menghalang pengoptimuman berlebihan dan 'penggodaman ganjaran'. Oleh kerana PPO bersifat fiddly, kaedah yang lebih baharu seperti DPO (Pengoptimuman Keutamaan Langsung) melangkau model ganjaran eksplisit dan gelung pengukuhan, mengoptimumkan dasar terus daripada pasangan keutamaan.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan Peneguhan Belajar Daripada Maklum Balas Manusia
RLHF sedang diperkemas dan sebahagiannya diautomatikkan. DPO dan kaedah keutamaan langsung yang berkaitan menggantikan saluran paip PPO yang berat untuk banyak pasukan, dan RLAIF menggunakan maklum balas yang dijana AI (seperti dalam AI Perlembagaan) untuk mengurangkan kos pelabelan. Penyelidikan sedang menangani penggodaman ganjaran, berat sebelah annotator, dan kesukaran menilai jawapan yang panjang atau pakar, dengan teknik seperti penyeliaan proses dan perbahasan. Jangkakan penjajaran untuk menggabungkan maklum balas manusia dan AI, isyarat ganjaran yang lebih kaya melangkaui satu ibu jari, dan penelitian yang semakin meningkat tentang siapa yang memberikan keutamaan dan nilai yang dikodkan.
Pelaksanaan Dunia Sebenar
Menala pembantu sembang supaya ia menolak permintaan yang berbahaya dan memberikan jawapan yang berguna dan tersusun dan bukannya teks yang munasabah.
Kedudukan pasangan ringkasan mengikut keutamaan manusia untuk melatih model yang menulis ringkasan orang sebenarnya mendapati berguna.
Mengurangkan keluaran toksik atau berat sebelah dengan memberi ganjaran kepada respons yang dinilai oleh penilai manusia sebagai hormat dan selamat.
Menggunakan DPO pada set data jawapan pilihan berbanding jawapan yang ditolak untuk menjajarkan model sumber terbuka tanpa menjalankan gelung PPO penuh.
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reinforcement Learning From Human Feedback quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pembelajaran Pengukuhan
Soalan lazim
Apakah Pembelajaran Pengukuhan Daripada Maklum Balas Manusia?
RLHF ialah teknik yang menjadikan model bahasa mentah menjadi pembantu yang membantu dan sopan dengan melatihnya mengikut keutamaan manusia. Ia penting kerana ia menjajarkan tingkah laku model dengan perkara yang sebenarnya dikehendaki oleh orang ramai, bukan hanya perkara yang berkemungkinan secara statistik.
Apakah tujuan utama RLHF untuk model bahasa?
RLHF mengemudi model ke arah tindak balas yang disukai manusia, menjadikannya lebih membantu, jujur dan selamat daripada sekadar munasabah.
Apakah model ganjaran dalam RLHF sebenarnya belajar lakukan?
Model ganjaran dilatih mengenai perbandingan keutamaan manusia untuk menjaringkan respons, memberikan isyarat yang dioptimumkan oleh dasar.
Mengapakah penalti KL-divergence terhadap model asal digunakan semasa langkah RL?
Penalti KL memastikan dasar yang dioptimumkan dekat dengan model rujukan, melindungi daripada penggodaman ganjaran dan kehilangan kefasihan.
Bagaimanakah data keutamaan biasanya dikumpulkan untuk model ganjaran?
Anotasi memilih respons pilihan dalam perbandingan berpasangan, yang melatih model ganjaran melalui kerugian gaya Bradley-Terry.
Apakah kelebihan yang ditawarkan oleh DPO (Pengoptimuman Keutamaan Langsung) berbanding saluran paip RLHF klasik?
DPO memperoleh objektif secara langsung daripada keutamaan, mengelakkan model ganjaran yang berasingan dan langkah pembelajaran pengukuhan secara fiddly.