Pemodelan Hadiah
Model penghargaan adalah jaringan saraf yang dilatih untuk memprediksi seberapa baik respons AI, dan bertindak sebagai pengganti otomatis untuk penilaian manusia.
Ikhtisar
It is the scoring engine that makes reinforcement learning from human feedback possible at scale.
Menyelam Lebih Dalam
Pemodelan penghargaan memecahkan masalah praktis: manusia tidak dapat menilai setiap satu dari jutaan keluaran yang dihasilkan model selama pelatihan. Sebaliknya, pemberi label membandingkan sejumlah kecil tanggapan, biasanya memilih mana dari dua jawaban yang lebih baik untuk pertanyaan yang sama. Model penghargaan kemudian dilatih berdasarkan perbandingan ini untuk menghasilkan skor skalar tunggal untuk setiap pasangan respons cepat. Tujuan pelatihan standarnya adalah model Bradley-Terry, yang mengubah preferensi berpasangan menjadi probabilitas bahwa satu respons lebih unggul dari respons lainnya. Setelah dilatih, model penghargaan ini dapat mengevaluasi keluaran baru tanpa batas dengan biaya murah, memberikan sinyal yang digunakan algoritme seperti PPO untuk meningkatkan model bahasa. Model penghargaan juga digunakan kembali pada waktu inferensi untuk pengambilan sampel best-of-N, di mana banyak kandidat dihasilkan dan kandidat dengan skor tertinggi dikembalikan.
Wawasan Teknis
Model penghargaan biasanya merupakan model bahasa dasar dengan kepala prediksi tokennya digantikan oleh lapisan linier tunggal yang memancarkan satu skalar. Pelatihan memaksimalkan kemungkinan log bahwa respons yang dipilih mendapat skor lebih tinggi daripada respons yang ditolak: loss = -log(sigmoid(r_chosen - r_rejected)). Yang penting hanyalah perbedaan relatif, jadi skala absolutnya bisa berubah-ubah. Kualitas bergantung pada konsistensi label dan cakupan gaya respons yang luas.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Pemodelan Penghargaan
Penelitian sedang mengatasi kelemahan terbesar model imbalan: model tersebut dapat 'diretas' (model mengeksploitasi kebiasaan seperti memilih jangka waktu), dan tidak dapat lagi didistribusikan seiring dengan perbaikan kebijakan. Arahan yang menjanjikan mencakup model imbalan proses yang memberi skor pada setiap langkah penalaran, ansambel dan perkiraan ketidakpastian untuk melawan peretasan, label preferensi yang dihasilkan AI (RLAIF), dan model imbalan generatif yang menghasilkan kritik dan alasan, bukan sekadar angka.
Implementasi Dunia Nyata
Mendukung RLHF untuk asisten seperti ChatGPT dan Claude dengan menilai respons kandidat selama pelatihan PPO
Pengambilan sampel Best-of-N, di mana suatu model menghasilkan banyak jawaban dan model penghargaan memilih yang terbaik bagi pengguna
'Penguji' matematika dan pengkodean atau model penghargaan proses yang menilai langkah-langkah penalaran menengah untuk meningkatkan pemecahan masalah
Memberi peringkat dan memfilter data pelatihan sintetis, hanya mempertahankan generasi dengan skor tinggi untuk penyesuaian lebih lanjut
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Reward Modeling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pemodelan Hadiah Bradley-Terry
Pertanyaan yang sering diajukan
What is Reward Modeling?
Model penghargaan adalah jaringan saraf yang dilatih untuk memprediksi seberapa baik respons AI, dan bertindak sebagai pengganti otomatis untuk penilaian manusia. Ini adalah mesin penilaian yang memungkinkan pembelajaran penguatan dari umpan balik manusia dalam skala besar.
Apa keluaran utama dari model penghargaan untuk pasangan respons cepat tertentu?
Model penghargaan memetakan permintaan dan respons terhadap satu angka skalar yang mewakili prediksi kualitas atau preferensi manusia.
Jenis data manusia apa yang paling umum digunakan untuk melatih model penghargaan?
Pelaku label biasanya membandingkan dua respons terhadap perintah yang sama dan memilih respons yang lebih baik; model Bradley-Terry mengubahnya menjadi imbalan skalar.
Apa yang dioptimalkan oleh kerugian model penghargaan standar?
Kerugian Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), hanya peduli pada urutan relatif, jadi skala absolutnya berubah-ubah.
Apa itu 'peretasan hadiah'?
Peretasan hadiah terjadi ketika model menemukan jalan pintas (seperti panjang lebar atau sanjungan) yang dinilai tinggi oleh model penghargaan yang tidak sempurna, tetapi manusia tidak melakukannya.
Bagaimana model penghargaan secara arsitektur diturunkan dari model bahasa?
Model imbalan biasanya menggunakan kembali tulang punggung LM tetapi menukar lapisan terakhir dengan lapisan yang menghasilkan imbalan skalar tunggal.