PANDUAN AI Bahasa

Pemodelan Hadiah

Model penghargaan adalah jaringan saraf yang dilatih untuk memprediksi seberapa baik respons AI, dan bertindak sebagai pengganti otomatis untuk penilaian manusia.

2 min readTerakhir diperbarui

Ikhtisar

It is the scoring engine that makes reinforcement learning from human feedback possible at scale.

Menyelam Lebih Dalam

Pemodelan penghargaan memecahkan masalah praktis: manusia tidak dapat menilai setiap satu dari jutaan keluaran yang dihasilkan model selama pelatihan. Sebaliknya, pemberi label membandingkan sejumlah kecil tanggapan, biasanya memilih mana dari dua jawaban yang lebih baik untuk pertanyaan yang sama. Model penghargaan kemudian dilatih berdasarkan perbandingan ini untuk menghasilkan skor skalar tunggal untuk setiap pasangan respons cepat. Tujuan pelatihan standarnya adalah model Bradley-Terry, yang mengubah preferensi berpasangan menjadi probabilitas bahwa satu respons lebih unggul dari respons lainnya. Setelah dilatih, model penghargaan ini dapat mengevaluasi keluaran baru tanpa batas dengan biaya murah, memberikan sinyal yang digunakan algoritme seperti PPO untuk meningkatkan model bahasa. Model penghargaan juga digunakan kembali pada waktu inferensi untuk pengambilan sampel best-of-N, di mana banyak kandidat dihasilkan dan kandidat dengan skor tertinggi dikembalikan.

Wawasan Teknis

Model penghargaan biasanya merupakan model bahasa dasar dengan kepala prediksi tokennya digantikan oleh lapisan linier tunggal yang memancarkan satu skalar. Pelatihan memaksimalkan kemungkinan log bahwa respons yang dipilih mendapat skor lebih tinggi daripada respons yang ditolak: loss = -log(sigmoid(r_chosen - r_rejected)). Yang penting hanyalah perbedaan relatif, jadi skala absolutnya bisa berubah-ubah. Kualitas bergantung pada konsistensi label dan cakupan gaya respons yang luas.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Pemodelan Penghargaan

Penelitian sedang mengatasi kelemahan terbesar model imbalan: model tersebut dapat 'diretas' (model mengeksploitasi kebiasaan seperti memilih jangka waktu), dan tidak dapat lagi didistribusikan seiring dengan perbaikan kebijakan. Arahan yang menjanjikan mencakup model imbalan proses yang memberi skor pada setiap langkah penalaran, ansambel dan perkiraan ketidakpastian untuk melawan peretasan, label preferensi yang dihasilkan AI (RLAIF), dan model imbalan generatif yang menghasilkan kritik dan alasan, bukan sekadar angka.

Implementasi Dunia Nyata

Mendukung RLHF untuk asisten seperti ChatGPT dan Claude dengan menilai respons kandidat selama pelatihan PPO

Pengambilan sampel Best-of-N, di mana suatu model menghasilkan banyak jawaban dan model penghargaan memilih yang terbaik bagi pengguna

'Penguji' matematika dan pengkodean atau model penghargaan proses yang menilai langkah-langkah penalaran menengah untuk meningkatkan pemecahan masalah

Memberi peringkat dan memfilter data pelatihan sintetis, hanya mempertahankan generasi dengan skor tinggi untuk penyesuaian lebih lanjut

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Reward Modeling quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pemodelan Hadiah Bradley-Terry

Pertanyaan yang sering diajukan

What is Reward Modeling?

Model penghargaan adalah jaringan saraf yang dilatih untuk memprediksi seberapa baik respons AI, dan bertindak sebagai pengganti otomatis untuk penilaian manusia. Ini adalah mesin penilaian yang memungkinkan pembelajaran penguatan dari umpan balik manusia dalam skala besar.

Apa keluaran utama dari model penghargaan untuk pasangan respons cepat tertentu?

Model penghargaan memetakan permintaan dan respons terhadap satu angka skalar yang mewakili prediksi kualitas atau preferensi manusia.

Jenis data manusia apa yang paling umum digunakan untuk melatih model penghargaan?

Pelaku label biasanya membandingkan dua respons terhadap perintah yang sama dan memilih respons yang lebih baik; model Bradley-Terry mengubahnya menjadi imbalan skalar.

Apa yang dioptimalkan oleh kerugian model penghargaan standar?

Kerugian Bradley-Terry, -log(sigmoid(r_chosen - r_rejected)), hanya peduli pada urutan relatif, jadi skala absolutnya berubah-ubah.

Apa itu 'peretasan hadiah'?

Peretasan hadiah terjadi ketika model menemukan jalan pintas (seperti panjang lebar atau sanjungan) yang dinilai tinggi oleh model penghargaan yang tidak sempurna, tetapi manusia tidak melakukannya.

Bagaimana model penghargaan secara arsitektur diturunkan dari model bahasa?

Model imbalan biasanya menggunakan kembali tulang punggung LM tetapi menukar lapisan terakhir dengan lapisan yang menghasilkan imbalan skalar tunggal.