PANDUAN AI Bahasa

Penalaan Halus Pensampelan Penolakan

Penalaan Halus Pensampelan Penolakan (RFT) menjana banyak jawapan calon, hanya menyimpan jawapan yang mendapat markah terbaik dan melatih semula model pada pemenang tersebut.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Menyelam dalam

Penalaan Halus Pensampelan Penolakan, kadangkala dipanggil penalaan halus terbaik-of-N, ialah ramuan utama dalam cara model seperti Llama 2 dan Llama 3 Meta dijajarkan. Resipinya mudah: untuk setiap gesaan, sampel beberapa respons (katakan 4 hingga 64) daripada model semasa, skor setiap satu dengan model ganjaran atau penyemak automatik, kemudian buang ('tolak') semua kecuali output yang menduduki tempat teratas. Sampel berkualiti tinggi yang masih ada menjadi set data penalaan halus yang diselia dan model itu dilatih mengenainya dengan kehilangan token seterusnya yang biasa. Mengulangi gelung ini secara berulang mendorong model ke arah menghasilkan jawapan yang lebih baik dengan sendirinya. Oleh kerana model itu belajar daripada output ditapisnya sendiri, RFT mengelakkan ketidakstabilan dan sakit kepala penalaan RL kecerunan dasar sambil masih memanfaatkan isyarat ganjaran.

Wawasan Teknikal

RFT mengeksploitasi fakta bahawa pensampelan berkali-kali dan mengekalkan tindak balas ganjaran maksimum menghampiri memilih daripada pengedaran yang lebih tajam dan berkualiti tinggi. Latihan tentang pemenang tersebut melalui entropi silang standard dengan berkesan menyaring tingkah laku terbaik N itu kembali ke dalam output sampel tunggal model. Untuk domain yang boleh disahkan seperti matematik atau kod, 'ganjaran' boleh jadi sama ada jawapan akhir atau ujian unit lulus, menghapuskan keperluan untuk model ganjaran yang dipelajari sepenuhnya.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Penalaan Persampelan Penolakan

RFT adalah pusat kepada pasca latihan moden, sering digunakan sebelum atau bersama kaedah RL seperti PPO dan DPO. Daya tarikannya berkembang dengan inferens yang murah dan pengesah automatik yang kukuh: apabila model menjadi lebih baik dalam menjana sendiri dan menyemak sendiri, pensampelan penolakan berulang menyokong data sintetik dan gelung pembaikan kendiri. Jangkakan penyepaduan yang lebih ketat dengan model penaakulan yang menghasilkan rantaian pemikiran yang boleh disahkan, dan kajian berterusan tentang cara mengelakkan penggodaman ganjaran dan kepelbagaian runtuh apabila latihan berulang kali pada output model sendiri.

Pelaksanaan Dunia Sebenar

Menjajarkan model gaya Llama dengan mengambil sampel berbilang jawapan setiap gesaan, mengekalkan skor model ganjaran tertinggi, kemudian SFT pada

Meningkatkan penyelesai matematik dengan menghasilkan banyak penyelesaian dan mengekalkan hanya penyelesaian yang mencapai jawapan yang betul dan boleh diperiksa

Penjanaan kod di mana calon disimpan hanya jika mereka lulus ujian unit, kemudian digunakan sebagai data latihan

Membina set data arahan sintetik dengan menapis respons jana sendiri terbaik model untuk pusingan latihan seterusnya

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

QLoRA dan Penalaan Halus 4-Bit

Soalan lazim

What is Rejection Sampling Fine-Tuning?

Penalaan Halus Pensampelan Penolakan (RFT) menjana banyak jawapan calon, hanya menyimpan jawapan yang mendapat markah terbaik dan melatih semula model pada pemenang tersebut. Ia penting kerana ia menawarkan banyak manfaat RLHF menggunakan pembelajaran seliaan yang mudah dan bukannya pembelajaran peneguhan yang kompleks.

Apakah idea teras Penalaan Halus Pensampelan Penolakan?

RFT mencontohi berbilang respons, menapis kepada yang mendapat markah tertinggi dan memperhalusi model pada pemenang tersebut.

Dalam domain yang boleh disahkan seperti matematik atau kod, apakah yang boleh berfungsi sebagai ganjaran?

Untuk tugasan boleh semak, RFT boleh menggunakan ketepatan tepat atau lulus ujian unit, mengelakkan model ganjaran yang dipelajari.

Keluarga model manakah yang terkenal menggunakan pensampelan penolakan semasa penjajaran?

Meta diterangkan menggunakan pensampelan penolakan sebagai sebahagian daripada resipi selepas latihan untuk model Llama 2 dan Llama 3.

Mengapakah pasukan mungkin lebih suka RFT berbanding RL kecerunan dasar seperti PPO?

RFT melatih semula dengan kehilangan token seterusnya standard pada sampel yang ditapis, mengetepikan kesukaran penalaan dan ketidakstabilan kaedah kecerunan dasar.

Latihan mengenai sampel ganjaran maksimum berkesan melakukan apa?

Dengan belajar daripada respons yang ditapis teratas, model ini menghayati tingkah laku berkualiti tinggi dalam satu generasi.