Penalaan Halus Pensampelan Penolakan
Penalaan Halus Pensampelan Penolakan (RFT) menjana banyak jawapan calon, hanya menyimpan jawapan yang mendapat markah terbaik dan melatih semula model pada pemenang tersebut.
Gambaran keseluruhan
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Menyelam dalam
Penalaan Halus Pensampelan Penolakan, kadangkala dipanggil penalaan halus terbaik-of-N, ialah ramuan utama dalam cara model seperti Llama 2 dan Llama 3 Meta dijajarkan. Resipinya mudah: untuk setiap gesaan, sampel beberapa respons (katakan 4 hingga 64) daripada model semasa, skor setiap satu dengan model ganjaran atau penyemak automatik, kemudian buang ('tolak') semua kecuali output yang menduduki tempat teratas. Sampel berkualiti tinggi yang masih ada menjadi set data penalaan halus yang diselia dan model itu dilatih mengenainya dengan kehilangan token seterusnya yang biasa. Mengulangi gelung ini secara berulang mendorong model ke arah menghasilkan jawapan yang lebih baik dengan sendirinya. Oleh kerana model itu belajar daripada output ditapisnya sendiri, RFT mengelakkan ketidakstabilan dan sakit kepala penalaan RL kecerunan dasar sambil masih memanfaatkan isyarat ganjaran.
Wawasan Teknikal
RFT mengeksploitasi fakta bahawa pensampelan berkali-kali dan mengekalkan tindak balas ganjaran maksimum menghampiri memilih daripada pengedaran yang lebih tajam dan berkualiti tinggi. Latihan tentang pemenang tersebut melalui entropi silang standard dengan berkesan menyaring tingkah laku terbaik N itu kembali ke dalam output sampel tunggal model. Untuk domain yang boleh disahkan seperti matematik atau kod, 'ganjaran' boleh jadi sama ada jawapan akhir atau ujian unit lulus, menghapuskan keperluan untuk model ganjaran yang dipelajari sepenuhnya.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Penalaan Persampelan Penolakan
RFT adalah pusat kepada pasca latihan moden, sering digunakan sebelum atau bersama kaedah RL seperti PPO dan DPO. Daya tarikannya berkembang dengan inferens yang murah dan pengesah automatik yang kukuh: apabila model menjadi lebih baik dalam menjana sendiri dan menyemak sendiri, pensampelan penolakan berulang menyokong data sintetik dan gelung pembaikan kendiri. Jangkakan penyepaduan yang lebih ketat dengan model penaakulan yang menghasilkan rantaian pemikiran yang boleh disahkan, dan kajian berterusan tentang cara mengelakkan penggodaman ganjaran dan kepelbagaian runtuh apabila latihan berulang kali pada output model sendiri.
Pelaksanaan Dunia Sebenar
Menjajarkan model gaya Llama dengan mengambil sampel berbilang jawapan setiap gesaan, mengekalkan skor model ganjaran tertinggi, kemudian SFT pada
Meningkatkan penyelesai matematik dengan menghasilkan banyak penyelesaian dan mengekalkan hanya penyelesaian yang mencapai jawapan yang betul dan boleh diperiksa
Penjanaan kod di mana calon disimpan hanya jika mereka lulus ujian unit, kemudian digunakan sebagai data latihan
Membina set data arahan sintetik dengan menapis respons jana sendiri terbaik model untuk pusingan latihan seterusnya
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
QLoRA dan Penalaan Halus 4-Bit
Soalan lazim
What is Rejection Sampling Fine-Tuning?
Penalaan Halus Pensampelan Penolakan (RFT) menjana banyak jawapan calon, hanya menyimpan jawapan yang mendapat markah terbaik dan melatih semula model pada pemenang tersebut. Ia penting kerana ia menawarkan banyak manfaat RLHF menggunakan pembelajaran seliaan yang mudah dan bukannya pembelajaran peneguhan yang kompleks.
Apakah idea teras Penalaan Halus Pensampelan Penolakan?
RFT mencontohi berbilang respons, menapis kepada yang mendapat markah tertinggi dan memperhalusi model pada pemenang tersebut.
Dalam domain yang boleh disahkan seperti matematik atau kod, apakah yang boleh berfungsi sebagai ganjaran?
Untuk tugasan boleh semak, RFT boleh menggunakan ketepatan tepat atau lulus ujian unit, mengelakkan model ganjaran yang dipelajari.
Keluarga model manakah yang terkenal menggunakan pensampelan penolakan semasa penjajaran?
Meta diterangkan menggunakan pensampelan penolakan sebagai sebahagian daripada resipi selepas latihan untuk model Llama 2 dan Llama 3.
Mengapakah pasukan mungkin lebih suka RFT berbanding RL kecerunan dasar seperti PPO?
RFT melatih semula dengan kehilangan token seterusnya standard pada sampel yang ditapis, mengetepikan kesukaran penalaan dan ketidakstabilan kaedah kecerunan dasar.
Latihan mengenai sampel ganjaran maksimum berkesan melakukan apa?
Dengan belajar daripada respons yang ditapis teratas, model ini menghayati tingkah laku berkualiti tinggi dalam satu generasi.