Penyempurnaan Pengambilan Sampel Penolakan
Penyempurnaan Pengambilan Sampel Penolakan (RFT) menghasilkan banyak kandidat jawaban, hanya menyimpan jawaban dengan skor terbaik, dan melatih ulang model pada pemenang tersebut.
Ikhtisar
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Menyelam Lebih Dalam
Penyempurnaan Pengambilan Sampel Penolakan, terkadang disebut penyempurnaan terbaik dari N, adalah elemen utama dalam penyelarasan model seperti Llama 2 dan Llama 3 Meta. Resepnya sederhana: untuk setiap perintah, ambil contoh beberapa respons (katakanlah 4 hingga 64) dari model saat ini, nilai masing-masing dengan model penghargaan atau pemeriksa otomatis, lalu buang ('tolak') semua kecuali keluaran yang berperingkat teratas. Sampel berkualitas tinggi yang masih ada menjadi kumpulan data penyesuaian baru yang diawasi, dan model dilatih berdasarkan sampel tersebut dengan kehilangan token berikutnya yang biasa. Mengulangi perulangan ini secara berulang akan mendorong model untuk menghasilkan jawaban yang lebih baik dengan sendirinya. Karena model belajar dari keluarannya yang difilter, RFT menghindari ketidakstabilan dan kesulitan penyesuaian RL gradien kebijakan sambil tetap memanfaatkan sinyal imbalan.
Wawasan Teknis
RFT memanfaatkan fakta bahwa pengambilan sampel berkali-kali dan mempertahankan respons imbalan maksimum mendekati pengambilan dari distribusi yang lebih tajam dan berkualitas lebih tinggi. Pelatihan terhadap pemenang tersebut melalui entropi silang standar secara efektif menyaring perilaku best-of-N tersebut kembali ke keluaran sampel tunggal model. Untuk domain yang dapat diverifikasi seperti matematika atau kode, 'hadiah' dapat berupa apakah jawaban akhir atau pengujian unit berhasil, sehingga menghilangkan kebutuhan akan model penghargaan yang dipelajari sepenuhnya.
Dampak Strategis
Kecepatan dan skala
Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.
Access and reach
Ini memperluas akses lintas bahasa dan gaya komunikasi.
Clearer decisions
Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.
Masa Depan Penyempurnaan Pengambilan Sampel Penolakan
RFT sangat penting dalam pasca-pelatihan modern, sering kali digunakan sebelum atau bersamaan dengan metode RL seperti PPO dan DPO. Daya tariknya tumbuh dengan inferensi yang murah dan pemverifikasi otomatis yang kuat: seiring dengan semakin baiknya model dalam menghasilkan dan memeriksa sendiri, pengambilan sampel penolakan berulang mendukung data sintetis dan loop perbaikan diri. Harapkan integrasi yang lebih erat dengan model penalaran yang menghasilkan rantai pemikiran yang dapat diverifikasi, dan studi berkelanjutan tentang cara menghindari peretasan penghargaan dan runtuhnya keberagaman ketika melatih berulang kali tentang keluaran model itu sendiri.
Implementasi Dunia Nyata
Menyelaraskan model gaya Llama dengan mengambil sampel beberapa jawaban per pertanyaan, mempertahankan skor model penghargaan tertinggi, lalu SFT pada model tersebut
Meningkatkan pemecah matematika dengan menghasilkan banyak solusi dan hanya mempertahankan solusi yang menghasilkan jawaban yang benar dan dapat diperiksa
Pembuatan kode di mana kandidat disimpan hanya jika mereka lulus pengujian unit, kemudian digunakan sebagai data pelatihan
Membangun kumpulan data instruksi sintetik dengan memfilter respons terbaik yang dihasilkan sendiri oleh model untuk putaran pelatihan berikutnya
Risiko & Pagar Pembatas
Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.
Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.
Data teks sensitif mungkin terekspos jika kontrol akses lemah.
Peta Jalan Implementasi
Tentukan format output, nada, dan standar kualitas sebelum peluncuran.
Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.
Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.
Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
QLoRA dan Penyempurnaan 4-Bit
Pertanyaan yang sering diajukan
What is Rejection Sampling Fine-Tuning?
Penyempurnaan Pengambilan Sampel Penolakan (RFT) menghasilkan banyak kandidat jawaban, hanya menyimpan jawaban dengan skor terbaik, dan melatih ulang model pada pemenang tersebut. Hal ini penting karena RLHF menawarkan banyak manfaat dengan menggunakan pembelajaran yang diawasi secara langsung dibandingkan dengan pembelajaran penguatan yang rumit.
Apa ide inti dari Penyempurnaan Pengambilan Sampel Penolakan?
RFT mengambil sampel beberapa respons, memfilter ke respons dengan skor tertinggi, dan menyempurnakan model pada pemenang tersebut.
Dalam domain yang dapat diverifikasi seperti matematika atau kode, apa yang bisa menjadi imbalannya?
Untuk tugas yang dapat diperiksa, RFT dapat menggunakan kebenaran yang tepat atau pengujian unit yang lulus, menghindari model penghargaan yang dipelajari.
Kelompok model mana yang terkenal menggunakan pengambilan sampel penolakan selama penyelarasan?
Meta dijelaskan menggunakan pengambilan sampel penolakan sebagai bagian dari resep pasca pelatihan untuk model Llama 2 dan Llama 3.
Mengapa tim mungkin lebih memilih RFT dibandingkan RL gradien kebijakan seperti PPO?
RFT berlatih ulang dengan kehilangan token berikutnya standar pada sampel yang difilter, menghindari kesulitan penyesuaian dan ketidakstabilan metode gradien kebijakan.
Pelatihan tentang sampel dengan imbalan maksimum secara efektif menghasilkan apa?
Dengan belajar dari respons yang difilter paling atas, model ini menginternalisasikan perilaku berkualitas lebih tinggi dalam satu generasi.