PANDUAN AI Bahasa

Penyempurnaan Pengambilan Sampel Penolakan

Penyempurnaan Pengambilan Sampel Penolakan (RFT) menghasilkan banyak kandidat jawaban, hanya menyimpan jawaban dengan skor terbaik, dan melatih ulang model pada pemenang tersebut.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.

Menyelam Lebih Dalam

Penyempurnaan Pengambilan Sampel Penolakan, terkadang disebut penyempurnaan terbaik dari N, adalah elemen utama dalam penyelarasan model seperti Llama 2 dan Llama 3 Meta. Resepnya sederhana: untuk setiap perintah, ambil contoh beberapa respons (katakanlah 4 hingga 64) dari model saat ini, nilai masing-masing dengan model penghargaan atau pemeriksa otomatis, lalu buang ('tolak') semua kecuali keluaran yang berperingkat teratas. Sampel berkualitas tinggi yang masih ada menjadi kumpulan data penyesuaian baru yang diawasi, dan model dilatih berdasarkan sampel tersebut dengan kehilangan token berikutnya yang biasa. Mengulangi perulangan ini secara berulang akan mendorong model untuk menghasilkan jawaban yang lebih baik dengan sendirinya. Karena model belajar dari keluarannya yang difilter, RFT menghindari ketidakstabilan dan kesulitan penyesuaian RL gradien kebijakan sambil tetap memanfaatkan sinyal imbalan.

Wawasan Teknis

RFT memanfaatkan fakta bahwa pengambilan sampel berkali-kali dan mempertahankan respons imbalan maksimum mendekati pengambilan dari distribusi yang lebih tajam dan berkualitas lebih tinggi. Pelatihan terhadap pemenang tersebut melalui entropi silang standar secara efektif menyaring perilaku best-of-N tersebut kembali ke keluaran sampel tunggal model. Untuk domain yang dapat diverifikasi seperti matematika atau kode, 'hadiah' dapat berupa apakah jawaban akhir atau pengujian unit berhasil, sehingga menghilangkan kebutuhan akan model penghargaan yang dipelajari sepenuhnya.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan Penyempurnaan Pengambilan Sampel Penolakan

RFT sangat penting dalam pasca-pelatihan modern, sering kali digunakan sebelum atau bersamaan dengan metode RL seperti PPO dan DPO. Daya tariknya tumbuh dengan inferensi yang murah dan pemverifikasi otomatis yang kuat: seiring dengan semakin baiknya model dalam menghasilkan dan memeriksa sendiri, pengambilan sampel penolakan berulang mendukung data sintetis dan loop perbaikan diri. Harapkan integrasi yang lebih erat dengan model penalaran yang menghasilkan rantai pemikiran yang dapat diverifikasi, dan studi berkelanjutan tentang cara menghindari peretasan penghargaan dan runtuhnya keberagaman ketika melatih berulang kali tentang keluaran model itu sendiri.

Implementasi Dunia Nyata

Menyelaraskan model gaya Llama dengan mengambil sampel beberapa jawaban per pertanyaan, mempertahankan skor model penghargaan tertinggi, lalu SFT pada model tersebut

Meningkatkan pemecah matematika dengan menghasilkan banyak solusi dan hanya mempertahankan solusi yang menghasilkan jawaban yang benar dan dapat diperiksa

Pembuatan kode di mana kandidat disimpan hanya jika mereka lulus pengujian unit, kemudian digunakan sebagai data pelatihan

Membangun kumpulan data instruksi sintetik dengan memfilter respons terbaik yang dihasilkan sendiri oleh model untuk putaran pelatihan berikutnya

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Rejection Sampling Fine-Tuning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

QLoRA dan Penyempurnaan 4-Bit

Pertanyaan yang sering diajukan

What is Rejection Sampling Fine-Tuning?

Penyempurnaan Pengambilan Sampel Penolakan (RFT) menghasilkan banyak kandidat jawaban, hanya menyimpan jawaban dengan skor terbaik, dan melatih ulang model pada pemenang tersebut. Hal ini penting karena RLHF menawarkan banyak manfaat dengan menggunakan pembelajaran yang diawasi secara langsung dibandingkan dengan pembelajaran penguatan yang rumit.

Apa ide inti dari Penyempurnaan Pengambilan Sampel Penolakan?

RFT mengambil sampel beberapa respons, memfilter ke respons dengan skor tertinggi, dan menyempurnakan model pada pemenang tersebut.

Dalam domain yang dapat diverifikasi seperti matematika atau kode, apa yang bisa menjadi imbalannya?

Untuk tugas yang dapat diperiksa, RFT dapat menggunakan kebenaran yang tepat atau pengujian unit yang lulus, menghindari model penghargaan yang dipelajari.

Kelompok model mana yang terkenal menggunakan pengambilan sampel penolakan selama penyelarasan?

Meta dijelaskan menggunakan pengambilan sampel penolakan sebagai bagian dari resep pasca pelatihan untuk model Llama 2 dan Llama 3.

Mengapa tim mungkin lebih memilih RFT dibandingkan RL gradien kebijakan seperti PPO?

RFT berlatih ulang dengan kehilangan token berikutnya standar pada sampel yang difilter, menghindari kesulitan penyesuaian dan ketidakstabilan metode gradien kebijakan.

Pelatihan tentang sampel dengan imbalan maksimum secara efektif menghasilkan apa?

Dengan belajar dari respons yang difilter paling atas, model ini menginternalisasikan perilaku berkualitas lebih tinggi dalam satu generasi.