Normalisasi Ganjaran Berkumpulan dalam RLHF
Normalisasi ganjaran berkumpulan menyeragamkan ganjaran model dalam kumpulan respons kepada gesaan yang sama, menukar skor bising kepada isyarat latihan yang stabil.
Gambaran keseluruhan
Ia adalah helah teras di sebalik GRPO, algoritma yang menggerakkan banyak model penaakulan moden.
Menyelam dalam
Dalam pembelajaran pengukuhan daripada maklum balas manusia (RLHF), model menjana respons dan model ganjaran menjaringkannya, tetapi ganjaran mentah adalah bising dan berbeza-beza merentasi gesaan. Normalisasi ganjaran berkumpulan membetulkan perkara ini dengan mensampel sekumpulan beberapa respons kepada gesaan yang sama, kemudian menormalkan setiap ganjaran dengan menolak min kumpulan dan membahagikan dengan sisihan piawai kumpulan. Skor z ini menjadi kelebihan. Pendekatan ini penting kepada Pengoptimuman Dasar Relatif Kumpulan (GRPO), yang diperkenalkan oleh DeepSeek, yang terkenal dengan alasan DeepSeek-R1. Yang penting, GRPO menghapuskan rangkaian nilai berasingan (pengkritik) yang digunakan oleh PPO, kerana purata kumpulan berfungsi sebagai garis dasar. Ini menjadikan latihan lebih mudah, lebih murah dan lebih cekap ingatan sambil mengekalkan isyarat kecerunan berskala baik.
Wawasan Teknikal
Untuk sekumpulan output dengan ganjaran r_1...r_G, kelebihannya ialah A_i = (r_i − min(r)) / std(r). Respons yang lebih baik daripada purata kumpulan mereka mendapat kelebihan positif dan diperkukuh; yang lebih teruk daripada purata ditolak ke bawah. Oleh kerana perbandingan adalah relatif dalam skala ganjaran yang segera, mutlak dan kesukaran setiap langkah membatalkan, mengurangkan varians. GRPO mengekalkan objektif terpotong PPO dan penalti KL terhadap dasar rujukan untuk mengelakkan model daripada hanyut terlalu jauh.
Kesan Strategik
Keputusan yang lebih jelas
Ia membantu anda memisahkan tuntutan teknikal yang jelas daripada bahasa pemasaran.
Kos dan bajet
Anda boleh bertanya soalan pelaksanaan yang lebih baik sebelum menghabiskan wang atau masa.
Pasukan dan aliran kerja
Pasukan yang berkongsi pemahaman membuat keputusan produk, dasar dan pembelajaran yang lebih baik.
Masa Depan Normalisasi Ganjaran Berkumpulan dalam RLHF
Normalisasi berkumpulan menyemarakkan ledakan model penaakulan, di mana model belajar daripada ganjaran yang boleh disahkan seperti jawapan matematik yang betul tanpa pengkritik yang bijak. Penyelidikan sedang memperhalusinya: perdebatan sama ada untuk membahagikan dengan sisihan piawai, mengendalikan kumpulan yang betul atau salah yang menghasilkan kelebihan sifar dan menskalakan saiz kumpulan. Jangkakan kaedah berkumpulan, bebas pengkritik untuk merebak kepada penggunaan alat agenik dan penjanaan kod, di mana pengesah automatik membekalkan isyarat ganjaran yang murah dan banyak.
Pelaksanaan Dunia Sebenar
Melatih model penaakulan matematik dengan mengambil sampel 16 penyelesaian bagi setiap masalah dan memberi ganjaran yang melebihi ketepatan purata kumpulan.
Perhalusi kebolehgunaan chatbot dengan menormalkan skor model ganjaran merentas beberapa balasan calon kepada setiap gesaan pengguna.
Memperbaik pembantu pengekodan di mana setiap penyelesaian sampel dijaringkan sama ada ia lulus ujian unit, kemudian dinormalkan dalam kumpulan.
Mengurangkan memori GPU dalam saluran paip RLHF dengan menjatuhkan rangkaian pengkritik PPO dan sebaliknya menggunakan min kumpulan sebagai garis dasar.
Risiko & Pengawal
Pasukan yang berbeza mungkin menggunakan istilah yang sama secara berbeza, jadi tentukan skop lebih awal.
Penanda aras boleh kelihatan kukuh manakala prestasi dunia sebenar tidak sekata.
Mengabaikan kualiti data dan rancangan penilaian sering menghasilkan hasil yang rapuh.
Hala Tuju Pelaksanaan
Mulakan dengan definisi bahasa biasa hasil yang anda perlukan.
Pilih satu metrik kejayaan dan satu keadaan kegagalan sebelum ujian.
Jalankan juruterbang kecil dengan data perwakilan, bukan set demo yang digilap.
Dokumen di mana Normalisasi Ganjaran Berkumpulan dalam RLHF membantu dan kaedah yang lebih mudah adalah lebih baik.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Grouped Reward Normalization in RLHF quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Normalisasi Panjang dalam Pengoptimuman Keutamaan
Soalan lazim
Apakah itu Penormalan Ganjaran Berkumpulan dalam RLHF?
Normalisasi ganjaran berkumpulan menyeragamkan ganjaran model dalam kumpulan respons kepada gesaan yang sama, menukar skor bising kepada isyarat latihan yang stabil. Ia adalah muslihat teras di sebalik GRPO, algoritma yang menguasai banyak model penaakulan moden.
Dalam normalisasi ganjaran berkumpulan, berapakah ganjaran setiap respons berbanding?
Setiap ganjaran ditukar kepada skor z menggunakan min dan sisihan piawai kumpulan respons kepada gesaan yang sama.
Algoritma manakah yang paling dikaitkan dengan normalisasi ganjaran berkumpulan?
GRPO, yang diperkenalkan oleh DeepSeek dan digunakan dalam DeepSeek-R1, dibina berdasarkan menormalkan ganjaran dalam kumpulan.
Apakah komponen PPO standard yang ketara dihapuskan oleh GRPO?
Dengan menggunakan purata kumpulan sebagai garis dasar, GRPO menggugurkan pengkritik yang dipelajari, menjimatkan memori dan mengira.
Apakah yang berlaku kepada respons yang ganjarannya berada di bawah min kumpulannya?
Menolak min kumpulan menjadikan respons di bawah purata mempunyai kelebihan negatif, menolak dasar daripadanya.
Mengapakah menormalkan dalam kumpulan mengurangkan varians latihan?
Oleh kerana perbandingan adalah relatif dalam setiap gesaan, perbezaan dalam skala mutlak dan kesukaran segera hilang.