Pengoptimuman Dasar Relatif Kumpulan
Pengoptimuman Dasar Relatif Kumpulan (GRPO) ialah kaedah pembelajaran pengukuhan untuk memperhalusi model bahasa yang menilai setiap jawapan terhadap sekumpulan jawapan adik beradik kepada gesaan yang sama, menghapuskan rangkaian nilai berasingan yang digunakan oleh PPO.
Gambaran keseluruhan
Ia menjadi terkenal sebagai helah latihan teras di sebalik model penaakulan DeepSeek.
Menyelam dalam
GRPO ialah varian pembelajaran pengukuhan kecerunan dasar yang direka bentuk untuk menjadikan penalaan halus RL bagi model bahasa besar lebih murah dan lebih stabil. PPO standard memerlukan 'pengkritik' yang dipelajari (model nilai), kira-kira sebesar dasar itu sendiri, untuk menganggarkan sejauh mana kebaikan setiap token. GRPO membuang pengkritik itu sepenuhnya. Untuk setiap gesaan ia mengambil sampel sekumpulan penyiapan (katakan 8-64), menjaringkan kesemuanya dengan isyarat ganjaran, dan kemudian mengira kelebihan setiap penyiapan dengan menyeragamkan ganjarannya terhadap min dan sisihan piawai kumpulan. Jawapan di atas purata diperkukuh dan jawapan di bawah purata ditindas. Istilah KL-divergence memastikan model itu hampir kepada dasar rujukan. Diperkenalkan oleh DeepSeek, ia memperkasakan DeepSeekMath dan model penaakulan DeepSeek-R1.
Wawasan Teknikal
Idea utama ialah menggantikan garis dasar nilai yang dipelajari PPO dengan garis dasar kumpulan Monte Carlo. Untuk sekumpulan output dengan ganjaran r_i, setiap kelebihan ialah A_i = (r_i - min(r)) / std(r). Skor yang dinormalkan itu menggandakan nisbah kebarangkalian terpotong, sama seperti dalam PPO, dan penalti KL terhadap model rujukan beku mengekang drift. Oleh kerana tiada pengkritik dilatih, ingatan dan pengiraan menjadi separuh, dan normalisasi mengikut segera memberikan kelebihan berskala semula jadi, varians rendah.
Kesan Strategik
Kos dan bajet
Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.
Keputusan yang lebih jelas
Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.
Kawalan kualiti
Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.
Masa Depan Pengoptimuman Dasar Relatif Kumpulan
GRPO telah menjadi resipi lalai dengan pantas untuk melatih model penaakulan terbuka, dan makmal sedang mengulangi kelemahannya. Penyelidik sedang meneroka pembetulan untuk berat sebelah panjang dan kesukaran (seperti Dr. GRPO), tahap token dan bukannya normalisasi peringkat jujukan, dan mengalih keluar atau membentuk semula istilah KL. Jangkakan penyepaduan yang lebih ketat dengan ganjaran yang boleh disahkan (matematik, kod, penggunaan alat), pengendalian isyarat jarang yang lebih baik dan hibrid yang menggabungkan garis dasar kumpulan dengan pengkritik ringan untuk tugasan berbilang langkah yang agenik.
Pelaksanaan Dunia Sebenar
Melatih DeepSeek-R1 dan DeepSeekMath untuk menghasilkan penaakulan rantaian pemikiran yang panjang menggunakan ganjaran ketepatan berasaskan peraturan pada masalah matematik
Penalaan halus model penjanaan kod di mana setiap penyelesaian sampel dijaringkan sama ada ia lulus ujian unit dan kumpulan dinormalkan untuk memilih pemenang
Saluran paip RLHF sumber terbuka (cth., dalam perpustakaan TRL dan verl) menggunakan GRPO untuk menjajarkan model sembang tanpa membayar untuk rangkaian nilai yang berasingan
Memperbaiki tingkah laku mengikut arahan atau keselamatan dengan mencontohi beberapa respons setiap gesaan dan memberi ganjaran kepada yang model ganjaran kadar tertinggi berbanding rakan sebaya mereka
Risiko & Pengawal
Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.
Kos infrastruktur dan penyelenggaraan sering dipandang remeh.
Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.
Hala Tuju Pelaksanaan
Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.
Penanda aras di bawah beban realistik dan keadaan data.
Pemantauan instrumen untuk ralat, drift dan kesan pengguna.
Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Pengoptimuman Dasar Proksimal
Soalan lazim
Apakah itu Pengoptimuman Dasar Relatif Kumpulan?
Pengoptimuman Dasar Relatif Kumpulan (GRPO) ialah kaedah pembelajaran pengukuhan untuk memperhalusi model bahasa yang menilai setiap jawapan terhadap sekumpulan jawapan adik beradik kepada gesaan yang sama, menghapuskan rangkaian nilai berasingan yang digunakan oleh PPO. Ia menjadi terkenal sebagai helah latihan teras di sebalik model penaakulan DeepSeek.
Apakah komponen utama PPO yang dihapuskan oleh GRPO?
Perubahan tandatangan GRPO menggugurkan model nilai/pengkritik PPO yang dipelajari, yang biasanya berukuran lebih kurang sama dengan dasar, menjimatkan memori dan pengiraan yang besar.
Bagaimanakah GRPO mengira kelebihan untuk penyiapan tertentu?
Setiap kelebihan penyiapan ialah (ganjaran - min kumpulan) / sisihan piawai kumpulan, jadi kumpulan jawapan kepada gesaan yang sama bertindak sebagai garis dasar.
Model manakah yang menjadikan GRPO terkenal?
GRPO telah diperkenalkan dan dipopularkan oleh DeepSeek, terutamanya dalam DeepSeekMath dan sebagai enjin RL di belakang model penaakulan DeepSeek-R1.
Apakah peranan yang dimainkan oleh istilah KL-divergence dalam GRPO?
Penalti KL terhadap rujukan (biasanya model pra-RL) menyelaraskan latihan supaya polisi bertambah baik tanpa runtuh atau hanyut menjadi output yang merosot.
Mengapakah GRPO sangat menarik untuk melatih model penaakulan tentang matematik atau kod?
Mensampel banyak penyelesaian dan menjaringkannya dengan pemeriksaan ketepatan automatik berpasangan dengan bersih dengan kelebihan GRPO yang dinormalisasi kumpulan, tidak perlu pengkritik.