PANDUAN Teknikal

Pengoptimuman Dasar Relatif Kumpulan

Pengoptimuman Dasar Relatif Kumpulan (GRPO) ialah kaedah pembelajaran pengukuhan untuk memperhalusi model bahasa yang menilai setiap jawapan terhadap sekumpulan jawapan adik beradik kepada gesaan yang sama, menghapuskan rangkaian nilai berasingan yang digunakan oleh PPO.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

Ia menjadi terkenal sebagai helah latihan teras di sebalik model penaakulan DeepSeek.

Menyelam dalam

GRPO ialah varian pembelajaran pengukuhan kecerunan dasar yang direka bentuk untuk menjadikan penalaan halus RL bagi model bahasa besar lebih murah dan lebih stabil. PPO standard memerlukan 'pengkritik' yang dipelajari (model nilai), kira-kira sebesar dasar itu sendiri, untuk menganggarkan sejauh mana kebaikan setiap token. GRPO membuang pengkritik itu sepenuhnya. Untuk setiap gesaan ia mengambil sampel sekumpulan penyiapan (katakan 8-64), menjaringkan kesemuanya dengan isyarat ganjaran, dan kemudian mengira kelebihan setiap penyiapan dengan menyeragamkan ganjarannya terhadap min dan sisihan piawai kumpulan. Jawapan di atas purata diperkukuh dan jawapan di bawah purata ditindas. Istilah KL-divergence memastikan model itu hampir kepada dasar rujukan. Diperkenalkan oleh DeepSeek, ia memperkasakan DeepSeekMath dan model penaakulan DeepSeek-R1.

Wawasan Teknikal

Idea utama ialah menggantikan garis dasar nilai yang dipelajari PPO dengan garis dasar kumpulan Monte Carlo. Untuk sekumpulan output dengan ganjaran r_i, setiap kelebihan ialah A_i = (r_i - min(r)) / std(r). Skor yang dinormalkan itu menggandakan nisbah kebarangkalian terpotong, sama seperti dalam PPO, dan penalti KL terhadap model rujukan beku mengekang drift. Oleh kerana tiada pengkritik dilatih, ingatan dan pengiraan menjadi separuh, dan normalisasi mengikut segera memberikan kelebihan berskala semula jadi, varians rendah.

Kesan Strategik

Kos dan bajet

Keputusan seni bina memacu prestasi dan kos operasi selama bertahun-tahun.

Keputusan yang lebih jelas

Pendidikan teknikal membantu pasukan memilih timbunan yang betul, bukan hanya yang terbaharu.

Kawalan kualiti

Pilihan kejuruteraan yang lebih baik mengurangkan insiden kebolehpercayaan dalam pengeluaran.

Masa Depan Pengoptimuman Dasar Relatif Kumpulan

GRPO telah menjadi resipi lalai dengan pantas untuk melatih model penaakulan terbuka, dan makmal sedang mengulangi kelemahannya. Penyelidik sedang meneroka pembetulan untuk berat sebelah panjang dan kesukaran (seperti Dr. GRPO), tahap token dan bukannya normalisasi peringkat jujukan, dan mengalih keluar atau membentuk semula istilah KL. Jangkakan penyepaduan yang lebih ketat dengan ganjaran yang boleh disahkan (matematik, kod, penggunaan alat), pengendalian isyarat jarang yang lebih baik dan hibrid yang menggabungkan garis dasar kumpulan dengan pengkritik ringan untuk tugasan berbilang langkah yang agenik.

Pelaksanaan Dunia Sebenar

Melatih DeepSeek-R1 dan DeepSeekMath untuk menghasilkan penaakulan rantaian pemikiran yang panjang menggunakan ganjaran ketepatan berasaskan peraturan pada masalah matematik

Penalaan halus model penjanaan kod di mana setiap penyelesaian sampel dijaringkan sama ada ia lulus ujian unit dan kumpulan dinormalkan untuk memilih pemenang

Saluran paip RLHF sumber terbuka (cth., dalam perpustakaan TRL dan verl) menggunakan GRPO untuk menjajarkan model sembang tanpa membayar untuk rangkaian nilai yang berasingan

Memperbaiki tingkah laku mengikut arahan atau keselamatan dengan mencontohi beberapa respons setiap gesaan dan memberi ganjaran kepada yang model ganjaran kadar tertinggi berbanding rakan sebaya mereka

Risiko & Pengawal

Mengoptimumkan satu penanda aras boleh menyembunyikan kelemahan sistem yang lebih luas.

Kos infrastruktur dan penyelenggaraan sering dipandang remeh.

Jurang keselamatan dan pemerhatian boleh berkembang apabila sistem menjadi lebih kompleks.

Hala Tuju Pelaksanaan

1

Tentukan sasaran kependaman, kualiti dan kos sebelum pelaksanaan.

2

Penanda aras di bawah beban realistik dan keadaan data.

3

Pemantauan instrumen untuk ralat, drift dan kesan pengguna.

4

Sediakan laluan balik dan tindak balas insiden sebelum penskalaan.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Pengoptimuman Dasar Proksimal

Soalan lazim

Apakah itu Pengoptimuman Dasar Relatif Kumpulan?

Pengoptimuman Dasar Relatif Kumpulan (GRPO) ialah kaedah pembelajaran pengukuhan untuk memperhalusi model bahasa yang menilai setiap jawapan terhadap sekumpulan jawapan adik beradik kepada gesaan yang sama, menghapuskan rangkaian nilai berasingan yang digunakan oleh PPO. Ia menjadi terkenal sebagai helah latihan teras di sebalik model penaakulan DeepSeek.

Apakah komponen utama PPO yang dihapuskan oleh GRPO?

Perubahan tandatangan GRPO menggugurkan model nilai/pengkritik PPO yang dipelajari, yang biasanya berukuran lebih kurang sama dengan dasar, menjimatkan memori dan pengiraan yang besar.

Bagaimanakah GRPO mengira kelebihan untuk penyiapan tertentu?

Setiap kelebihan penyiapan ialah (ganjaran - min kumpulan) / sisihan piawai kumpulan, jadi kumpulan jawapan kepada gesaan yang sama bertindak sebagai garis dasar.

Model manakah yang menjadikan GRPO terkenal?

GRPO telah diperkenalkan dan dipopularkan oleh DeepSeek, terutamanya dalam DeepSeekMath dan sebagai enjin RL di belakang model penaakulan DeepSeek-R1.

Apakah peranan yang dimainkan oleh istilah KL-divergence dalam GRPO?

Penalti KL terhadap rujukan (biasanya model pra-RL) menyelaraskan latihan supaya polisi bertambah baik tanpa runtuh atau hanyut menjadi output yang merosot.

Mengapakah GRPO sangat menarik untuk melatih model penaakulan tentang matematik atau kod?

Mensampel banyak penyelesaian dan menjaringkannya dengan pemeriksaan ketepatan automatik berpasangan dengan bersih dengan kelebihan GRPO yang dinormalisasi kumpulan, tidak perlu pengkritik.