Optimasi Kebijakan Relatif Grup
Pengoptimalan Kebijakan Relatif Grup (GRPO) adalah metode pembelajaran penguatan untuk menyempurnakan model bahasa yang menilai setiap jawaban berdasarkan sekelompok jawaban saudara terhadap perintah yang sama, menghilangkan jaringan nilai terpisah yang digunakan oleh PPO.
Ikhtisar
It became famous as the core training trick behind DeepSeek's reasoning models.
Menyelam Lebih Dalam
GRPO adalah varian pembelajaran penguatan gradien kebijakan yang dirancang untuk membuat penyesuaian RL pada model bahasa besar menjadi lebih murah dan stabil. PPO standar memerlukan 'kritikus' (model nilai) yang terpelajar, yang kira-kira sama besarnya dengan kebijakan itu sendiri, untuk memperkirakan seberapa baik setiap token. GRPO menghilangkan kritik tersebut sepenuhnya. Untuk setiap perintah, ia mengambil sampel sekelompok penyelesaian (katakanlah 8-64), menilai semuanya dengan sinyal imbalan, lalu menghitung keuntungan setiap penyelesaian dengan membakukan imbalannya terhadap rata-rata dan deviasi standar kelompok tersebut. Jawaban yang di atas rata-rata akan diperkuat dan jawaban yang di bawah rata-rata akan dihilangkan. Istilah KL-divergence membuat model tetap dekat dengan kebijakan acuan. Diperkenalkan oleh DeepSeek, ini mendukung model penalaran DeepSeekMath dan DeepSeek-R1.
Wawasan Teknis
Ide utamanya adalah mengganti data dasar nilai yang dipelajari PPO dengan data dasar grup Monte Carlo. Untuk sekelompok keluaran dengan imbalan r_i, masing-masing keuntungannya adalah A_i = (r_i - mean(r)) / std(r). Skor yang dinormalisasi tersebut mengalikan rasio probabilitas yang terpotong, persis seperti pada PPO, dan penalti KL terhadap model referensi yang dibekukan membatasi penyimpangan. Karena tidak ada kritikus yang dilatih, memori dan komputasi berkurang setengahnya, dan normalisasi per-prompt memberikan keuntungan dengan skala alami dan variansi rendah.
Dampak Strategis
Cost and budget
Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.
Clearer decisions
Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.
Quality control
Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.
Masa Depan Optimalisasi Kebijakan Relatif Grup
GRPO dengan cepat menjadi resep standar untuk melatih model penalaran terbuka, dan laboratorium terus mengulangi titik lemahnya. Para peneliti sedang menjajaki perbaikan untuk bias panjang dan kesulitan (seperti Dr. GRPO), normalisasi tingkat token daripada tingkat urutan, dan menghilangkan atau membentuk kembali istilah KL. Harapkan integrasi yang lebih erat dengan imbalan yang dapat diverifikasi (matematika, kode, penggunaan alat), penanganan sinyal jarang yang lebih baik, dan hibrida yang menggabungkan garis dasar grup dengan kritik ringan untuk tugas-tugas yang bersifat agen dan multi-langkah.
Implementasi Dunia Nyata
Melatih DeepSeek-R1 dan DeepSeekMath untuk menghasilkan penalaran rantai pemikiran yang panjang menggunakan penghargaan kebenaran berbasis aturan pada soal matematika
Menyempurnakan model pembuatan kode di mana setiap solusi sampel diberi skor berdasarkan apakah solusi tersebut lulus pengujian unit, dan grup dinormalisasi untuk memilih pemenang
Pipeline RLHF sumber terbuka (misalnya, di perpustakaan TRL dan verl) menggunakan GRPO untuk menyelaraskan model obrolan tanpa membayar jaringan nilai terpisah
Meningkatkan kepatuhan terhadap instruksi atau perilaku keselamatan dengan mengambil contoh beberapa respons per perintah dan memberikan penghargaan kepada respons yang diberikan model penghargaan dengan nilai tertinggi dibandingkan rekan-rekan mereka
Risiko & Pagar Pembatas
Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.
Biaya infrastruktur dan pemeliharaan sering kali diremehkan.
Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.
Peta Jalan Implementasi
Tentukan target latensi, kualitas, dan biaya sebelum penerapan.
Tolok ukur dalam kondisi beban dan data yang realistis.
Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.
Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Group Relative Policy Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Optimalisasi Kebijakan Proksimal
Pertanyaan yang sering diajukan
What is Group Relative Policy Optimization?
Pengoptimalan Kebijakan Relatif Grup (GRPO) adalah metode pembelajaran penguatan untuk menyempurnakan model bahasa yang menilai setiap jawaban berdasarkan sekelompok jawaban saudara terhadap perintah yang sama, menghilangkan jaringan nilai terpisah yang digunakan oleh PPO. Ini menjadi terkenal sebagai trik pelatihan inti di balik model penalaran DeepSeek.
Komponen utama PPO apa yang dihilangkan GRPO?
Perubahan khas GRPO adalah menghilangkan model nilai/kritik yang dipelajari PPO, yang biasanya berukuran sama dengan kebijakan, sehingga menghemat banyak memori dan komputasi.
Bagaimana GRPO menghitung keuntungan untuk penyelesaian tertentu?
Keuntungan setiap penyelesaian adalah (hadiah - rata-rata kelompok) / deviasi standar kelompok, sehingga kelompok jawaban terhadap perintah yang sama bertindak sebagai garis dasar.
Model manakah yang membuat GRPO terkenal?
GRPO diperkenalkan dan dipopulerkan oleh DeepSeek, terutama di DeepSeekMath dan sebagai mesin RL di balik model penalaran DeepSeek-R1.
Apa peran istilah KL-divergence dalam GRPO?
Penalti KL terhadap model acuan (biasanya pra-RL) mengatur pelatihan sehingga kebijakan menjadi lebih baik tanpa menyebabkan keruntuhan atau penurunan keluaran.
Mengapa GRPO sangat menarik untuk melatih model penalaran matematika atau kode?
Mengambil sampel banyak solusi dan menilai solusi tersebut dengan pemeriksaan kebenaran otomatis yang berpasangan dengan keunggulan GRPO yang dinormalisasi grup, tidak diperlukan kritik.