PANDUAN Teknis

Optimasi Kebijakan Relatif Grup

Pengoptimalan Kebijakan Relatif Grup (GRPO) adalah metode pembelajaran penguatan untuk menyempurnakan model bahasa yang menilai setiap jawaban berdasarkan sekelompok jawaban saudara terhadap perintah yang sama, menghilangkan jaringan nilai terpisah yang digunakan oleh PPO.

2 min readTerakhir diperbarui

Ikhtisar

It became famous as the core training trick behind DeepSeek's reasoning models.

Menyelam Lebih Dalam

GRPO adalah varian pembelajaran penguatan gradien kebijakan yang dirancang untuk membuat penyesuaian RL pada model bahasa besar menjadi lebih murah dan stabil. PPO standar memerlukan 'kritikus' (model nilai) yang terpelajar, yang kira-kira sama besarnya dengan kebijakan itu sendiri, untuk memperkirakan seberapa baik setiap token. GRPO menghilangkan kritik tersebut sepenuhnya. Untuk setiap perintah, ia mengambil sampel sekelompok penyelesaian (katakanlah 8-64), menilai semuanya dengan sinyal imbalan, lalu menghitung keuntungan setiap penyelesaian dengan membakukan imbalannya terhadap rata-rata dan deviasi standar kelompok tersebut. Jawaban yang di atas rata-rata akan diperkuat dan jawaban yang di bawah rata-rata akan dihilangkan. Istilah KL-divergence membuat model tetap dekat dengan kebijakan acuan. Diperkenalkan oleh DeepSeek, ini mendukung model penalaran DeepSeekMath dan DeepSeek-R1.

Wawasan Teknis

Ide utamanya adalah mengganti data dasar nilai yang dipelajari PPO dengan data dasar grup Monte Carlo. Untuk sekelompok keluaran dengan imbalan r_i, masing-masing keuntungannya adalah A_i = (r_i - mean(r)) / std(r). Skor yang dinormalisasi tersebut mengalikan rasio probabilitas yang terpotong, persis seperti pada PPO, dan penalti KL terhadap model referensi yang dibekukan membatasi penyimpangan. Karena tidak ada kritikus yang dilatih, memori dan komputasi berkurang setengahnya, dan normalisasi per-prompt memberikan keuntungan dengan skala alami dan variansi rendah.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Optimalisasi Kebijakan Relatif Grup

GRPO dengan cepat menjadi resep standar untuk melatih model penalaran terbuka, dan laboratorium terus mengulangi titik lemahnya. Para peneliti sedang menjajaki perbaikan untuk bias panjang dan kesulitan (seperti Dr. GRPO), normalisasi tingkat token daripada tingkat urutan, dan menghilangkan atau membentuk kembali istilah KL. Harapkan integrasi yang lebih erat dengan imbalan yang dapat diverifikasi (matematika, kode, penggunaan alat), penanganan sinyal jarang yang lebih baik, dan hibrida yang menggabungkan garis dasar grup dengan kritik ringan untuk tugas-tugas yang bersifat agen dan multi-langkah.

Implementasi Dunia Nyata

Melatih DeepSeek-R1 dan DeepSeekMath untuk menghasilkan penalaran rantai pemikiran yang panjang menggunakan penghargaan kebenaran berbasis aturan pada soal matematika

Menyempurnakan model pembuatan kode di mana setiap solusi sampel diberi skor berdasarkan apakah solusi tersebut lulus pengujian unit, dan grup dinormalisasi untuk memilih pemenang

Pipeline RLHF sumber terbuka (misalnya, di perpustakaan TRL dan verl) menggunakan GRPO untuk menyelaraskan model obrolan tanpa membayar jaringan nilai terpisah

Meningkatkan kepatuhan terhadap instruksi atau perilaku keselamatan dengan mengambil contoh beberapa respons per perintah dan memberikan penghargaan kepada respons yang diberikan model penghargaan dengan nilai tertinggi dibandingkan rekan-rekan mereka

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Optimalisasi Kebijakan Proksimal

Pertanyaan yang sering diajukan

What is Group Relative Policy Optimization?

Pengoptimalan Kebijakan Relatif Grup (GRPO) adalah metode pembelajaran penguatan untuk menyempurnakan model bahasa yang menilai setiap jawaban berdasarkan sekelompok jawaban saudara terhadap perintah yang sama, menghilangkan jaringan nilai terpisah yang digunakan oleh PPO. Ini menjadi terkenal sebagai trik pelatihan inti di balik model penalaran DeepSeek.

Komponen utama PPO apa yang dihilangkan GRPO?

Perubahan khas GRPO adalah menghilangkan model nilai/kritik yang dipelajari PPO, yang biasanya berukuran sama dengan kebijakan, sehingga menghemat banyak memori dan komputasi.

Bagaimana GRPO menghitung keuntungan untuk penyelesaian tertentu?

Keuntungan setiap penyelesaian adalah (hadiah - rata-rata kelompok) / deviasi standar kelompok, sehingga kelompok jawaban terhadap perintah yang sama bertindak sebagai garis dasar.

Model manakah yang membuat GRPO terkenal?

GRPO diperkenalkan dan dipopulerkan oleh DeepSeek, terutama di DeepSeekMath dan sebagai mesin RL di balik model penalaran DeepSeek-R1.

Apa peran istilah KL-divergence dalam GRPO?

Penalti KL terhadap model acuan (biasanya pra-RL) mengatur pelatihan sehingga kebijakan menjadi lebih baik tanpa menyebabkan keruntuhan atau penurunan keluaran.

Mengapa GRPO sangat menarik untuk melatih model penalaran matematika atau kode?

Mengambil sampel banyak solusi dan menilai solusi tersebut dengan pemeriksaan kebenaran otomatis yang berpasangan dengan keunggulan GRPO yang dinormalisasi grup, tidak diperlukan kritik.