Teknik KILAVUZ

Grup Göreli Politika Optimizasyonu

Grup Göreli Politika Optimizasyonu (GRPO), PPO tarafından kullanılan ayrı değer ağını ortadan kaldırarak, her yanıtı aynı istemdeki bir grup kardeş yanıta göre değerlendiren dil modellerinde ince ayar yapmaya yönelik bir takviyeli öğrenme yöntemidir.

2 min readSon güncelleme

Genel Bakış

It became famous as the core training trick behind DeepSeek's reasoning models.

Derin Dalış

GRPO, büyük dil modellerinde RL'nin ince ayarını daha ucuz ve daha kararlı hale getirmek için tasarlanmış politika aşamalı takviyeli öğrenmenin bir çeşididir. Standart PPO'nun, her bir tokenın ne kadar iyi olduğunu tahmin etmek için kabaca politikanın kendisi kadar büyük, bilgili bir 'eleştirmene' (değer modeli) ihtiyacı vardır. GRPO bu eleştirmeni tamamen ortadan kaldırır. Her bir istem için bir grup tamamlamayı (mesela 8-64) örnekliyor, hepsini bir ödül sinyaliyle puanlıyor ve ardından ödülünü grubun ortalamasına ve standart sapmasına göre standartlaştırarak her tamamlamanın avantajını hesaplıyor. Ortalamanın üzerindeki cevaplar güçlendirilir, ortalamanın altındaki cevaplar bastırılır. KL-ıraksama terimi, modeli bir referans politikasına yakın tutar. DeepSeek tarafından tanıtılan bu model, DeepSeekMath ve DeepSeek-R1 akıl yürütme modellerini güçlendirdi.

Teknik Bilgi

Ana fikir, PPO'nun öğrenilmiş değer temel çizgisini Monte Carlo grup temel çizgisiyle değiştirmektir. R_i ödüllerine sahip bir grup çıktı için her avantaj A_i = (r_i - ortalama(r)) / std(r)'dir. Bu normalleştirilmiş puan, tıpkı PPO'da olduğu gibi kırpılmış olasılık oranını çarpar ve donmuş bir referans modeline karşı bir KL cezası, sapmayı frenler. Hiçbir eleştirmen eğitilmediği için bellek ve bilgi işlem kabaca yarı yarıya azalır ve istem başına normalleştirme, doğal olarak ölçeklendirilmiş, düşük varyanslı avantajlar sağlar.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Grup Göreli Politika Optimizasyonunun Geleceği

GRPO, açık muhakeme modellerini eğitmek için hızla varsayılan bir yöntem haline geldi ve laboratuvarlar onun zayıf noktalarını yineliyor. Araştırmacılar uzunluk ve zorluk önyargıları (Dr. GRPO gibi), dizi düzeyinde normalleştirme yerine belirteç düzeyinde düzeltmeler ve KL terimini kaldırma veya yeniden şekillendirme için düzeltmeler araştırıyorlar. Doğrulanabilir ödüllerle (matematik, kod, araç kullanımı), seyrek sinyallerin daha iyi işlenmesiyle ve grup temellerini aracılı, çok adımlı görevler için hafif eleştirilerle birleştiren hibritlerle daha sıkı entegrasyon bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Matematik problemlerinde kurala dayalı doğruluk ödüllerini kullanarak uzun düşünce zinciri muhakemesi üretmek için DeepSeek-R1 ve DeepSeekMath'i eğitmek

Örneklenen her çözümün birim testleri geçip geçmediğine göre puanlandığı ve grubun kazananları seçecek şekilde normalleştirildiği kod oluşturma modellerinde ince ayar yapılması

Ayrı bir değer ağı için ödeme yapmadan sohbet modellerini uyumlu hale getirmek için GRPO kullanan açık kaynaklı RLHF işlem hatları (ör. TRL ve sürüm kitaplıklarında)

Komut istemi başına çeşitli yanıtları örnekleyerek ve ödül modelinin akranlarına göre en yüksek puan verdiği yanıtları ödüllendirerek talimat izleme veya güvenlik davranışını iyileştirmek

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Group Relative Policy Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Yakınsal Politika Optimizasyonu

Sık sorulan sorular

What is Group Relative Policy Optimization?

Grup Göreli Politika Optimizasyonu (GRPO), PPO tarafından kullanılan ayrı değer ağını ortadan kaldırarak, her yanıtı aynı istemdeki bir grup kardeş yanıta göre değerlendiren dil modellerinde ince ayar yapmaya yönelik bir takviyeli öğrenme yöntemidir. DeepSeek'in muhakeme modellerinin ardındaki temel eğitim hilesi olarak ünlendi.

GRPO, PPO'nun hangi ana bileşenini ortadan kaldırır?

GRPO'nun imza değişikliği, normalde politikayla hemen hemen aynı boyutta olan PPO'nun öğrenilmiş değer/eleştirme modelini düşürüyor ve önemli miktarda bellek ve işlem tasarrufu sağlıyor.

GRPO belirli bir tamamlamanın avantajını nasıl hesaplar?

Her tamamlamanın avantajı (ödül - grup ortalaması) / grup standart sapmasıdır, dolayısıyla aynı istemin yanıt grubu temel olarak hareket eder.

Hangi modeller GRPO'nun tanınmasını sağladı?

GRPO, DeepSeek tarafından, özellikle DeepSeekMath'te ve DeepSeek-R1 akıl yürütme modellerinin arkasındaki RL motoru olarak tanıtıldı ve popüler hale getirildi.

GRPO'da KL-ıraksama teriminin rolü nedir?

Bir referans (genellikle RL öncesi) modeline karşı KL cezası, politikanın çökmeden veya yozlaşmış çıktılara sürüklenmeden gelişmesini sağlayacak şekilde eğitimi düzenli hale getirir.

GRPO neden matematik veya kodla ilgili muhakeme modellerinin eğitimi için özellikle çekici?

Birçok çözümün örneklenmesi ve bunların otomatik doğruluk kontrolleriyle puanlanması, GRPO'nun grup normalleştirilmiş avantajlarıyla temiz bir şekilde eşleşir, hiçbir eleştiriye gerek yoktur.