Oran Oranı Tercihi Optimizasyonu
Oran Oranı Tercih Optimizasyonu (ORPO), tek bir eğitim geçişinde bir dil modeline iyi davranışı ve insan tercihlerini öğreten bir ince ayar yöntemidir.
Genel Bakış
It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.
Derin Dalış
Hong, Lee ve Thorne tarafından 2024'te tanıtılan ORPO, denetimli ince ayar ve tercih hizalamasını tek adımda birleştiriyor. Çoğu hizalama işlem hattı ilk olarak iyi örnekler üzerinde SFT yapar, ardından modelin dondurulmuş bir kopyasını (bir referans) artı kayıtlı tercih çiftlerini gerektiren RLHF veya DPO gibi ikinci bir yöntemi çalıştırır. ORPO referans modelini tamamen kaldırır. Kaybı, standart sonraki jeton hedefine bir ceza terimi ekler: modelin seçilen (tercih edilen) yanıta atadığı olasılıkları artırırken, reddedilen yanıtın olasılığını düşürür. Güçlü bir log-olasılık farkı yerine olasılık oranını kullandığı için ceza hafiftir, bu nedenle model, akıcı nesli felaketle unutmadan iyi cevapları tercih etmeyi öğrenir.
Teknik Bilgi
ORPO'nun kaybı, SFT çapraz entropi kaybı artı seçilen ve reddedilen yanıtlar arasındaki log olasılık oranının ağırlıklı log-sigmoididir. Oranlar p/(1-p)'ye eşittir; dolayısıyla oran, modelin kötü yanıta karşı iyi yanıtı bulma olasılığının ne kadar yüksek olduğunu karşılaştırır. Ham olasılık yerine olasılıkların kullanılması kontrastı hafif tutar, bu da referans verilmeyen bir modeli bozabilecek reddedilen tokenların aşırı bastırılmasını önler.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Olasılık Oranı Tercih Optimizasyonunun Geleceği
ORPO, sınırlı donanım üzerinde ince ayar yapan ekipler için cazip olan referans modelini bırakarak hafızayı ve hesaplamayı azalttığı için ilgi kazanıyor. Açık kaynaklı tariflerde daha sık ve Hugging Face TRL gibi kitaplıklarda varsayılan seçenek olarak görünmesini bekleyin. Gelecekteki çalışmalar muhtemelen lambda ağırlıklandırmasını otomatik olarak ayarlayacak, ORPO'yu diğer referanssız hedeflerle harmanlayacak ve bunu iki kopyayı bellekte tutmanın maliyetli olduğu çok modlu ve çok büyük modellere genişletecek.
Gerçek Dünya Uygulaması
Açık kaynaklı bir 7B sohbet modeline ikinci bir referans kopyası yüklemeden tercih çiftlerinde ince ayar yapılması, GPU belleğinin yarıya indirilmesi
Bir müşteri destek asistanını, SFT ve ardından DPO yerine tek bir eğitim çalıştırmasında kibar, politikaya uygun yanıtları tercih edecek şekilde ayarlayan bir girişim
Daha düşük bilgi işlemle karşılaştırılabilir uyum göstermek için aynı veri kümesinde ORPO'yu DPO ile karşılaştıran araştırmacılar
Temel modeli, iyi ve kötü örnek çiftlerinin mevcut olduğu ancak ödül modeli bütçesinin bulunmadığı özel bir alana (örneğin, yasal taslak hazırlama) uyarlamak
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Odds Ratio Preference Optimization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Doğrudan Tercih Optimizasyonu
Sık sorulan sorular
What is Odds Ratio Preference Optimization?
Oran Oranı Tercih Optimizasyonu (ORPO), tek bir eğitim geçişinde bir dil modeline iyi davranışı ve insan tercihlerini öğreten bir ince ayar yöntemidir. Bu önemlidir çünkü olağan ayrı ödül modelini ve referans modelini atlayarak hizalamayı daha ucuz ve daha basit hale getirir.
ORPO'nun DPO gibi yöntemlere göre temel pratik avantajı nedir?
ORPO, tercih öğrenimini SFT kaybına katlar ve modelin dondurulmuş bir referans kopyasına ihtiyaç duymaz, böylece bellek ve işlem tasarrufu sağlanır.
ORPO'daki 'olasılık oranı' neyi karşılaştırır?
ORPO, modelin tercih edilen cevaba karşı tercih edilmeyen cevaba atadığı olasılık oranını (p/(1-p)) kullanır.
ORPO tek bir eğitim geçişinde hangi iki görevi gerçekleştirir?
ORPO, standart SFT sonraki jeton hedefini tek bir birleşik kayıpta tercih cezasıyla birleştirir.
ORPO neden ceza için ham log-olasılık farkı yerine olasılıkları kullanıyor?
Olasılığa dayalı ceza daha hafiftir ve referanssız modelin iyi cevapları tercih ederken akıcı nesil tutmasına yardımcı olur.
ORPO kaybı en iyi şekilde hangi kombinasyonla tanımlanır?
ORPO, denetlenen çapraz entropi kaybının üzerine ağırlıklı bir log-sigmoid olasılık oranı terimi ekler.