Dil AI KILAVUZU

Oran Oranı Tercihi Optimizasyonu

Oran Oranı Tercih Optimizasyonu (ORPO), tek bir eğitim geçişinde bir dil modeline iyi davranışı ve insan tercihlerini öğreten bir ince ayar yöntemidir.

2 min readSon güncelleme

Genel Bakış

It matters because it skips the usual separate reward model and reference model, making alignment cheaper and simpler.

Derin Dalış

Hong, Lee ve Thorne tarafından 2024'te tanıtılan ORPO, denetimli ince ayar ve tercih hizalamasını tek adımda birleştiriyor. Çoğu hizalama işlem hattı ilk olarak iyi örnekler üzerinde SFT yapar, ardından modelin dondurulmuş bir kopyasını (bir referans) artı kayıtlı tercih çiftlerini gerektiren RLHF veya DPO gibi ikinci bir yöntemi çalıştırır. ORPO referans modelini tamamen kaldırır. Kaybı, standart sonraki jeton hedefine bir ceza terimi ekler: modelin seçilen (tercih edilen) yanıta atadığı olasılıkları artırırken, reddedilen yanıtın olasılığını düşürür. Güçlü bir log-olasılık farkı yerine olasılık oranını kullandığı için ceza hafiftir, bu nedenle model, akıcı nesli felaketle unutmadan iyi cevapları tercih etmeyi öğrenir.

Teknik Bilgi

ORPO'nun kaybı, SFT çapraz entropi kaybı artı seçilen ve reddedilen yanıtlar arasındaki log olasılık oranının ağırlıklı log-sigmoididir. Oranlar p/(1-p)'ye eşittir; dolayısıyla oran, modelin kötü yanıta karşı iyi yanıtı bulma olasılığının ne kadar yüksek olduğunu karşılaştırır. Ham olasılık yerine olasılıkların kullanılması kontrastı hafif tutar, bu da referans verilmeyen bir modeli bozabilecek reddedilen tokenların aşırı bastırılmasını önler.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Olasılık Oranı Tercih Optimizasyonunun Geleceği

ORPO, sınırlı donanım üzerinde ince ayar yapan ekipler için cazip olan referans modelini bırakarak hafızayı ve hesaplamayı azalttığı için ilgi kazanıyor. Açık kaynaklı tariflerde daha sık ve Hugging Face TRL gibi kitaplıklarda varsayılan seçenek olarak görünmesini bekleyin. Gelecekteki çalışmalar muhtemelen lambda ağırlıklandırmasını otomatik olarak ayarlayacak, ORPO'yu diğer referanssız hedeflerle harmanlayacak ve bunu iki kopyayı bellekte tutmanın maliyetli olduğu çok modlu ve çok büyük modellere genişletecek.

Gerçek Dünya Uygulaması

Açık kaynaklı bir 7B sohbet modeline ikinci bir referans kopyası yüklemeden tercih çiftlerinde ince ayar yapılması, GPU belleğinin yarıya indirilmesi

Bir müşteri destek asistanını, SFT ve ardından DPO yerine tek bir eğitim çalıştırmasında kibar, politikaya uygun yanıtları tercih edecek şekilde ayarlayan bir girişim

Daha düşük bilgi işlemle karşılaştırılabilir uyum göstermek için aynı veri kümesinde ORPO'yu DPO ile karşılaştıran araştırmacılar

Temel modeli, iyi ve kötü örnek çiftlerinin mevcut olduğu ancak ödül modeli bütçesinin bulunmadığı özel bir alana (örneğin, yasal taslak hazırlama) uyarlamak

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Odds Ratio Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Doğrudan Tercih Optimizasyonu

Sık sorulan sorular

What is Odds Ratio Preference Optimization?

Oran Oranı Tercih Optimizasyonu (ORPO), tek bir eğitim geçişinde bir dil modeline iyi davranışı ve insan tercihlerini öğreten bir ince ayar yöntemidir. Bu önemlidir çünkü olağan ayrı ödül modelini ve referans modelini atlayarak hizalamayı daha ucuz ve daha basit hale getirir.

ORPO'nun DPO gibi yöntemlere göre temel pratik avantajı nedir?

ORPO, tercih öğrenimini SFT kaybına katlar ve modelin dondurulmuş bir referans kopyasına ihtiyaç duymaz, böylece bellek ve işlem tasarrufu sağlanır.

ORPO'daki 'olasılık oranı' neyi karşılaştırır?

ORPO, modelin tercih edilen cevaba karşı tercih edilmeyen cevaba atadığı olasılık oranını (p/(1-p)) kullanır.

ORPO tek bir eğitim geçişinde hangi iki görevi gerçekleştirir?

ORPO, standart SFT sonraki jeton hedefini tek bir birleşik kayıpta tercih cezasıyla birleştirir.

ORPO neden ceza için ham log-olasılık farkı yerine olasılıkları kullanıyor?

Olasılığa dayalı ceza daha hafiftir ve referanssız modelin iyi cevapları tercih ederken akıcı nesil tutmasına yardımcı olur.

ORPO kaybı en iyi şekilde hangi kombinasyonla tanımlanır?

ORPO, denetlenen çapraz entropi kaybının üzerine ağırlıklı bir log-sigmoid olasılık oranı terimi ekler.