Dil AI KILAVUZU

Doğrudan Tercih Optimizasyonu

Doğrudan Tercih Optimizasyonu (DPO), ayrı bir ödül modeli eğitmeden veya takviyeli öğrenmeyi çalıştırmadan, dil modellerini insan tercihleriyle uyumlu hale getirmenin bir yoludur.

2 min readSon güncelleme

Genel Bakış

It collapses a complex multi-stage pipeline into a single, stable training loss.

Derin Dalış

Rafailov ve Stanford'daki meslektaşları tarafından 2023'te tanıtılan DPO, insanların tercih ettiği bir modeli nasıl öğrettiğimizi yeniden düşünüyor. Geleneksel yaklaşım (RLHF), insan karşılaştırmaları üzerine bir ödül modeli eğitir ve ardından bu ödülü en üst düzeye çıkarmak için takviyeli öğrenmeyi kullanır. DPO'nun temel görüşü matematikseldir: Bu RLHF hedefi kapsamındaki en uygun politikanın ödülle kapalı formda bir ilişkisi vardır, böylece denklemleri yeniden düzenleyebilir ve dil modelini doğrudan tercih çiftleri üzerinde optimize edebilirsiniz. Ona bir uyarı, bir 'seçilmiş' (tercih edilen) yanıt ve bir 'reddedilmiş' yanıt verirsiniz ve basit bir sınıflandırma tarzı kayıp, seçilen yanıtı nispeten daha olası hale getirmek için modeli dürtükler. Ödül modeli yok, örnekleme döngüsü yok, ödül hackleme yok. Çalıştırılması çok daha basit ve daha kararlı.

Teknik Bilgi

DPO, tercih çiftleri üzerinde ikili çapraz entropi kaybını kullanır. Seçilen yanıtın reddedilen yanıta göre log-olasılık oranını artırır; her biri donmuş bir referans modeline (genellikle denetimli-ince ayarlı başlangıç ​​noktası) göre ölçülür. Bir sıcaklık parametresi beta, politikanın bu referanstan ne kadar uzaklaşabileceğini kontrol ederek RLHF'nin açıkça uyguladığı KL kısıtlamasını örtülü olarak zorlar. Ödül asla gerçekleşmez; politikanın kendi günlük olasılıklarında örtülüdür.

Stratejik Etki

Speed and scale

Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.

Access and reach

Diller ve iletişim tarzları arasında erişimi genişletir.

Daha net kararlar

Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.

Doğrudan Tercih Optimizasyonunun Geleceği

DPO, ucuz ve tekrarlanabilir olması nedeniyle varsayılan bir hizalama yöntemi haline geldi ve bir değişken ailesi ortaya çıkardı: IPO, neredeyse deterministik tercihlere aşırı uyum sağlamayı düzeltiyor, KTO, çiftler yerine tek iyi veya kötü etiketlerinden öğreniyor ve ORPO, tercih öğrenimini referans modeli olmayan ince ayara katlıyor. Tam çevrimiçi RLHF ile kalan boşluğun daraltılması için DPO'nun politikaya ilişkin verilerle ve uzunluk/kalite ayrımının azaltılmasıyla birleştirilmesine yönelik çalışmaların devam etmesini bekliyoruz.

Gerçek Dünya Uygulaması

Tercih veri kümelerinde DPO ile uyumlu hale getirilen Zephyr ve birçok Llama ve Mistral türevi gibi açık ağırlıklı sohbet modellerinde ince ayar yapılması

Sorunlu yanıt yerine güvenli, yararlı yanıtın 'seçildiği' çiftleri kullanarak zararlı veya yararsız çıktıları azaltmak

Geliştirici tarafından derecelendirilmiş karşılaştırmalar kullanarak bir kodlama asistanına hatalı çözümler yerine doğru, iyi belgelenmiş çözümleri tercih etmesini öğretmek

Modellerin ayrıntılı veya halüsinasyonlu özetler yerine kısa ve aslına sadık özetleri tercih etmesi için özetleme stilinin ayarlanması

Riskler ve Korkuluklar

Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.

İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.

Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.

Uygulama Yol Haritası

1

Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.

2

Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.

3

Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.

4

Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Direct Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Oran Oranı Tercihi Optimizasyonu

Sık sorulan sorular

What is Direct Preference Optimization?

Doğrudan Tercih Optimizasyonu (DPO), ayrı bir ödül modeli eğitmeden veya takviyeli öğrenmeyi çalıştırmadan, dil modellerini insan tercihleriyle uyumlu hale getirmenin bir yoludur. Karmaşık, çok aşamalı bir boru hattını tek ve istikrarlı bir eğitim kaybına dönüştürür.

Geleneksel RLHF ile karşılaştırıldığında DPO neyi ortadan kaldırır?

DPO'nun ana avantajı, açık ödül modelini ve RL örnekleme döngüsünü kaldırarak politikayı doğrudan tercih çiftlerine göre optimize etmesidir.

Tek bir DPO eğitim örneği hangi verilerden oluşur?

DPO tercih çiftleri üzerinde eğitim verir: bir istem artı bir tercih edilen ("seçilen") ve bir tercih edilmeyen ("reddedilen") yanıt.

Referans modelinin DPO'daki rolü nedir?

Dondurulmuş bir referans (tipik olarak SFT modeli) kaybı sabitler; beta parametresi, eğitilen politikanın ondan ne kadar uzaklaşabileceğini kontrol eder.

DPO'da 'ödül' nerede temsil edilir?

DPO'nun türetilmesi, ödülün politika ve referans arasındaki log-olasılık oranında örtülü olduğunu gösterir, dolayısıyla açık bir ödül modeline gerek yoktur.

DPO kontrolünde beta (sıcaklık) parametresi ne işe yarar?

Beta, örtülü KL kısıtlamasını yönetir: daha yüksek beta, politikayı referansa daha yakın tutar, daha düşük beta ise daha fazla sapmaya izin verir.