Temel Bilgiler KILAVUZU

Tercih Optimizasyonunda Uzunluk Normalleştirmesi

Uzunluk normalizasyonu, tercih ayarlama hedeflerini ayarlayarak modellerin yalnızca daha uzun yanıtlar yazarak onay almasını engeller.

2 min readSon güncelleme

Genel Bakış

It matters because uncorrected reward signals push chatbots toward verbose, padded responses instead of genuinely better ones.

Derin Dalış

Modeller RLHF veya DPO gibi yöntemlerle uyumlu hale getirildiğinde, insanların (veya bir ödül modelinin) iki yanıttan 'daha iyi' olanı seçtiği karşılaştırmalardan öğrenirler. Kalıcı bir hata, aslında daha iyi olmasalar bile daha uzun yanıtların tercih edilme eğiliminde olmasıdır, bu nedenle model kısayolu öğrenir: uzun uzun. Uzunluk normalizasyonu buna karşı koyar. DPO'da örtülü ödül, uzunlukla birlikte mekanik olarak büyüyen, jeton başına log olasılık farklarının toplamıdır. Uzunluğu normalleştirilmiş DPO ve SimPO gibi varyantlar, bu ödülü jeton sayısına böler ve bunun yerine jeton başına ortalama puan alır. Sonuç, hedefe ulaşmak için tepkileri şişirmek yerine kısa ve öz kalan modellerdir.

Teknik Bilgi

DPO'nun örtülü ödülü, yanıttaki her belirteç üzerinden toplanan, ayarlanan ve referans politikalar arasındaki log oranıdır. Her jeton başka bir (genellikle pozitif) terim eklediğinden, ham ödül, dizi uzunluğuna göre ölçeklenir ve optimizasyonu daha uzun tamamlamalara doğru yönlendirir. SimPO referans modelini bırakır ve ödül olarak token başına ortalama log olasılığını ve hedef ödül marjını kullanır. Uzunluğa göre bölmek mekanik uzunluk avantajını ortadan kaldırır, dolayısıyla tercih gradyanları kelime sayısından ziyade kaliteyi yansıtır.

Stratejik Etki

Daha net kararlar

Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.

Maliyet ve bütçe

Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.

Ekip ve iş akışı

Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.

Tercih Optimizasyonunda Uzunluk Normalleştirmenin Geleceği

Uzunluk kontrolünün sonradan düşünülmek yerine standart bir düğme haline gelmesini bekleyin. Araştırmacılar, gerçek kalite kazanımlarını ölçmek için uzunluk normalizasyonunu açık uzunluk cezaları, uzunluğa bağlı ödüller ve cevap uzunluğunu sabit tutan değerlendirme paketleriyle birleştiriyor. Ödül modelleri ayrıntı yanlılığını tespit etmede daha iyi hale geldikçe, hizalama hatları büyük ihtimalle varsayılan olarak uzunluğa dayalı kazanma oranlarını raporlayacak ve kullanıcılar bir modelin yanıtlarının ne kadar kısa veya ayrıntılı olması gerektiği konusunda daha iyi kontrol sahibi olacak.

Gerçek Dünya Uygulaması

Müşteri destek asistanını SimPO ile ayarlayarak yalnızca kapsamlı görünen paragraflar yerine net, doğru yanıtlar vermesini sağlayın.

AlpacaEval 2'de 'uzunluk kontrollü kazanma oranı' raporlanarak daha konuşkan bir model olmaktan ziyade gerçekten geliştirilmiş bir model gösterildi.

Bir kodlama modelinde ince ayar yapılırken DPO'ya uzunluk normalizasyonu ekleniyor, böylece şişirilmiş standart metin yerine minimum doğru parçacıklar döndürülüyor.

Daha uzun makaleleri sistematik olarak daha yüksek puanlara kavuşturan bir ödül modelinin teşhis edilmesi, ardından bunu bir yazma asistanına uyum sağlamak için kullanmadan önce önyargılarının azaltılması.

Riskler ve Korkuluklar

Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.

Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.

Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.

Uygulama Yol Haritası

1

İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.

2

Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.

3

Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.

4

Tercih Optimizasyonundaki Uzunluk Normalleştirmesinin nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Length Normalization in Preference Optimization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Oran Oranı Tercihi Optimizasyonu

Sık sorulan sorular

What is Length Normalization in Preference Optimization?

Uzunluk normalizasyonu, tercih ayarlama hedeflerini ayarlayarak modellerin yalnızca daha uzun yanıtlar yazarak onay almasını engeller. Bu önemlidir çünkü düzeltilmemiş ödül sinyalleri, sohbet robotlarını gerçekten daha iyi yanıtlar yerine ayrıntılı, dolgulu yanıtlara doğru iter.

DPO'daki uzunluk normalleştirmesi öncelikli olarak hangi istenmeyen davranışı önlemeyi amaçlamaktadır?

DPO'nun örtülü ödülü jeton sayısıyla birlikte artar, dolayısıyla normalleştirme olmadan modeller, daha ayrıntılı olmanın tercih karşılaştırmalarını kazanma eğiliminde olduğunu öğrenir.

Standart DPO'nun örtülü ödülü neden yanıt süresi arttıkça artma eğilimindedir?

Örtülü ödül, her jetondaki log-olasılık oranlarını toplar, dolayısıyla daha fazla jeton genellikle daha büyük bir toplam ödül anlamına gelir.

SimPO uzunluk yanlılığını nasıl ele alıyor?

SimPO, yanıtları ortalama (uzunluğa göre normalleştirilmiş) log olasılıklarına göre puanlar ve bir hedef ödül marjı ekleyerek mekanik uzunluk avantajını ortadan kaldırır.

Hangi değerlendirme uygulaması, yalnızca uzunluktan ziyade kalite açısından iyileştirilmiş bir modelin doğrulanmasına yardımcı olur?

Uzunluk kontrollü kazanma oranı (AlpacaEval 2'de olduğu gibi), yanıt uzunluğuna göre ayarlanır, böylece kazançlar ayrıntıyı değil kaliteyi yansıtır.