Reddetme Örnekleme İnce Ayarı
Reddetme Örneklemesi İnce Ayarı (RFT), birçok aday yanıtı üretir, yalnızca en iyi puanı alan yanıtları tutar ve modeli bu kazananlar üzerinde yeniden eğitir.
Genel Bakış
It matters because it offers much of RLHF's benefit using straightforward supervised learning instead of complex reinforcement learning.
Derin Dalış
Bazen N'nin en iyisi ince ayarı olarak da adlandırılan Reddet Örnekleme İnce Ayarı, Meta'nin Llama 2 ve Llama 3'ünün nasıl hizalandığına dair önemli bir bileşendir. Tarif basittir: Her istem için, mevcut modelden birkaç yanıt (örneğin 4'ten 64'e kadar) örnekleyin, her birini bir ödül modeliyle veya otomatik bir denetleyiciyle puanlayın, ardından en üst sıradaki çıktılar dışındakilerin hepsini atın ('reddedin'). Hayatta kalan yüksek kaliteli örnekler, denetlenen yeni bir ince ayar veri kümesi haline gelir ve model, sıradan bir sonraki simge kaybıyla bunlar üzerinde eğitilir. Bu döngünün yinelenerek tekrarlanması, modeli kendi başına daha iyi yanıtlar üretmeye doğru iter. Model kendi filtrelenmiş çıktılarından öğrendiğinden, RFT, bir ödül sinyalinden yararlanmaya devam ederken, politika kademeli RL'nin istikrarsızlığından ve ayarlama sıkıntılarından kaçınır.
Teknik Bilgi
RFT, birçok kez örnekleme yapılması ve maksimum ödül yanıtını korumanın, keskinleştirilmiş, daha yüksek kaliteli bir dağıtımdan seçim yapmaya yakın olduğu gerçeğinden yararlanır. Bu kazananlar üzerinde standart çapraz entropi yoluyla eğitim, N'nin en iyisi olan davranışı etkili bir şekilde modelin tek örnek çıktılarına geri dönüştürür. Matematik veya kod gibi doğrulanabilir alanlar için 'ödül', son yanıtın veya birim testinin geçip geçmediği olabilir ve öğrenilmiş bir ödül modeline olan ihtiyacı tamamen ortadan kaldırır.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Reddetme Örneklemesinin Geleceği İnce Ayarı
RFT, modern eğitim sonrası eğitimin merkezinde yer alır ve sıklıkla PPO ve DPO gibi RL yöntemlerinden önce veya bunlarla birlikte kullanılır. Ucuz çıkarım ve güçlü otomatik doğrulayıcılarla çekiciliği artıyor: Modeller kendi kendini oluşturma ve kendi kendini denetleme konusunda daha iyi hale geldikçe, yinelenen reddetme örneklemesi sentetik verileri ve kendi kendini geliştirme döngülerini destekliyor. Doğrulanabilir düşünce zincirleri üreten akıl yürütme modelleriyle daha sıkı entegrasyon ve bir modelin kendi çıktıları üzerinde tekrar tekrar eğitim alırken ödül korsanlığının ve çeşitliliğin çökmesinin nasıl önleneceğine dair devam eden çalışmalar bekleyebilirsiniz.
Gerçek Dünya Uygulaması
Her istemde birden fazla yanıt örnekleyerek, en yüksek ödül modeli puanlarını koruyarak ve ardından bunlar üzerinde SFT yaparak Lama tarzı modelleri hizalamak
Birçok çözüm üreterek ve yalnızca doğru, kontrol edilebilir cevaba ulaşanları tutarak bir matematik çözücüyü geliştirmek
Adayların yalnızca birim testleri geçmeleri durumunda tutulduğu ve daha sonra eğitim verileri olarak kullanıldığı kod oluşturma
Bir sonraki eğitim turu için modelin kendi ürettiği en iyi yanıtları filtreleyerek sentetik talimat veri kümeleri oluşturma
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Rejection Sampling Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
QLoRA ve 4-Bit İnce Ayar
Sık sorulan sorular
What is Rejection Sampling Fine-Tuning?
Reddetme Örneklemesi İnce Ayarı (RFT), birçok aday yanıtı üretir, yalnızca en iyi puanı alan yanıtları tutar ve modeli bu kazananlar üzerinde yeniden eğitir. Bu önemlidir çünkü karmaşık takviyeli öğrenme yerine basit denetimli öğrenmeyi kullanarak RLHF'nin faydalarının çoğunu sunar.
Reddetme Örneklemesi İnce Ayarının temel fikri nedir?
RFT birden fazla yanıtı örnekler, en yüksek puanı alan yanıtları filtreler ve kazananlara göre modelde ince ayarlar yapar.
Matematik veya kod gibi doğrulanabilir alanlarda ödül olarak ne işe yarayabilir?
Kontrol edilebilir görevler için RFT, öğrenilmiş bir ödül modelinden kaçınarak kesin doğruluğu veya geçen birim testlerini kullanabilir.
Hizalama sırasında hangi model ailesi ünlü olarak ret örneklemesini kullandı?
Meta, Llama 2 ve Llama 3 modellerine yönelik eğitim sonrası tarifin bir parçası olarak ret örneklemesinin kullanıldığını açıkladı.
Ekipler neden PPO gibi politika aşamalı RL yerine RFT'yi tercih edebilir?
RFT, filtrelenmiş örneklerde standart sonraki jeton kaybıyla yeniden eğitim alarak, politika aşamalı yöntemlerin ayarlama zorluğunu ve istikrarsızlığını ortadan kaldırır.
Maksimum ödül örneklerine ilişkin eğitim etkili bir şekilde ne işe yarar?
Model, en üst düzeyde filtrelenen yanıtlardan öğrenerek, tek bir nesilde daha yüksek kaliteli davranışı içselleştirir.