Kendi Kendine Oynayan İnce Ayar
Kendi kendine ince ayar yapma, bir modeli kendi geçmiş çıktılarıyla rekabet ederek veya onlardan öğrenerek kendi eğitim sinyalini üreterek geliştirir.
Genel Bakış
It matters because it can push performance beyond the supervised data using little or no extra human labeling.
Derin Dalış
Kendi kendine oynamanın oyun yapay zekasında derin kökleri vardır: AlphaGo Zero ve AlphaZero, hiçbir insan oyunu kaydı olmadan yalnızca kendilerine karşı milyonlarca oyun oynayarak insanüstü oyuna ulaştı. Aynı ruh artık dil modelinin ince ayarında da görülüyor. SPIN'de (Kendi Kendine Oyun İnce Ayarı), mevcut model, yönlendirmelere yanıtlar üretir ve eğitim, modeli, kendisini hem oyuncu hem de rakip olarak ele alarak, kendi ürettiği yanıtları orijinal insan tarafından yazılan yanıtlardan ayırmaya zorlar. Ardışık yinelemeler boyunca 'rakip' (önceki kontrol noktası) güçlenir, bu nedenle modelin gelişmeye devam etmesi ve hedef dağılımla arasındaki farkı kademeli olarak kapatması gerekir. En büyük çekiciliği veri verimliliğidir: Sabit, denetlenen bir veri seti, yeni insan gösterileri veya tercihleri toplanmadan daha fazla kazanç elde etmek için sıkıştırılabilir.
Teknik Bilgi
SPIN, ince ayarı DPO tarzı kayıplı iki oyunculu bir oyun olarak çerçeveliyor: model, önceki yinelemede kendi ürettiği yanıtlardan ziyade insan referans yanıtlarına daha yüksek olasılık atamak üzere eğitildi. Önceki kontrol noktası olumsuzlukları sağladığından, model geliştikçe zorluk otomatik olarak ölçeklenir. Oyun oynama sistemlerinde, kendi kendine oyun, arama (örn. MCTS) ve bir değer ağıyla eşleştirilerek, dış veriler olmadan giderek daha zor rakiplerden oluşan sonsuz bir müfredat oluşturulur.
Stratejik Etki
Daha net kararlar
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Maliyet ve bütçe
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ekip ve iş akışı
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Kendi Kendine Oynayan İnce Ayarın Geleceği
Kendi kendine oyun, sınırlı insan etiketlerine bağlı kalmak yerine kendi müfredatını ürettiği için veri duvarını kırmanın önde gelen adaylarından biridir. Otomatik damanın kendi kendine oluşturulan denemeleri derecelendirdiği matematik, kod ve teorem kanıtlama gibi doğrulanabilir alanlarda büyüme bekleyebilirsiniz. Riskler arasında ödülün hacklenmesi ve çok fazla sentetik çıktıyla yapılan eğitim nedeniyle modelin çökmesi yer alıyor; bu nedenle gelecekteki sistemler muhtemelen kendi kendine oynamayı temel sinyaller, doğrulayıcılar ve periyodik insan veya gerçek dünya geri bildirimleriyle harmanlayacak.
Gerçek Dünya Uygulaması
AlphaGo Zero ve AlphaZero, insan oyunları olmadan tamamen kendi kendine oynayarak insanüstü Go, satranç ve shogi'ye ulaşıyor
SPIN, kendi çıktılarını insan referans yanıtlarından yinelemeli olarak ayırarak bir Yüksek Lisans'ın kıyaslama puanlarını yükseltiyor
Çözüm denemeleri üreten matematik ve kodlama modelleri, ardından otomatik denetleyiciler veya birim testleriyle doğrulananlar üzerinde eğitim
Müzakere ve diyalog temsilcileri, bir konuşmanın her iki tarafını da tekrar tekrar kendilerine karşı oynayarak stratejiyi geliştiriyorlar
Riskler ve Korkuluklar
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
Uygulama Yol Haritası
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Kendi Kendine Oynatma İnce Ayarının nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Self-Play Fine-Tuning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
İnce Ayar
Sık sorulan sorular
What is Self-Play Fine-Tuning?
Kendi kendine ince ayar yapma, bir modeli kendi geçmiş çıktılarıyla rekabet ederek veya onlardan öğrenerek kendi eğitim sinyalini üreterek geliştirir. Bu önemlidir çünkü çok az veya hiç insan etiketlemesi kullanmadan performansı denetlenen verilerin ötesine taşıyabilir.
Hangi ünlü sistem, insan oyunu kayıtları olmadan, yalnızca kendi kendine oyun kullanarak insanüstü Go oyununa ulaştı?
AlphaGo Zero, rastgele oyundan başlayarak ve insan oyunları üzerinde eğitilen önceki sürümleri geride bırakarak tamamen kendisine karşı oynadığı oyunlardan öğrendi.
SPIN'de modelin yenmesi gereken 'rakip' rolünü ne oynuyor?
SPIN, ince ayarı, önceki yinelemenin kendi kendine ürettiği çıktıların, modelin aşmayı öğrendiği olumsuzluklar olarak hizmet ettiği, kendi kendine oynanan bir oyun olarak ele alır.
Kendi kendine ince ayar yapmanın temel veri verimliliği avantajı nedir?
Kendi kendine oynama, kendi eğitim sinyalini üretir, böylece sabit denetimli bir set, yeni gösterimler toplamaya gerek kalmadan daha fazla iyileştirme sağlayabilir.
SPIN'in eğitim hedefinde model ne yapmaya itiliyor?
SPIN, insan referans yanıtlarını (pozitifler) modelin daha önce kendi kendine oluşturduğu yanıtlardan (negatifler) ayırt etmeyi ödüllendiren DPO tarzı bir kayıp kullanır.
Kendi kendine ince ayar yapmadaki zorluk neden yinelemeler boyunca otomatik olarak artıyor?
Her yinelemenin olumsuz yönleri daha güçlü bir önceki modelden geldiğinden, manuel müfredat tasarımı olmadan model giderek daha zor bir zorlukla karşı karşıya kalır.