Çinçilla Ölçekleme Yasaları
DeepMind'ın 2022'de çıkardığı Chinchilla ölçeklendirme yasaları, çoğu büyük dil modelinin yetersiz eğitildiğini gösterdi: Sabit bir bilgi işlem bütçesi için, model boyutunu ve eğitim verilerini kabaca eşit oranda ölçeklendirmeniz gerekir.
Genel Bakış
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Derin Dalış
Chinchilla'dan önce eğilim, nispeten mütevazı miktarda veri üzerinde eğitim verirken daha da büyük modeller (175B parametreli GPT-3 gibi) oluşturmaktı. DeepMind, birçok boyut ve veri bütçesinde 400'den fazla modeli eğitti ve ardından sabit bir hesaplama (FLOP) bütçesi altında parametrelerin ve belirteçlerin bir fonksiyonu olarak kaybı tahmin eden eğrileri yerleştirdi. Bulguları: parametreler ve eğitim jetonları, kabaca 1'e 1 oranında birlikte ölçeklendirilmelidir, bu da parametre başına yaklaşık 20 jeton eğitim verisi anlamına gelir. Bunu kanıtlamak için, 1,4 trilyon token üzerinde 70B parametreli bir model olan Chinchilla'yı eğittiler; bu model, çok daha fazla veri üzerinde eğitildiğinden, aynı hesaplamayı kullanmasına rağmen çok daha büyük olan 280B parametreli Gopher'dan daha iyi performans gösterdi.
Teknik Bilgi
Yasalar, indirgenemez kayıp, model boyutu ve veri boyutu terimleri dahil olmak üzere N'nin parametreler ve D'nin belirteçler olduğu bir parametrik kayıp fonksiyonu L(N, D)'nin uydurulmasından gelir. Bir hesaplama kısıtlamasına bağlı olarak kaybın en aza indirilmesi (hesaplama kabaca N çarpı D ile orantılıdır), optimal N ve D'nin her ikisinin de benzer üslerle bir hesaplama gücü olarak büyüdüğü sonucunu verir, böylece optimum hesaplama oranı parametre başına 20 jetona yakın kalır.
Stratejik Etki
Speed and scale
Dil iş akışları tutarlılıktan ödün vermeden daha hızlı ilerleyebilir.
Access and reach
Diller ve iletişim tarzları arasında erişimi genişletir.
Daha net kararlar
Otomasyon tekrarlamayı yönetirken ekipler karar vermeye daha fazla zaman ayırabilir.
Chinchilla Ölçekleme Yasalarının Geleceği
Chinchilla, alanı parametre sayımlarını takip etmekten, modelleri çok daha yüksek kaliteli verilerle beslemeye kaydırdı ve modern modeller, çıkarımı daha ucuz hale getirmek için genellikle 'optimal hesaplama' noktasının çok ötesinde eğitim veriyor. Yüksek kaliteli web metni azaldıkça, ölçeklendirmeyi sürdürmek için dikkatler veri iyileştirmeye, sentetik verilere, çoklu dönemlere ve çok modlu verilere yöneliyor. Temel ders kalıcıdır: Veriler ve parametreler dengelenmelidir ve artık amaç tek başına ham boyut değildir.
Gerçek Dünya Uygulaması
DeepMind'ın 70B parametreli Chinchilla'sı, çok daha fazla veri üzerinde eğitim vererek, eşit hesaplama kullanarak kıyaslamalarda 280B Gopher'ı geride bırakıyor
Sıfırdan bir model planlarken ekiplere parametre başına yaklaşık 20 eğitim jetonu bütçeleme konusunda rehberlik etme
Çıkarım zamanında çalıştırılması daha ucuz olan LLaMA gibi daha küçük, veri açısından zengin modelleri gerekçelendirmek
Planlanan bir modelin 'yetersiz eğitilmiş' olup olmadığını ve ekstra parametrelerden ziyade ekstra verilerden daha fazla fayda sağlayıp sağlamayacağını tahmin etmek
Riskler ve Korkuluklar
Halüsinasyonlu gerçekler sessizce raporlara, destek akışlarına veya araştırma çıktılarına girebilir.
İstem hassasiyeti, benzer istekler arasında tutarsız sonuçlar yaratabilir.
Erişim kontrolleri zayıfsa hassas metin verileri açığa çıkabilir.
Uygulama Yol Haritası
Kullanıma sunmadan önce çıktı formatını, tonunu ve kalite standartlarını tanımlayın.
Doğruluğun önemli olduğu durumlarda güvenilir kaynaklarla zemin müdahaleleri.
Yüksek riskli çıktılar için insan incelemesi kontrol noktası bulundurun.
Arıza modellerini takip edin ve istemleri veya iş akışlarını düzenli olarak yeniden eğitin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Sinir Ağları İçin Ölçekleme Yasaları
Sık sorulan sorular
What is Chinchilla Scaling Laws?
DeepMind'ın 2022'de çıkardığı Chinchilla ölçeklendirme yasaları, çoğu büyük dil modelinin yetersiz eğitildiğini gösterdi: Sabit bir bilgi işlem bütçesi için, model boyutunu ve eğitim verilerini kabaca eşit oranda ölçeklendirmeniz gerekir. Bu önemlidir çünkü 'optimal' model boyutunun ne anlama geldiğini yeniden tanımladı ve laboratuvarların bilgi işlem harcama şeklini yeniden şekillendirdi.
Chinchilla ölçeklendirme yasalarının temel bulgusu neydi?
Chinchilla, sabit bir işlem bütçesi için parametrelerin ve eğitim belirteçlerinin kabaca 1'e 1 oranında birlikte büyümesi gerektiğini gösterdi.
Chinchilla, parametre başına yaklaşık kaç eğitim jetonunun hesaplama açısından ideal olduğunu öne sürdü?
Optimum hesaplama oranı, her model parametresi için yaklaşık 20 eğitim jetonuna denk gelir.
Chinchilla, çok daha küçük olmasına rağmen hangi modelden daha iyi performans gösterdi?
70B parametreli Chinchilla, DeepMind'in kendi 280B parametreli Gopher'ını aynı hesaplamayı kullanarak yendi çünkü çok daha fazla veri üzerinde eğitilmişti.
Chinchilla o zamanlar GPT-3 gibi modeller hakkında ne ima ediyordu?
O dönemin pek çok büyük modeli yeterince eğitilmemişti, bu da parametre sayımı için çok daha fazla veriyle daha iyi performans gösterecekleri anlamına geliyordu.
Chinchilla analizinde hesaplamaya kabaca nasıl yaklaşıldı?
Eğitim hesaplaması (FLOP'lar), parametre sayısı ile eğitim jetonlarının sayısının çarpımı ile yaklaşık olarak orantılıdır.