Chinchilla Bilgi İşlem-Optimal Eğitimi
Chinchilla, büyük dil modellerinin çoğunun yetersiz eğitildiğini ortaya koyan 2022 DeepMind bulgusudur: sabit bir bilgi işlem bütçesi için, yalnızca daha büyük bir model oluşturmakla kalmayıp, parametreleri ve verileri kabaca eşit şekilde ölçeklendirmelisiniz.
Genel Bakış
It reshaped how the industry balances model size against training data.
Derin Dalış
DeepMind'ın Chinchilla makalesi ölçeklendirmeyi yeniden ele aldı ve en uygun hesaplama dengesini bulmak için 400'ün üzerinde modeli eğitti. Temel kural: model boyutu ve eğitim jetonları, parametre başına yaklaşık 20 eğitim jetonu olacak şekilde, adım adım büyümelidir. Bunu kanıtlamak için, 1,4 trilyon token üzerinde 70 milyar parametreli bir model olan Chinchilla'yı, çok daha az token üzerinde eğitilen 280 milyar parametreli Gopher ile aynı hesaplamayı kullanarak eğittiler. Chinchilla, dört kat daha küçük olmasına rağmen neredeyse her kıyaslamada Gopher, GPT-3 ve diğer devlerden daha iyi performans gösterdi. Bu ders, birçok amiral gemisi modelinin çok büyük ve fazla veriye aç olması nedeniyle performansı masada bıraktığını göstererek, veri yerine boyutu tercih eden daha önceki OpenAI sonucunu bozdu.
Teknik Bilgi
Chinchilla uyum kaybı L(N,D) = E + A·N^(-α) + B·D^(-β) şeklindedir; α ve β'nın her ikisi de 0,34'e yakındır, bu da parametrelerin ve verilerin neredeyse simetrik olarak katkıda bulunduğu anlamına gelir. Bunu sabit bir hesaplama kısıtlaması altında optimize etmek (transformatörler için hesaplama ≈ 6·N·D) eşit ölçeklendirme sonucunu verir. Daha küçük, veri açısından zengin bir modelin çıkarımda çalıştırılması da daha ucuzdur, dolayısıyla avantajı yalnızca eğitimde değil, dağıtımda da artar.
Stratejik Etki
Daha net kararlar
Açık teknik iddiaları pazarlama dilinden ayırmanıza yardımcı olur.
Maliyet ve bütçe
Para veya zaman harcamadan önce daha iyi uygulama soruları sorabilirsiniz.
Ekip ve iş akışı
Ortak anlayışa sahip ekipler daha iyi ürün, politika ve öğrenme kararları verir.
Chinchilla Compute-Optimal Eğitiminin Geleceği
Llama 3 gibi modern modeller kasıtlı olarak Chinchilla'nın parametre başına 20 jeton oranını çok aşıyor, çıkarımı ucuz hale getirmek için küçük modelleri trilyonlarca jeton üzerinde eğitiyor ve optimal olmayan eğitim hesaplamasını kabul ediyor. İyi veriler azaldıkça, tekrarlanan dönemlere, sentetik verilere ve kaliteli filtrelemeye olan ilgi de artıyor. Chinchilla referans noktası olmaya devam ediyor, ancak optimum, yalnızca bir kerelik eğitim bütçesine değil, giderek artan bir şekilde yaşam boyu çıkarım maliyetine bağlı.
Gerçek Dünya Uygulaması
Aynı bütçe için çok az veriyle 30 milyarlık bir model yerine 2 trilyon tokenle 7 milyar parametreli bir modeli eğitmeyi seçmek.
10 milyar parametreli bir modelin, hesaplama açısından en uygun tatlı noktaya ulaşmak için yaklaşık 200 milyar token istediğini tahmin ediyoruz.
Daha büyük bir rakibin kalitesiyle eşleşirken sorgu başına çıkarım maliyetlerini azaltmak için daha küçük konuşlandırılmış bir modelin gerekçelendirilmesi.
Mevcut bir modeli denetlemek ve yetersiz eğitim aldığı sonucuna varmak, ardından parametre artışı yerine daha uzun bir eğitim çalışması planlamak.
Riskler ve Korkuluklar
Farklı ekipler aynı terimi farklı şekilde kullanabilir; bu nedenle kapsamı erken tanımlayın.
Gerçek dünya performansı dengesizken karşılaştırmalar güçlü görünebilir.
Veri kalitesini ve değerlendirme planlarını göz ardı etmek çoğu zaman hassas sonuçlar doğurur.
Uygulama Yol Haritası
İhtiyacınız olan sonucun sade bir dille tanımlanmasıyla başlayın.
Test etmeden önce bir başarı ölçüsü ve bir başarısızlık koşulu seçin.
Gösterişli bir demo seti yerine, temsili verilerle küçük bir pilot çalışma yürütün.
Chinchilla Compute-Optimal Training'in nerede yardımcı olduğunu ve daha basit yöntemlerin nerede daha iyi olduğunu belgeleyin.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Compute-Optimal Training quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Test Süresi Eğitimi
Sık sorulan sorular
What is Chinchilla Compute-Optimal Training?
Chinchilla, büyük dil modellerinin çoğunun yetersiz eğitildiğini ortaya koyan 2022 DeepMind bulgusudur: sabit bir bilgi işlem bütçesi için, yalnızca daha büyük bir model oluşturmakla kalmayıp, parametreleri ve verileri kabaca eşit şekilde ölçeklendirmelisiniz. Sektörün model boyutunu eğitim verileriyle nasıl dengeleyeceğini yeniden şekillendirdi.
Chinchilla'nın bilişim açısından ideal eğitim için ünlü temel kuralı nedir?
DeepMind, parametrelerin ve belirteçlerin, belirli bir işlem bütçesi için parametre başına yaklaşık 20 belirteçle birlikte ölçeklendirilmesi gerektiğini buldu.
70B parametreli Chinchilla, 280B parametreli Gopher ile nasıl karşılaştırıldı?
Aynı hesaplamayla çok daha fazla token üzerinde eğitim alan Chinchilla, çoğu kıyaslamada kendisinden çok daha büyük olan Gopher'ı yendi.
Chinchilla makalesi önceki büyük modellerle ilgili hangi temel sorunu ortaya çıkardı?
GPT-3 ve Gopher gibi modeller, eğitim verilerine göre çok büyüktü ve performans gerçekleşmedi.
Chinchilla kuralı 10 milyar parametreli bir model için kabaca kaç token önermektedir?
Parametre başına 20 jeton, 10 milyar parametre yaklaşık 200 milyar eğitim jetonu anlamına gelir.
Eğitim verimliliğinin yanı sıra, dağıtımda daha küçük, veri açısından zengin bir model neden çekici?
Daha az parametre, sorgu başına daha düşük işlem anlamına gelir; dolayısıyla model her kullanıldığında tasarruf artar.