Undang-undang Penskalaan Chinchilla
Undang-undang penskalaan Chinchilla, daripada DeepMind pada tahun 2022, menunjukkan bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap, anda harus menskalakan saiz model dan data latihan secara kasar dalam perkadaran yang sama.
Gambaran keseluruhan
It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.
Menyelam dalam
Sebelum Chinchilla, trendnya ialah membina model yang lebih besar (seperti GPT-3 parameter 175B) sambil melatih jumlah data yang agak sederhana. DeepMind melatih lebih 400 model merentas pelbagai saiz dan belanjawan data, kemudian lengkung muat meramalkan kerugian sebagai fungsi parameter dan token di bawah belanjawan pengiraan tetap (FLOP). Penemuan mereka: parameter dan token latihan harus berskala bersama, kira-kira nisbah 1-dengan-1, membayangkan kira-kira 20 token data latihan bagi setiap parameter. Untuk membuktikannya, mereka melatih Chinchilla, model parameter 70B pada 1.4 trilion token, yang mengatasi prestasi Gopher 280B parameter yang lebih besar walaupun menggunakan pengiraan yang sama, kerana ia dilatih pada lebih banyak data.
Wawasan Teknikal
Undang-undang datang daripada memasangkan fungsi kehilangan parametrik L(N, D) dengan N ialah parameter dan D ialah token, termasuk istilah kehilangan tidak boleh dikurangkan, saiz model dan saiz data. Meminimumkan kerugian tertakluk kepada kekangan pengiraan (pengiraan adalah berkadar secara kasar dengan N kali D) menghasilkan keputusan bahawa N dan D optimum kedua-duanya berkembang sebagai kuasa pengiraan dengan eksponen yang serupa, jadi nisbah pengiraan optimum kekal berhampiran 20 token setiap parameter.
Kesan Strategik
Kelajuan dan skala
Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.
Akses dan capai
Ia meluaskan akses merentas bahasa dan gaya komunikasi.
Keputusan yang lebih jelas
Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.
Masa Depan Undang-undang Penskalaan Chinchilla
Chinchilla mengalihkan medan daripada mengejar kiraan parameter kepada memberi model data yang jauh lebih berkualiti, dan model moden sering berlatih melepasi titik 'optimum pengiraan' untuk membuat inferens lebih murah. Apabila teks web berkualiti tinggi menjadi terhad, perhatian beralih kepada penyusunan data, data sintetik, berbilang zaman dan data berbilang mod untuk terus berskala. Pelajaran teras bertahan: data dan parameter mesti seimbang, dan saiz mentah sahaja bukan lagi matlamat.
Pelaksanaan Dunia Sebenar
Chinchilla 70B-parameter DeepMind mengalahkan 280B Gopher pada penanda aras menggunakan pengiraan yang sama, dengan melatih lebih banyak data
Membimbing pasukan untuk membelanjakan kira-kira 20 token latihan bagi setiap parameter apabila merancang model dari awal
Mewajarkan model yang lebih kecil dan kaya data seperti LLaMA yang lebih murah untuk dijalankan pada masa inferens
Menganggarkan sama ada model yang dirancang 'kurang terlatih' dan akan mendapat lebih banyak manfaat daripada data tambahan daripada parameter tambahan
Risiko & Pengawal
Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.
Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.
Data teks sensitif mungkin terdedah jika kawalan akses lemah.
Hala Tuju Pelaksanaan
Tentukan format output, nada dan standard kualiti sebelum pelancaran.
Respons asas dengan sumber yang dipercayai apabila ketepatan penting.
Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.
Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.
Teruskan Meneroka
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Chinchilla Scaling Laws quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Panduan seterusnya
Undang-undang Penskalaan untuk Rangkaian Neural
Soalan lazim
What is Chinchilla Scaling Laws?
Undang-undang penskalaan Chinchilla, daripada DeepMind pada tahun 2022, menunjukkan bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap, anda harus menskalakan saiz model dan data latihan secara kasar dalam perkadaran yang sama. Ia penting kerana ia mentakrifkan semula maksud saiz model 'optimum' dan membentuk semula cara makmal membelanjakan pengiraan.
Apakah penemuan utama undang-undang penskalaan Chinchilla?
Chinchilla menunjukkan bahawa untuk belanjawan pengiraan tetap, parameter dan token latihan harus berkembang bersama-sama, kira-kira 1 hingga 1.
Kira-kira berapa banyak token latihan bagi setiap parameter yang Chinchilla cadangkan sebagai pengiraan-optimum?
Nisbah pengiraan optimum menghasilkan kira-kira 20 token latihan untuk setiap parameter model.
Model manakah yang Chinchilla mengatasi prestasi walaupun jauh lebih kecil?
Chinchilla 70B parameter mengalahkan Gopher 280B parameter DeepMind sendiri menggunakan pengiraan yang sama, kerana ia melatih lebih banyak data.
Apakah yang dimaksudkan oleh Chinchilla tentang model seperti GPT-3 pada masa itu?
Banyak model besar pada era itu kurang terlatih, bermakna mereka akan menunjukkan prestasi yang lebih baik dengan lebih banyak data untuk kiraan parameter mereka.
Secara kasar bagaimana pengiraan dianggarkan dalam analisis Chinchilla?
Pengiraan latihan (FLOP) adalah lebih kurang berkadar dengan bilangan parameter didarab dengan bilangan token latihan.