PANDUAN AI Bahasa

Undang-undang Penskalaan Chinchilla

Undang-undang penskalaan Chinchilla, daripada DeepMind pada tahun 2022, menunjukkan bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap, anda harus menskalakan saiz model dan data latihan secara kasar dalam perkadaran yang sama.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because it redefined what 'optimal' model size means and reshaped how labs spend compute.

Menyelam dalam

Sebelum Chinchilla, trendnya ialah membina model yang lebih besar (seperti GPT-3 parameter 175B) sambil melatih jumlah data yang agak sederhana. DeepMind melatih lebih 400 model merentas pelbagai saiz dan belanjawan data, kemudian lengkung muat meramalkan kerugian sebagai fungsi parameter dan token di bawah belanjawan pengiraan tetap (FLOP). Penemuan mereka: parameter dan token latihan harus berskala bersama, kira-kira nisbah 1-dengan-1, membayangkan kira-kira 20 token data latihan bagi setiap parameter. Untuk membuktikannya, mereka melatih Chinchilla, model parameter 70B pada 1.4 trilion token, yang mengatasi prestasi Gopher 280B parameter yang lebih besar walaupun menggunakan pengiraan yang sama, kerana ia dilatih pada lebih banyak data.

Wawasan Teknikal

Undang-undang datang daripada memasangkan fungsi kehilangan parametrik L(N, D) dengan N ialah parameter dan D ialah token, termasuk istilah kehilangan tidak boleh dikurangkan, saiz model dan saiz data. Meminimumkan kerugian tertakluk kepada kekangan pengiraan (pengiraan adalah berkadar secara kasar dengan N kali D) menghasilkan keputusan bahawa N dan D optimum kedua-duanya berkembang sebagai kuasa pengiraan dengan eksponen yang serupa, jadi nisbah pengiraan optimum kekal berhampiran 20 token setiap parameter.

Kesan Strategik

Kelajuan dan skala

Aliran kerja bahasa boleh bergerak lebih pantas tanpa mengorbankan konsistensi.

Akses dan capai

Ia meluaskan akses merentas bahasa dan gaya komunikasi.

Keputusan yang lebih jelas

Pasukan boleh menghabiskan lebih banyak masa untuk membuat pertimbangan manakala automasi mengendalikan pengulangan.

Masa Depan Undang-undang Penskalaan Chinchilla

Chinchilla mengalihkan medan daripada mengejar kiraan parameter kepada memberi model data yang jauh lebih berkualiti, dan model moden sering berlatih melepasi titik 'optimum pengiraan' untuk membuat inferens lebih murah. Apabila teks web berkualiti tinggi menjadi terhad, perhatian beralih kepada penyusunan data, data sintetik, berbilang zaman dan data berbilang mod untuk terus berskala. Pelajaran teras bertahan: data dan parameter mesti seimbang, dan saiz mentah sahaja bukan lagi matlamat.

Pelaksanaan Dunia Sebenar

Chinchilla 70B-parameter DeepMind mengalahkan 280B Gopher pada penanda aras menggunakan pengiraan yang sama, dengan melatih lebih banyak data

Membimbing pasukan untuk membelanjakan kira-kira 20 token latihan bagi setiap parameter apabila merancang model dari awal

Mewajarkan model yang lebih kecil dan kaya data seperti LLaMA yang lebih murah untuk dijalankan pada masa inferens

Menganggarkan sama ada model yang dirancang 'kurang terlatih' dan akan mendapat lebih banyak manfaat daripada data tambahan daripada parameter tambahan

Risiko & Pengawal

Fakta halusinasi boleh memasukkan laporan, aliran sokongan atau hasil penyelidikan secara senyap-senyap.

Sensitiviti segera boleh mencipta hasil yang tidak konsisten merentas permintaan yang serupa.

Data teks sensitif mungkin terdedah jika kawalan akses lemah.

Hala Tuju Pelaksanaan

1

Tentukan format output, nada dan standard kualiti sebelum pelancaran.

2

Respons asas dengan sumber yang dipercayai apabila ketepatan penting.

3

Simpan pusat pemeriksaan semakan manusia untuk output berkepentingan tinggi.

4

Jejaki corak kegagalan dan latih semula gesaan atau aliran kerja dengan kerap.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Scaling Laws quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Undang-undang Penskalaan untuk Rangkaian Neural

Soalan lazim

What is Chinchilla Scaling Laws?

Undang-undang penskalaan Chinchilla, daripada DeepMind pada tahun 2022, menunjukkan bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap, anda harus menskalakan saiz model dan data latihan secara kasar dalam perkadaran yang sama. Ia penting kerana ia mentakrifkan semula maksud saiz model 'optimum' dan membentuk semula cara makmal membelanjakan pengiraan.

Apakah penemuan utama undang-undang penskalaan Chinchilla?

Chinchilla menunjukkan bahawa untuk belanjawan pengiraan tetap, parameter dan token latihan harus berkembang bersama-sama, kira-kira 1 hingga 1.

Kira-kira berapa banyak token latihan bagi setiap parameter yang Chinchilla cadangkan sebagai pengiraan-optimum?

Nisbah pengiraan optimum menghasilkan kira-kira 20 token latihan untuk setiap parameter model.

Model manakah yang Chinchilla mengatasi prestasi walaupun jauh lebih kecil?

Chinchilla 70B parameter mengalahkan Gopher 280B parameter DeepMind sendiri menggunakan pengiraan yang sama, kerana ia melatih lebih banyak data.

Apakah yang dimaksudkan oleh Chinchilla tentang model seperti GPT-3 pada masa itu?

Banyak model besar pada era itu kurang terlatih, bermakna mereka akan menunjukkan prestasi yang lebih baik dengan lebih banyak data untuk kiraan parameter mereka.

Secara kasar bagaimana pengiraan dianggarkan dalam analisis Chinchilla?

Pengiraan latihan (FLOP) adalah lebih kurang berkadar dengan bilangan parameter didarab dengan bilangan token latihan.