PANDUAN Asas

Chinchilla Compute-Optimum Training

Chinchilla ialah penemuan DeepMind 2022 bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap anda harus menskalakan parameter dan data secara kasar secara sama, bukan hanya membina model yang lebih besar.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It reshaped how the industry balances model size against training data.

Menyelam dalam

Kertas Chinchilla DeepMind menyemak semula penskalaan dan melatih lebih 400 model untuk mencari keseimbangan pengiraan yang optimum. Peraturan utama tajuk utama: saiz model dan token latihan harus berkembang mengikut lockstep, kira-kira 20 token latihan setiap parameter. Untuk membuktikannya, mereka melatih Chinchilla, model 70 bilion parameter pada 1.4 trilion token, menggunakan pengiraan yang sama seperti 280 bilion parameter Gopher yang dilatih pada token yang jauh lebih sedikit. Chinchilla, walaupun empat kali lebih kecil, mengatasi Gopher, GPT-3, dan gergasi lain pada hampir setiap penanda aras. Pelajaran itu telah membatalkan kesimpulan awal OpenAI yang mengutamakan saiz berbanding data, menunjukkan banyak model perdana meninggalkan prestasi di atas meja kerana terlalu besar dan terlalu kehabisan data.

Wawasan Teknikal

Kehilangan fit Chinchilla kerana L(N,D) = E + A·N^(-α) + B·D^(-β), dengan α dan β kedua-duanya hampir 0.34, bermakna parameter dan data menyumbang hampir simetri. Mengoptimumkan ini di bawah kekangan pengiraan tetap (kira ≈ 6·N·D untuk transformer) menghasilkan hasil penskalaan yang sama. Model yang lebih kecil dan kaya data juga lebih murah untuk dijalankan pada inferens, jadi kelebihannya digabungkan dalam penggunaan, bukan hanya latihan.

Kesan Strategik

Keputusan yang lebih jelas

Ia membantu anda memisahkan tuntutan teknikal yang jelas daripada bahasa pemasaran.

Kos dan bajet

Anda boleh bertanya soalan pelaksanaan yang lebih baik sebelum menghabiskan wang atau masa.

Pasukan dan aliran kerja

Pasukan yang berkongsi pemahaman membuat keputusan produk, dasar dan pembelajaran yang lebih baik.

Masa Depan Latihan Chinchilla Compute-Optimal

Model moden seperti Llama 3 sengaja menolak jauh melebihi nisbah 20-token-per-parameter Chinchilla, melatih model kecil pada trilion token untuk membuat inferens murah, menerima pengiraan latihan suboptimum. Apabila data yang baik semakin berkurangan, minat semakin meningkat dalam zaman yang berulang, data sintetik dan penapisan kualiti. Chinchilla kekal sebagai titik rujukan, tetapi yang optimum semakin bergantung pada kos inferens seumur hidup, bukan hanya belanjawan latihan sekali sahaja.

Pelaksanaan Dunia Sebenar

Memilih untuk melatih model 7 bilion parameter pada 2 trilion token dan bukannya model 30 bilion pada data yang terlalu sedikit untuk belanjawan yang sama.

Menganggarkan bahawa model 10 bilion parameter mahukan kira-kira 200 bilion token untuk mencapai titik manis pengiraan yang optimum.

Mewajarkan model yang digunakan yang lebih kecil untuk mengurangkan kos inferens setiap pertanyaan sambil memadankan kualiti saingan yang lebih besar.

Mengaudit model sedia ada dan membuat kesimpulan bahawa ia kurang terlatih, kemudian merancang latihan yang lebih lama dan bukannya peningkatan parameter.

Risiko & Pengawal

Pasukan yang berbeza mungkin menggunakan istilah yang sama secara berbeza, jadi tentukan skop lebih awal.

Penanda aras boleh kelihatan kukuh manakala prestasi dunia sebenar tidak sekata.

Mengabaikan kualiti data dan rancangan penilaian sering menghasilkan hasil yang rapuh.

Hala Tuju Pelaksanaan

1

Mulakan dengan definisi bahasa biasa hasil yang anda perlukan.

2

Pilih satu metrik kejayaan dan satu keadaan kegagalan sebelum ujian.

3

Jalankan juruterbang kecil dengan data perwakilan, bukan set demo yang digilap.

4

Dokumen di mana Chinchilla Compute-Optimal Training membantu dan kaedah yang lebih mudah adalah lebih baik.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Latihan Masa Ujian

Soalan lazim

What is Chinchilla Compute-Optimal Training?

Chinchilla ialah penemuan DeepMind 2022 bahawa kebanyakan model bahasa besar kurang terlatih: untuk belanjawan pengiraan tetap anda harus menskalakan parameter dan data secara kasar secara sama, bukan hanya membina model yang lebih besar. Ia membentuk semula cara industri mengimbangi saiz model dengan data latihan.

Apakah peraturan Chinchilla yang terkenal untuk latihan pengiraan yang optimum?

DeepMind mendapati parameter dan token harus berskala bersama-sama pada kira-kira 20 token setiap parameter untuk belanjawan pengiraan tertentu.

Bagaimanakah 70B-parameter Chinchilla dibandingkan dengan 280B-parameter Gopher?

Dilatih menggunakan lebih banyak token dengan pengiraan yang sama, Chinchilla mengalahkan Gopher yang jauh lebih besar merentasi kebanyakan penanda aras.

Apakah masalah utama yang didedahkan oleh kertas Chinchilla tentang model besar sebelumnya?

Model seperti GPT-3 dan Gopher adalah terlalu besar berbanding dengan data latihan mereka, menyebabkan prestasi tidak direalisasikan.

Secara kasar berapa banyak token yang dicadangkan oleh peraturan Chinchilla untuk model 10 bilion parameter?

Pada 20 token setiap parameter, 10 bilion parameter membayangkan kira-kira 200 bilion token latihan.

Selain kecekapan latihan, mengapakah model yang lebih kecil dan kaya dengan data menarik dalam penggunaan?

Parameter yang lebih sedikit bermakna pengiraan setiap pertanyaan yang lebih rendah, jadi kompaun penjimatan setiap kali model digunakan.