PANDUAN Dasar

Pelatihan Komputasi Optimal Chinchilla

Chinchilla adalah temuan DeepMind tahun 2022 yang menunjukkan bahwa sebagian besar model bahasa besar kurang dilatih: untuk anggaran komputasi tetap, Anda harus menskalakan parameter dan data secara kira-kira sama, bukan hanya membuat model yang lebih besar.

2 min readTerakhir diperbarui

Ikhtisar

It reshaped how the industry balances model size against training data.

Menyelam Lebih Dalam

Makalah Chinchilla DeepMind meninjau kembali penskalaan dan melatih lebih dari 400 model untuk menemukan keseimbangan komputasi yang optimal. Aturan praktisnya: ukuran model dan token pelatihan harus tumbuh seiring, sekitar 20 token pelatihan per parameter. Untuk membuktikannya, mereka melatih Chinchilla, model dengan 70 miliar parameter pada 1,4 triliun token, menggunakan komputasi yang sama dengan Gopher dengan 280 miliar parameter yang dilatih pada token yang jauh lebih sedikit. Chinchilla, meski empat kali lebih kecil, mengungguli Gopher, GPT-3, dan raksasa lainnya di hampir semua benchmark. Pelajaran ini membalikkan kesimpulan OpenAI sebelumnya yang lebih mengutamakan ukuran dibandingkan data, menunjukkan bahwa banyak model andalan meninggalkan performa karena terlalu besar dan terlalu kekurangan data.

Wawasan Teknis

Kehilangan kecocokan Chinchilla sebagai L(N,D) = E + A·N^(-α) + B·D^(-β), dengan α dan β keduanya mendekati 0,34, artinya parameter dan data berkontribusi hampir secara simetris. Mengoptimalkan hal ini di bawah batasan komputasi tetap (hitung ≈ 6·N·D untuk transformator) akan menghasilkan hasil dengan skala yang sama. Model yang lebih kecil dan kaya data juga lebih murah untuk dijalankan pada inferensi, sehingga keunggulannya bertambah dalam penerapan, bukan hanya pelatihan.

Dampak Strategis

Clearer decisions

Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.

Cost and budget

Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.

Team and workflow

Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.

Masa Depan Pelatihan Komputasi Optimal Chinchilla

Model modern seperti Llama 3 dengan sengaja melampaui rasio 20 token per parameter Chinchilla, melatih model kecil dengan triliunan token untuk membuat inferensi menjadi murah, dan menerima komputasi pelatihan yang kurang optimal. Ketika data yang baik semakin langka, minat terhadap data yang berulang, data sintetis, dan pemfilteran kualitas meningkat. Chinchilla tetap menjadi titik referensi, namun hasil optimal semakin bergantung pada biaya inferensi seumur hidup, bukan hanya anggaran pelatihan satu kali.

Implementasi Dunia Nyata

Memilih untuk melatih model 7 miliar parameter dengan 2 triliun token daripada model 30 miliar dengan data yang terlalu sedikit untuk anggaran yang sama.

Memperkirakan bahwa model dengan 10 miliar parameter memerlukan sekitar 200 miliar token untuk mencapai titik optimal komputasi.

Membenarkan model penerapan yang lebih kecil untuk memangkas biaya inferensi per kueri sekaligus mencocokkan kualitas pesaing yang lebih besar.

Mengaudit model yang ada dan menyimpulkan bahwa model tersebut kurang terlatih, lalu merencanakan pelatihan yang dijalankan lebih lama daripada meningkatkan parameter.

Risiko & Pagar Pembatas

Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.

Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.

Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.

Peta Jalan Implementasi

1

Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.

2

Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.

3

Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.

4

Dokumentasikan di mana Pelatihan Komputasi Optimal Chinchilla membantu dan di mana metode yang lebih sederhana lebih baik.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pelatihan Waktu Tes

Pertanyaan yang sering diajukan

What is Chinchilla Compute-Optimal Training?

Chinchilla adalah temuan DeepMind tahun 2022 yang menunjukkan bahwa sebagian besar model bahasa besar kurang dilatih: untuk anggaran komputasi tetap, Anda harus menskalakan parameter dan data secara kira-kira sama, bukan hanya membuat model yang lebih besar. Hal ini mengubah cara industri menyeimbangkan ukuran model dengan data pelatihan.

Apa aturan praktis Chinchilla yang terkenal untuk pelatihan komputasi optimal?

DeepMind menemukan parameter dan token harus berskala bersama pada sekitar 20 token per parameter untuk anggaran komputasi tertentu.

Bagaimana Chinchilla berparameter 70B dibandingkan dengan Gopher berparameter 280B?

Dilatih dengan lebih banyak token dengan komputasi yang sama, Chinchilla mengalahkan Gopher yang jauh lebih besar di sebagian besar tolok ukur.

Masalah utama apa yang diungkapkan makalah Chinchilla tentang model-model besar sebelumnya?

Model seperti GPT-3 dan Gopher terlalu besar dibandingkan dengan data pelatihannya, sehingga performanya tidak tercapai.

Kira-kira berapa banyak token yang disarankan oleh aturan Chinchilla untuk model 10 miliar parameter?

Dengan 20 token per parameter, 10 miliar parameter berarti sekitar 200 miliar token pelatihan.

Selain efisiensi pelatihan, mengapa model yang lebih kecil dan kaya data menarik untuk diterapkan?

Parameter yang lebih sedikit berarti komputasi per kueri yang lebih rendah, sehingga penghematan bertambah setiap kali model digunakan.