PANDUAN Dasar

Fenomena Keturunan Ganda

Keturunan ganda adalah pengamatan yang mengejutkan bahwa semakin besar model, kesalahan pengujian mula-mula semakin buruk mendekati 'ambang batas interpolasi', namun kemudian menjadi lebih baik lagi — bertentangan dengan trade-off buku teks klasik.

2 min readTerakhir diperbarui

Ikhtisar

It matters because it helps explain why enormous, overparameterized neural networks generalize well instead of overfitting.

Menyelam Lebih Dalam

Statistik klasik mengajarkan kurva berbentuk U: ketika kompleksitas model meningkat, kesalahan pengujian menurun, mencapai titik terendah, lalu meningkat seiring dengan overfitting model. Keturunan ganda, yang dipopulerkan oleh Belkin, Hsu, Ma, dan Mandal pada tahun 2019 dan dipelajari dalam skala oleh OpenAI, menunjukkan bahwa kurva tersebut mengalami penurunan kedua. Kesalahan pengujian mencapai puncaknya tepat pada ambang batas interpolasi — titik di mana model memiliki parameter yang cukup untuk menyesuaikan setiap titik pelatihan secara tepat (kesalahan pelatihan nol). Jika hal tersebut melampaui batas tersebut, maka error pengujian akan turun lagi, sering kali di bawah sweet spot klasik. Efek yang sama muncul pada ukuran model, waktu pelatihan (penurunan ganda 'berdasarkan zaman'), dan ukuran kumpulan data. Hal ini mengubah ketakutan lama bahwa 'lebih banyak parameter berarti overfitting'.

Wawasan Teknis

Pada ambang batas interpolasi, pada dasarnya terdapat satu solusi yang benar-benar sesuai dengan data, dan solusi tersebut dipaksa menjadi bergerigi dan bernorma tinggi, sehingga menghasilkan generalisasi yang buruk. Dalam rezim yang diparameterisasi secara berlebihan, ada banyak sekali solusi tanpa kesalahan, dan bias implisit penurunan gradien mengarah ke solusi yang paling halus dan bernorma paling rendah. Preferensi untuk interpolator dengan kompleksitas rendah — bukan jumlah parameter itu sendiri — itulah yang mendorong penurunan kedua untuk menurunkan kesalahan pengujian.

Dampak Strategis

Clearer decisions

Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.

Cost and budget

Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.

Team and workflow

Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.

Masa Depan Fenomena Keturunan Ganda

Para peneliti menggunakan penurunan ganda untuk menyempurnakan undang-undang penskalaan dan memilih kapan harus menghentikan pelatihan, karena 'berlatih lebih lama, menjadi lebih buruk, lalu lebih baik' memiliki implikasi biaya yang nyata. Harapkan teori yang lebih ketat yang menghubungkannya dengan regularisasi implisit, kernel tangen saraf, dan grokking. Praktisnya, pembelajaran ini – yang lebih besar dan lebih lama dapat membantu melewati zona bahaya – telah mendasari keputusan untuk melatih model pondasi yang semakin besar dibandingkan model pondasi yang berukuran hati-hati.

Implementasi Dunia Nyata

Menjelaskan mengapa model bahasa dengan 175 miliar parameter dapat melakukan generalisasi lebih baik daripada model bahasa berukuran sedang yang disetel dengan cermat meskipun memiliki kapasitas yang jauh lebih besar

Memilih untuk berlatih melewati titik di mana kehilangan validasi memburuk untuk sementara waktu, karena penurunan ganda berdasarkan zaman memprediksi pemulihan di kemudian hari

Mendiagnosis model visi yang akurasinya menurun tepat ketika jumlah parameter cocok dengan ukuran set pelatihan, lalu mengarahkannya lebih jauh ke dalam parameterisasi berlebihan

Menginformasikan keputusan ukuran model di AutoML sehingga praktisi menghindari zona ambang batas interpolasi yang rapuh

Risiko & Pagar Pembatas

Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.

Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.

Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.

Peta Jalan Implementasi

1

Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.

2

Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.

3

Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.

4

Dokumentasikan di mana Fenomena Keturunan Ganda membantu dan di mana metode yang lebih sederhana lebih baik.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Double Descent Phenomenon quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Penurunan Gradien

Pertanyaan yang sering diajukan

What is Double Descent Phenomenon?

Keturunan ganda adalah pengamatan yang mengejutkan bahwa semakin besar model, kesalahan pengujian mula-mula semakin buruk mendekati 'ambang batas interpolasi', namun kemudian menjadi lebih baik lagi — bertentangan dengan trade-off buku teks klasik. Hal ini penting karena membantu menjelaskan mengapa jaringan saraf yang sangat besar dan berparameter berlebihan dapat melakukan generalisasi dengan baik, bukan melakukan overfitting.

Di manakah kesalahan pengujian biasanya mencapai puncaknya pada kurva penurunan ganda?

Lonjakan kesalahan terjadi pada ambang batas interpolasi, saat model memiliki kapasitas yang cukup untuk mendorong kesalahan pelatihan ke nol dengan satu solusi kaku.

Apa yang terjadi pada kesalahan pengujian saat model menjadi terlalu parameternya?

Dalam pengujian rezim dengan parameter berlebih, kesalahan turun untuk kedua kalinya, yang merupakan fitur penentu yang memberi nama penurunan ganda.

Mengapa penurunan gradien membantu dalam rezim parameter yang berlebihan?

Dengan banyaknya solusi tanpa kesalahan yang tersedia, bias implisit penurunan gradien mengarah ke yang paling halus, dengan norma terendah, yang dapat digeneralisasi dengan lebih baik.

Keturunan ganda 'berdasarkan zaman' mengacu pada efek yang muncul sebagai fungsi dari apa?

Penurunan ganda dapat terjadi di sepanjang sumbu waktu pelatihan: kesalahan pengujian dapat memburuk kemudian membaik seiring dengan berlanjutnya pelatihan selama beberapa periode.

Ide klasik manakah yang ditantang oleh keturunan ganda?

Hal ini bertentangan dengan kurva berbentuk U di buku teks yang mengatakan bahwa semakin banyak kompleksitas melewati suatu titik selalu meningkatkan kesalahan pengujian melalui overfitting.