PANDUAN Dasar

Penurunan Berat Badan dan Regularisasi L2

Peluruhan bobot adalah teknik sederhana dan ampuh yang mendorong bobot model ke nol selama pelatihan, sehingga tidak terlalu bergantung pada fitur apa pun.

2 min readTerakhir diperbarui

Ikhtisar

It reduces overfitting and is one of the most widely used regularizers in deep learning.

Menyelam Lebih Dalam

Saat sebuah model dilatih, model tersebut dapat menangkap noise dalam data dengan meningkatkan bobot yang besar dan disesuaikan secara sempurna agar sesuai dengan set pelatihan, namun dapat digeneralisasi dengan buruk. Regularisasi L2 mengatasi hal ini dengan menambahkan penalti yang sebanding dengan jumlah bobot kuadrat ke fungsi kerugian. Pengoptimal sekarang memiliki dua tujuan: menyesuaikan data dan menjaga bobot tetap kecil, sehingga menghasilkan solusi yang lebih lancar dan kuat. Peluruhan bobot adalah gagasan yang terkait erat dengan menyusutkan setiap bobot sebesar sebagian kecil pada setiap langkah pembaruan. Dengan penurunan gradien biasa, keduanya setara secara matematis, namun dengan pengoptimal adaptif seperti Adam keduanya berbeda, itulah sebabnya AdamW diperkenalkan untuk memisahkan peluruhan dari pembaruan berbasis gradien dan membuatnya berperilaku benar.

Wawasan Teknis

Regularisasi L2 menambahkan lambda kali jumlah bobot kuadrat ke kerugian, sehingga gradiennya menambahkan suku yang sebanding dengan setiap bobot, sehingga menariknya ke arah nol. Peluruhan bobot yang dipisahkan mengalikan setiap bobot dengan faktor seperti (1 dikurangi learning_rate dikali lambda) secara langsung. Dalam metode adaptif, menggabungkan L2 ke dalam kerugian memungkinkan penskalaan per parameter mendistorsi penalti, sehingga AdamW menerapkan penyusutan secara terpisah, sehingga mengembalikan tarikan seragam yang diinginkan ke bobot yang lebih kecil.

Dampak Strategis

Clearer decisions

Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.

Cost and budget

Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.

Team and workflow

Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.

Masa Depan Penurunan Berat Badan dan Regularisasi L2

Penurunan berat badan tetap menjadi bahan default dalam resep pelatihan untuk model bahasa besar dan pengubah visi, dan AdamW kini menjadi pengoptimal standar untuk model tersebut. Penelitian berlanjut mengenai bagaimana peluruhan berinteraksi dengan jadwal kecepatan pembelajaran, lapisan normalisasi, dan skala model, karena kekuatan efektifnya berubah seiring pertumbuhan model. Harapkan penyetelan peluruhan yang lebih berprinsip, mungkin per lapisan atau sesuai jadwal seiring dengan semakin matangnya penelusuran hyperparameter otomatis dan studi hukum penskalaan.

Implementasi Dunia Nyata

Menambahkan Weight_decay di pengoptimal AdamW atau SGD PyTorch saat melatih pengklasifikasi gambar untuk membatasi overfitting

Menyesuaikan koefisien lambda dalam regresi ridge, model linier klasik dengan sanksi L2, untuk menstabilkan prediksi pada fitur yang berkorelasi

Resep pra-pelatihan model bahasa besar yang menetapkan penurunan bobot kecil (seringkali sekitar 0,1) di samping jadwal kecepatan pembelajaran

Menggabungkan penurunan berat badan dengan augmentasi data dan dropout untuk mencegah model pencitraan medis kecil mengingat pemindaian pelatihan terbatas

Risiko & Pagar Pembatas

Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.

Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.

Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.

Peta Jalan Implementasi

1

Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.

2

Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.

3

Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.

4

Dokumentasikan di mana Weight Decay dan Regularisasi L2 membantu dan di mana metode yang lebih sederhana lebih baik.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Weight Decay and L2 Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Pertanyaan yang sering diajukan

What is Weight Decay and L2 Regularization?

Peluruhan bobot adalah teknik sederhana dan ampuh yang mendorong bobot model ke nol selama pelatihan, sehingga tidak terlalu bergantung pada fitur apa pun. Ini mengurangi overfitting dan merupakan salah satu pengatur yang paling banyak digunakan dalam pembelajaran mendalam.

Apa yang ditambahkan regularisasi L2 ke fungsi kerugian?

Regularisasi L2 menambahkan lambda kali jumlah bobot kuadrat, memberikan penalti pada bobot yang besar dan mendorong solusi yang lebih kecil dan lebih lancar.

Apa masalah utama yang bisa dicegah oleh penurunan berat badan?

Dengan menjaga bobot tetap kecil, penurunan bobot akan mencegah model menyesuaikan noise, sehingga meningkatkan generalisasi ke data baru.

Ke arah mana peluruhan bobot mendorong bobot model?

Peluruhan bobot menyusutkan bobot hingga nol pada setiap pembaruan, itulah sebabnya terkadang hal ini digambarkan sebagai 'peluruhan' bobot.

Mengapa AdamW diperkenalkan?

Di Adam, memasukkan L2 ke dalam kerugian berinteraksi buruk dengan penskalaan per parameter; AdamW menerapkan peluruhan secara terpisah untuk mengembalikan penyusutan seragam yang diinginkan.

Untuk penurunan gradien stokastik biasa, bagaimana hubungan regularisasi L2 dan peluruhan bobot?

Dengan SGD biasa, menambahkan penalti L2 pada kerugian menghasilkan pembaruan yang sama dengan pengurangan bobot secara langsung, sehingga keduanya setara.