PANDUAN Asas

Keciciran dan Regularisasi Stochastic

Keciciran ialah helah penyelarasan yang mematikan sebahagian kecil neuron secara rawak semasa setiap langkah latihan, memaksa rangkaian membina perwakilan yang berlebihan dan mantap.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It became one of the most influential techniques for fighting overfitting in deep learning.

Menyelam dalam

Diperkenalkan oleh kumpulan Hinton sekitar 2012, keciciran menangani kelemahan utama rangkaian besar: neuron boleh menyesuaikan diri, belajar untuk membetulkan kesilapan masing-masing dengan cara yang hanya berfungsi pada data latihan. Pada setiap hantaran ke hadapan semasa latihan, keciciran secara rawak menetapkan output setiap neuron kepada sifar dengan beberapa kebarangkalian p (selalunya 0.5 dalam lapisan padat). Kerana mana-mana neuron mungkin lenyap, rangkaian tidak boleh bersandar pada perkongsian yang rapuh dan mesti menyebarkan maklumat berguna merentasi banyak unit. Ini bertindak seperti melatih ensemble besar rangkaian nipis yang berkongsi berat. Pada masa ujian keciciran dimatikan dan rangkaian penuh digunakan, dengan pengaktifan berskala supaya output yang dijangka sepadan dengan latihan. Hasilnya biasanya generalisasi yang lebih baik dengan kos latihan yang lebih lama sedikit.

Wawasan Teknikal

Semasa latihan, setiap unit disimpan dengan kebarangkalian (1 tolak p) melalui topeng binari rawak, jadi sub-rangkaian yang berbeza diambil sampel setiap kelompok. Rangka kerja moden menggunakan keciciran terbalik: pengaktifan yang masih hidup dibahagikan dengan (1 tolak p) pada masa kereta api, jadi tiada penskalaan diperlukan pada inferens. Rawak ini menyuntik hingar yang tidak menggalakkan penyesuaian bersama dan menganggarkan purata ke atas bilangan eksponen sub-rangkaian berat kongsi, satu bentuk himpunan yang murah.

Kesan Strategik

Keputusan yang lebih jelas

Ia membantu anda memisahkan tuntutan teknikal yang jelas daripada bahasa pemasaran.

Kos dan bajet

Anda boleh bertanya soalan pelaksanaan yang lebih baik sebelum menghabiskan wang atau masa.

Pasukan dan aliran kerja

Pasukan yang berkongsi pemahaman membuat keputusan produk, dasar dan pembelajaran yang lebih baik.

Masa Depan Keciciran dan Regularisasi Stokastik

Dalam rangkaian penglihatan konvolusi, penormalan kelompok sebahagian besarnya telah menggantikan keciciran standard, tetapi varian berkembang maju di tempat lain: transformer menggunakan keciciran pada lapisan perhatian dan suapan ke hadapan, dan DropPath (kedalaman stokastik) menjatuhkan keseluruhan blok baki. Monte Carlo keciciran, yang mengekalkan keciciran aktif pada inferens, digunakan untuk menganggarkan ketidakpastian model. Jangkakan penyusunan stokastik kekal sebagai kit alat yang fleksibel, disesuaikan mengikut seni bina dan bukannya satu resipi tetap.

Pelaksanaan Dunia Sebenar

Menambah lapisan Tercicir dengan p sekitar 0.5 antara lapisan padat imej atau pengelas teks dalam PyTorch atau Keras

Model Transformer menggunakan keciciran pada pemberat perhatian dan pengaktifan suapan ke hadapan semasa pralatihan

Monte Carlo keciciran, di mana keciciran kekal pada inferens untuk menghasilkan anggaran ketidakpastian untuk ramalan perubatan atau keselamatan kritikal

Kedalaman stokastik (DropPath) melangkau blok sisa secara rawak untuk mengatur rangkaian yang sangat dalam seperti ResNets dan pengubah penglihatan

Risiko & Pengawal

Pasukan yang berbeza mungkin menggunakan istilah yang sama secara berbeza, jadi tentukan skop lebih awal.

Penanda aras boleh kelihatan kukuh manakala prestasi dunia sebenar tidak sekata.

Mengabaikan kualiti data dan rancangan penilaian sering menghasilkan hasil yang rapuh.

Hala Tuju Pelaksanaan

1

Mulakan dengan definisi bahasa biasa hasil yang anda perlukan.

2

Pilih satu metrik kejayaan dan satu keadaan kegagalan sebelum ujian.

3

Jalankan juruterbang kecil dengan data perwakilan, bukan set demo yang digilap.

4

Dokumen di mana Keciciran dan Regularisasi Stokastik membantu dan kaedah yang lebih mudah adalah lebih baik.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dropout and Stochastic Regularization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Panduan seterusnya

Penurunan Kecerunan Stokastik dengan Momentum

Soalan lazim

What is Dropout and Stochastic Regularization?

Keciciran ialah helah penyelarasan yang mematikan sebahagian kecil neuron secara rawak semasa setiap langkah latihan, memaksa rangkaian membina perwakilan yang berlebihan dan mantap. Ia menjadi salah satu teknik yang paling berpengaruh untuk melawan overfitting dalam pembelajaran mendalam.

Apakah yang dilakukan keciciran semasa latihan?

Keciciran secara rawak mensifarkan setiap neuron dengan kebarangkalian p semasa latihan, jadi sub-rangkaian yang berbeza digunakan setiap langkah.

Mengapakah keciciran meningkatkan generalisasi?

Dengan mengalih keluar unit secara rawak, keciciran menghentikan neuron daripada membentuk perkongsian rapuh yang hanya berfungsi pada data latihan, meningkatkan keteguhan.

Apakah yang berlaku kepada keciciran pada masa ujian (inferens)?

Secara inferens, rangkaian penuh berjalan dengan keciciran dilumpuhkan, dan pengaktifan diskalakan supaya output yang dijangka sepadan dengan pengedaran latihan.

Kadar keciciran p = 0.5 dalam satu lapisan bermakna kira-kira apa semasa latihan?

Dengan p = 0.5 setiap neuron mempunyai peluang 50 peratus untuk disifarkan, jadi secara purata kira-kira separuh digugurkan setiap hantaran hadapan.

Apakah keciciran yang sering digambarkan sebagai anggaran?

Mensampel sub-rangkaian yang berbeza setiap langkah menghampiri purata ke atas bilangan eksponen rangkaian berat kongsi, satu bentuk himpunan murah.