PANDUAN Teknis

Rata-rata Berat Stokastik

Stochastic Weight Averaging (SWA) mengambil rata-rata sederhana dari bobot model dari beberapa titik di akhir pelatihan, bukan hanya menyimpan cuplikan akhir.

2 min readTerakhir diperbarui

Ikhtisar

This cheap trick often lands the model in a flatter, wider region of the loss landscape, which tends to generalize noticeably better on unseen data.

Menyelam Lebih Dalam

Diperkenalkan oleh Izmailov, Wilson, dan rekannya pada tahun 2018, SWA memanfaatkan pengamatan bahwa SGD dengan kecepatan pemelajaran yang konstan atau siklis tidak menyatu pada satu titik — SGD memantul di sekitar tepi lembah yang luas dan datar. Daripada memilih salah satu dari titik perhentian yang ramai tersebut, SWA menjalankan kecepatan pembelajaran yang cukup tinggi (sering kali konstan atau siklik) untuk epoch terakhir dan rata-rata bobot yang dikunjungi, biasanya setiap epoch. Bobot rata-rata berada lebih dekat ke pusat wilayah datar. Karena statistik normalisasi batch dihitung untuk bobot tertentu, SWA memerlukan satu penerusan tambahan pada data untuk menghitung ulang rata-rata dan varians berjalan BN untuk model rata-rata. Biayanya pada dasarnya gratis, dan peningkatan akurasi konsisten di seluruh pengklasifikasi gambar dan seterusnya.

Wawasan Teknis

SWA mempertahankan rata-rata berjalan w_SWA = (n·w_SWA + w_i)/(n+1) yang diperbarui setiap siklus, sementara model SGD langsung terus melakukan eksplorasi dengan kecepatan pemelajaran yang relatif besar. Rata-rata dalam ruang bobot mendekati ansambel dalam ruang fungsi tetapi membutuhkan satu model pada inferensi, tidak banyak. Mekanisme utamanya adalah flat minima kuat terhadap gangguan bobot, sehingga permukaan kerugian pelatihan/pengujian tetap selaras, sehingga mengurangi kesenjangan generalisasi.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Rata-Rata Berat Stochastic

SWA telah melahirkan varian seperti SWA-Gaussian (SWAG) untuk ketidakpastian Bayesian yang murah, dan gagasan rata-rata kini mendasari trik Rata-Rata Pergerakan Eksponensial yang digunakan secara luas dalam model difusi, pembelajaran yang diawasi mandiri, dan pra-pelatihan model besar. Harapkan rata-rata berat badan untuk tetap menjadi 'makan siang gratis' default dalam resep pelatihan, dengan penelitian memperluasnya hingga menggabungkan model yang dilatih secara independen (model sup) dan meningkatkan kalibrasi bersamaan dengan akurasi mentah.

Implementasi Dunia Nyata

Meningkatkan akurasi pengujian pengklasifikasi gambar ResNet dan DenseNet di CIFAR dan ImageNet tanpa biaya inferensi tambahan.

SWAG (SWA-Gaussian) menghasilkan perkiraan ketidakpastian yang dikalibrasi untuk prediksi yang sensitif terhadap keselamatan dari satu kali pelatihan.

Bobot EMA menstabilkan jaringan pengambilan sampel dalam generator gambar difusi seperti Difusi Stabil.

Membangun 'model sup' dengan merata-ratakan beberapa pos pemeriksaan yang telah disesuaikan untuk meningkatkan ketahanan tanpa pelatihan ulang.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stochastic Weight Averaging quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Inisialisasi Berat

Pertanyaan yang sering diajukan

What is Stochastic Weight Averaging?

Stochastic Weight Averaging (SWA) mengambil rata-rata sederhana dari bobot model dari beberapa titik di akhir pelatihan, bukan hanya menyimpan cuplikan akhir. Trik murahan ini sering kali menempatkan model di wilayah lanskap kerugian yang lebih datar dan lebih luas, yang cenderung menggeneralisasi data yang tidak terlihat dengan lebih baik.

Berapa sebenarnya rata-rata Stochastic Weight Averaging?

SWA menghitung rata-rata parameter model (bobot) yang dikumpulkan di beberapa titik pemeriksaan selama fase akhir pelatihan, bukan prediksi atau gradien.

Mengapa SWA cenderung meningkatkan generalisasi?

Rata-rata menggerakkan solusi menuju pusat wilayah datar dari permukaan kerugian, dan minimum datar menggeneralisasi lebih baik karena kerugian rangkaian dan pengujian tetap selaras.

Langkah tambahan apa yang diperlukan SWA untuk jaringan yang menggunakan normalisasi batch?

Karena statistik BN bergantung pada bobot spesifik, model rata-rata memerlukan satu data penerusan tambahan untuk menghitung ulang mean dan varians yang berjalan.

Perilaku kecepatan pembelajaran apa yang biasanya digunakan selama fase rata-rata SWA?

SWA mempertahankan kecepatan pembelajaran konstan atau siklik yang cukup tinggi sehingga SGD terus menjelajahi wilayah datar luas yang poinnya kemudian dirata-ratakan.

Bagaimana biaya inferensi SWA dibandingkan dengan model N model tradisional?

SWA menggabungkan banyak pos pemeriksaan menjadi satu kumpulan bobot rata-rata, sehingga biaya inferensi sama dengan satu model, bukan N.