PANDUAN Asas

Pembesaran Data

Pembesaran data secara buatan mengembangkan set latihan dengan membuat salinan diubah suai bagi contoh sedia ada — seperti menyelak atau memangkas imej.

2 min dibacaKemas kini terakhir

Gambaran keseluruhan

It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.

Menyelam dalam

Pembesaran data menjana contoh latihan baharu dengan menggunakan transformasi pemeliharaan label pada data yang anda sudah ada. Untuk imej, ini bermakna putaran, lambungan, pemangkasan, peralihan warna, kabur dan penambahan hingar — perubahan yang mengubah piksel tetapi bukan jawapan yang betul (kucing terbalik masih kucing). Untuk teks, teknik termasuk penggantian sinonim, terjemahan belakang (terjemah ke bahasa lain dan belakang), dan pemadaman atau pertukaran perkataan rawak. Untuk audio, anda boleh menambah bunyi latar belakang, pic anjakan atau klip regangan masa. Matlamatnya adalah untuk mengajar model invarians yang penting — bahawa identiti objek tidak bergantung pada kedudukan, pencahayaan atau frasanya. Ini menjadikan model lebih teguh dan amat berharga apabila data berlabel adalah terhad, kerana setiap contoh sebenar menjadi banyak. Talian paip moden selalunya membuat penambahan secara rawak semasa setiap zaman latihan.

Wawasan Teknikal

Pembesaran berfungsi kerana ia menyuntik pengetahuan sedia ada tentang invarian terus ke dalam latihan: dengan menunjukkan model banyak versi perubahan satu contoh, anda menggalakkannya mempelajari ciri yang mengabaikan variasi yang tidak berkaitan. Yang penting, transformasi mesti mengekalkan label — menukar '6' menjadi '9' akan mengajar perkara yang salah. Kaedah lanjutan melangkaui pengeditan mudah: Mixup menggabungkan dua imej dan labelnya, kawasan topeng Potongan dan dasar yang dipelajari seperti AutoAugment mencari kombinasi transformasi terbaik untuk set data tertentu.

Kesan Strategik

Keputusan yang lebih jelas

Ia membantu anda memisahkan tuntutan teknikal yang jelas daripada bahasa pemasaran.

Kos dan bajet

Anda boleh bertanya soalan pelaksanaan yang lebih baik sebelum menghabiskan wang atau masa.

Pasukan dan aliran kerja

Pasukan yang berkongsi pemahaman membuat keputusan produk, dasar dan pembelajaran yang lebih baik.

Masa Depan Peningkatan Data

Sempadan adalah pembesaran generatif dan dipelajari: menggunakan model resapan atau GAN untuk mensintesis contoh latihan yang benar-benar baharu dan realistik dan bukannya mengubah yang lama. Carian pembesaran automatik (AutoAugment, RandAugment) mengurangkan penalaan manual, dan pembesaran kini menjadi pusat pembelajaran penyeliaan sendiri, di mana model belajar dengan mengenali bahawa dua paparan tambahan bagi input yang sama harus sepadan. Jangkakan penambahan untuk terus mengaburkan garisan dengan penjanaan data sintetik, terutamanya untuk kelas yang jarang ditemui dan domain sensitif privasi yang sukar untuk mengumpul data sebenar.

Pelaksanaan Dunia Sebenar

Pengelas imej melatih pada foto yang diputar secara rawak, dipotong dan digegarkan warna supaya ia mengecam objek tanpa mengira sudut atau pencahayaan.

Pasukan NLP menggunakan terjemahan belakang (Bahasa Inggeris ke Jerman dan belakang) untuk menghurai ayat dan mengembangkan set data analisis sentimen yang kecil.

Model pertuturan menambah hingar kafe latar belakang dan mengalih pic pada rakaman supaya ia kekal tepat dalam keadaan dunia sebenar yang bising.

AI perubatan menggunakan ubah bentuk anjal dan membalikkan kepada set imbasan MRI terhad untuk membiak contoh berlabel yang terhad tanpa pesakit baharu.

Risiko & Pengawal

Pasukan yang berbeza mungkin menggunakan istilah yang sama secara berbeza, jadi tentukan skop lebih awal.

Penanda aras boleh kelihatan kukuh manakala prestasi dunia sebenar tidak sekata.

Mengabaikan kualiti data dan rancangan penilaian sering menghasilkan hasil yang rapuh.

Hala Tuju Pelaksanaan

1

Mulakan dengan definisi bahasa biasa hasil yang anda perlukan.

2

Pilih satu metrik kejayaan dan satu keadaan kegagalan sebelum ujian.

3

Jalankan juruterbang kecil dengan data perwakilan, bukan set demo yang digilap.

4

Dokumen tempat Augmentasi Data membantu dan kaedah yang lebih mudah adalah lebih baik.

Teruskan Meneroka

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulakan kuiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Soalan lazim

What is Data Augmentation?

Pembesaran data secara buatan mengembangkan set latihan dengan membuat salinan diubah suai bagi contoh sedia ada — seperti menyelak atau memangkas imej. Ini penting kerana data yang lebih pelbagai mengurangkan pemasangan lampau dan membantu model membuat generalisasi kepada input yang tidak mereka lihat.

Apakah tujuan utama penambahan data?

Pembesaran menghasilkan salinan data sedia ada yang diubah suai untuk mengurangkan pemasangan lampau dan membantu model mengendalikan input yang tidak kelihatan.

Manakah antara ini merupakan teknik pembesaran imej yang biasa?

Melibas, memotong, berputar dan anjakan warna ialah pembesaran imej standard yang menukar piksel sambil mengekalkan label.

Apakah yang dilakukan oleh terjemahan belakang dalam penambahan teks?

Terjemahan belakang menjalankan teks melalui bahasa lain dan belakang, menghasilkan versi perkataan semula yang mengekalkan makna.

Mengapakah penambahan mesti 'memelihara label'?

Transformasi tidak seharusnya mengubah jawapan yang betul — membalikkan '6' menjadi '9', sebagai contoh, akan menyalahlabelkan contoh.

Apakah yang dilakukan oleh teknik Mixup?

Mixup mencipta sampel baharu dengan menggabungkan pasangan input dan labelnya secara linear, menggalakkan sempadan keputusan yang lebih lancar.