Augmentasi Data
Augmentasi data secara artifisial memperluas set pelatihan dengan membuat salinan modifikasi dari contoh yang ada — seperti membalik atau memotong gambar.
Ikhtisar
It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.
Menyelam Lebih Dalam
Augmentasi data menghasilkan contoh pelatihan baru dengan menerapkan transformasi pelestarian label pada data yang sudah Anda miliki. Untuk gambar, hal ini berarti rotasi, pembalikan, pemotongan, perubahan warna, pengaburan, dan penambahan noise — perubahan yang mengubah piksel tetapi bukan jawaban yang benar (kucing yang dibalik tetaplah kucing). Untuk teks, tekniknya meliputi penggantian sinonim, terjemahan balik (menerjemahkan ke bahasa lain dan sebaliknya), dan penghapusan atau pertukaran kata secara acak. Untuk audio, Anda dapat menambahkan kebisingan latar belakang, pergeseran nada, atau klip rentang waktu. Tujuannya adalah untuk mengajarkan model tentang invarian yang penting — bahwa identitas suatu objek tidak bergantung pada posisi, pencahayaan, atau frasanya. Hal ini membuat model lebih kuat dan sangat berguna ketika data berlabel langka, karena setiap contoh nyata akan menjadi banyak. Pipeline modern sering kali mengacak augmentasi dengan cepat selama setiap periode pelatihan.
Wawasan Teknis
Augmentasi berfungsi karena memasukkan pengetahuan sebelumnya tentang invarian langsung ke dalam pelatihan: dengan menunjukkan banyak versi transformasi dari satu contoh kepada model, Anda mendorongnya untuk mempelajari fitur-fitur yang mengabaikan variasi yang tidak relevan. Yang terpenting, transformasi harus mempertahankan labelnya — mengubah angka '6' menjadi '9' akan mengajarkan hal yang salah. Metode tingkat lanjut lebih dari sekadar pengeditan sederhana: Mixup memadukan dua gambar dan labelnya, wilayah masker Cutout, dan kebijakan yang dipelajari seperti penelusuran AutoAugment untuk kombinasi transformasi terbaik untuk kumpulan data tertentu.
Dampak Strategis
Clearer decisions
Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.
Cost and budget
Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.
Team and workflow
Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.
Masa Depan Augmentasi Data
Batasannya adalah augmentasi generatif dan pembelajaran: menggunakan model difusi atau GAN untuk mensintesis contoh pelatihan yang benar-benar baru dan realistis, bukan hanya mentransformasi model lama. Penelusuran augmentasi otomatis (AutoAugment, RandAugment) mengurangi penyetelan manual, dan augmentasi kini menjadi pusat pembelajaran dengan pengawasan mandiri, di mana model belajar dengan mengenali bahwa dua tampilan augmentasi dari masukan yang sama harus cocok. Harapkan augmentasi untuk terus mengaburkan batasan dalam pembuatan data sintetis, terutama untuk kelas langka dan domain sensitif privasi di mana pengumpulan data nyata sulit dilakukan.
Implementasi Dunia Nyata
Pengklasifikasi gambar melatih foto yang diputar secara acak, dipotong, dan diubah warnanya sehingga dapat mengenali objek apa pun sudut atau pencahayaannya.
Tim NLP menggunakan terjemahan balik (Bahasa Inggris ke Bahasa Jerman dan sebaliknya) untuk memparafrasekan kalimat dan memperluas kumpulan data analisis sentimen kecil.
Model ucapan menambahkan kebisingan latar belakang kafe dan mengubah nada pada rekaman sehingga tetap akurat dalam kondisi dunia nyata yang bising.
AI medis menerapkan deformasi elastis dan membalik ke serangkaian pemindaian MRI terbatas untuk melipatgandakan contoh berlabel langka tanpa pasien baru.
Risiko & Pagar Pembatas
Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.
Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.
Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.
Peta Jalan Implementasi
Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.
Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.
Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.
Dokumentasikan di mana Augmentasi Data membantu dan di mana metode yang lebih sederhana lebih baik.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Augmentation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
AI & Data
Pertanyaan yang sering diajukan
What is Data Augmentation?
Augmentasi data secara artifisial memperluas set pelatihan dengan membuat salinan modifikasi dari contoh yang ada — seperti membalik atau memotong gambar. Hal ini penting karena data yang lebih bervariasi mengurangi overfitting dan membantu model menggeneralisasi masukan yang belum mereka lihat.
Apa tujuan utama augmentasi data?
Augmentasi membuat salinan data yang ada yang bervariasi dan dimodifikasi untuk mengurangi overfitting dan membantu model menangani masukan yang tidak terlihat.
Manakah dari teknik berikut yang merupakan teknik augmentasi gambar yang umum?
Membalik, memotong, memutar, dan pergeseran warna adalah augmentasi gambar standar yang mengubah piksel sambil mempertahankan label.
Apa yang dilakukan terjemahan balik dalam augmentasi teks?
Terjemahan balik menjalankan teks melalui bahasa lain dan sebaliknya, menghasilkan versi penulisan ulang yang mempertahankan makna.
Mengapa augmentasi harus bersifat 'melestarikan label'?
Transformasi tidak boleh mengubah jawaban yang benar — membalik angka '6' menjadi '9', misalnya, akan memberikan label yang salah pada contoh.
Apa yang dilakukan teknik Mixup?
Mixup menciptakan sampel baru dengan menggabungkan pasangan input dan labelnya secara linier, sehingga mendorong batasan keputusan yang lebih mulus.