PANDUAN Dasar

Augmentasi Data

Augmentasi data secara artifisial memperluas set pelatihan dengan membuat salinan modifikasi dari contoh yang ada — seperti membalik atau memotong gambar.

2 min readTerakhir diperbarui

Ikhtisar

It matters because more varied data reduces overfitting and helps models generalize to inputs they have not seen.

Menyelam Lebih Dalam

Augmentasi data menghasilkan contoh pelatihan baru dengan menerapkan transformasi pelestarian label pada data yang sudah Anda miliki. Untuk gambar, hal ini berarti rotasi, pembalikan, pemotongan, perubahan warna, pengaburan, dan penambahan noise — perubahan yang mengubah piksel tetapi bukan jawaban yang benar (kucing yang dibalik tetaplah kucing). Untuk teks, tekniknya meliputi penggantian sinonim, terjemahan balik (menerjemahkan ke bahasa lain dan sebaliknya), dan penghapusan atau pertukaran kata secara acak. Untuk audio, Anda dapat menambahkan kebisingan latar belakang, pergeseran nada, atau klip rentang waktu. Tujuannya adalah untuk mengajarkan model tentang invarian yang penting — bahwa identitas suatu objek tidak bergantung pada posisi, pencahayaan, atau frasanya. Hal ini membuat model lebih kuat dan sangat berguna ketika data berlabel langka, karena setiap contoh nyata akan menjadi banyak. Pipeline modern sering kali mengacak augmentasi dengan cepat selama setiap periode pelatihan.

Wawasan Teknis

Augmentasi berfungsi karena memasukkan pengetahuan sebelumnya tentang invarian langsung ke dalam pelatihan: dengan menunjukkan banyak versi transformasi dari satu contoh kepada model, Anda mendorongnya untuk mempelajari fitur-fitur yang mengabaikan variasi yang tidak relevan. Yang terpenting, transformasi harus mempertahankan labelnya — mengubah angka '6' menjadi '9' akan mengajarkan hal yang salah. Metode tingkat lanjut lebih dari sekadar pengeditan sederhana: Mixup memadukan dua gambar dan labelnya, wilayah masker Cutout, dan kebijakan yang dipelajari seperti penelusuran AutoAugment untuk kombinasi transformasi terbaik untuk kumpulan data tertentu.

Dampak Strategis

Clearer decisions

Ini membantu Anda memisahkan klaim teknis yang jelas dari bahasa pemasaran.

Cost and budget

Anda dapat mengajukan pertanyaan implementasi yang lebih baik sebelum mengeluarkan uang atau waktu.

Team and workflow

Tim dengan pemahaman bersama membuat keputusan produk, kebijakan, dan pembelajaran yang lebih baik.

Masa Depan Augmentasi Data

Batasannya adalah augmentasi generatif dan pembelajaran: menggunakan model difusi atau GAN untuk mensintesis contoh pelatihan yang benar-benar baru dan realistis, bukan hanya mentransformasi model lama. Penelusuran augmentasi otomatis (AutoAugment, RandAugment) mengurangi penyetelan manual, dan augmentasi kini menjadi pusat pembelajaran dengan pengawasan mandiri, di mana model belajar dengan mengenali bahwa dua tampilan augmentasi dari masukan yang sama harus cocok. Harapkan augmentasi untuk terus mengaburkan batasan dalam pembuatan data sintetis, terutama untuk kelas langka dan domain sensitif privasi di mana pengumpulan data nyata sulit dilakukan.

Implementasi Dunia Nyata

Pengklasifikasi gambar melatih foto yang diputar secara acak, dipotong, dan diubah warnanya sehingga dapat mengenali objek apa pun sudut atau pencahayaannya.

Tim NLP menggunakan terjemahan balik (Bahasa Inggris ke Bahasa Jerman dan sebaliknya) untuk memparafrasekan kalimat dan memperluas kumpulan data analisis sentimen kecil.

Model ucapan menambahkan kebisingan latar belakang kafe dan mengubah nada pada rekaman sehingga tetap akurat dalam kondisi dunia nyata yang bising.

AI medis menerapkan deformasi elastis dan membalik ke serangkaian pemindaian MRI terbatas untuk melipatgandakan contoh berlabel langka tanpa pasien baru.

Risiko & Pagar Pembatas

Tim yang berbeda mungkin menggunakan istilah yang sama secara berbeda, jadi tentukan cakupannya sejak dini.

Tolok ukur dapat terlihat kuat sementara kinerja di dunia nyata tidak merata.

Mengabaikan kualitas data dan rencana evaluasi sering kali menimbulkan hasil yang rapuh.

Peta Jalan Implementasi

1

Mulailah dengan definisi bahasa sederhana tentang hasil yang Anda butuhkan.

2

Pilih satu metrik keberhasilan dan satu kondisi kegagalan sebelum pengujian.

3

Jalankan uji coba kecil dengan data yang representatif, bukan kumpulan demo yang disempurnakan.

4

Dokumentasikan di mana Augmentasi Data membantu dan di mana metode yang lebih sederhana lebih baik.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Augmentation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Pertanyaan yang sering diajukan

What is Data Augmentation?

Augmentasi data secara artifisial memperluas set pelatihan dengan membuat salinan modifikasi dari contoh yang ada — seperti membalik atau memotong gambar. Hal ini penting karena data yang lebih bervariasi mengurangi overfitting dan membantu model menggeneralisasi masukan yang belum mereka lihat.

Apa tujuan utama augmentasi data?

Augmentasi membuat salinan data yang ada yang bervariasi dan dimodifikasi untuk mengurangi overfitting dan membantu model menangani masukan yang tidak terlihat.

Manakah dari teknik berikut yang merupakan teknik augmentasi gambar yang umum?

Membalik, memotong, memutar, dan pergeseran warna adalah augmentasi gambar standar yang mengubah piksel sambil mempertahankan label.

Apa yang dilakukan terjemahan balik dalam augmentasi teks?

Terjemahan balik menjalankan teks melalui bahasa lain dan sebaliknya, menghasilkan versi penulisan ulang yang mempertahankan makna.

Mengapa augmentasi harus bersifat 'melestarikan label'?

Transformasi tidak boleh mengubah jawaban yang benar — membalik angka '6' menjadi '9', misalnya, akan memberikan label yang salah pada contoh.

Apa yang dilakukan teknik Mixup?

Mixup menciptakan sampel baru dengan menggabungkan pasangan input dan labelnya secara linier, sehingga mendorong batasan keputusan yang lebih mulus.