PANDUAN Teknis

Contoh Permusuhan dan Kekokohan

Contoh adversarial adalah masukan yang terganggu oleh perubahan kecil yang sering kali tidak terlihat sehingga menyebabkan model membuat prediksi yang salah dan meyakinkan.

2 min readTerakhir diperbarui

Ikhtisar

Robustness is the field dedicated to defending against them, and it reveals deep gaps between machine and human perception.

Menyelam Lebih Dalam

Pada tahun 2013-2014, para peneliti menunjukkan bahwa menambahkan pola kebisingan yang hampir tak terlihat ke dalam gambar dapat mengubah pengklasifikasi dari 'panda' menjadi 'owa' dengan tingkat keyakinan yang tinggi. Contoh-contoh permusuhan ini mengeksploitasi fakta bahwa jaringan saraf mempelajari batas-batas keputusan yang rapuh dalam ruang dimensi tinggi. Serangan biasanya berupa kotak putih (penyerang mengetahui model dan menggunakan gradien, seperti pada FGSM dan PGD) atau kotak hitam (hanya keluaran yang terlihat). Menariknya, contoh-contoh permusuhan sering kali berpindah antar model yang berbeda, sehingga memungkinkan terjadinya serangan tanpa akses internal. Bahayanya praktis: stiker dunia fisik dapat menipu detektor tanda berhenti, dan 'jailbreak' injeksi cepat adalah analogi model bahasa. Penelitian kekokohan (robustness) mencari model-model yang berperilaku benar bahkan dalam kasus terburuk, yaitu gangguan yang merugikan.

Wawasan Teknis

Banyak serangan berbasis gradien: FGSM mengambil satu langkah ke arah tanda gradien kerugian sehubungan dengan masukan, sementara PGD mengulanginya dalam bola berbatas kecil (misalnya, L-infinity) di sekitar masukan asli. Pertahanan terkuat yang diketahui adalah pelatihan permusuhan, pelatihan ulang berdasarkan contoh-contoh permusuhan, yang dirumuskan sebagai masalah min-maks: meminimalkan kerugian terhadap gangguan terburuk. Hal ini meningkatkan ketahanan tetapi biasanya memerlukan akurasi dan komputasi yang bersih.

Dampak Strategis

Cost and budget

Keputusan arsitektur mendorong kinerja dan biaya pengoperasian selama bertahun-tahun.

Clearer decisions

Pendidikan teknis membantu tim memilih tumpukan yang tepat, bukan hanya yang terbaru.

Quality control

Pilihan teknik yang lebih baik mengurangi insiden keandalan dalam produksi.

Masa Depan Contoh dan Kekokohan yang Bermusuhan

Saat AI memasuki sistem yang sangat penting bagi keselamatan, ketahanan beralih dari keingintahuan akademis ke persyaratan teknik. Pekerjaan terus dilakukan pada pertahanan tersertifikasi yang secara matematis menjamin tidak ada gangguan yang dapat mengubah hasil, dan pada ketahanan terhadap serangan yang lebih luas dan lebih sulit yang dihadapi model bahasa besar, seperti jailbreak dan injeksi cepat. Harapkan tolok ukur permusuhan yang terstandarisasi, jalur kerja tim merah, dan tekanan peraturan untuk model yang diterapkan dalam mengemudi otonom, keamanan, dan layanan kesehatan untuk menunjukkan keandalan dalam kasus terburuk.

Implementasi Dunia Nyata

Para peneliti menempelkan stiker fisik kecil pada tanda berhenti yang menyebabkan model penglihatan salah membacanya sebagai tanda batas kecepatan, yang menggambarkan ancaman dunia nyata terhadap mobil yang dapat mengemudi sendiri.

Tim keamanan melakukan pengenalan wajah tim merah dengan tambalan permusuhan yang dicetak pada kacamata atau pakaian yang menghindari atau menipu pencocokan identitas.

Filter spam dan malware diselidiki dengan masukan yang terganggu sehingga mempertahankan muatan berbahaya sambil lolos dari pengklasifikasi.

Pengembang LLM bertahan melawan 'jailbreak' injeksi cepat, analogi bahasa dari contoh permusuhan, yang mengelabui model agar mengabaikan instruksi keselamatan.

Risiko & Pagar Pembatas

Mengoptimalkan satu tolok ukur dapat menyembunyikan kelemahan sistem yang lebih luas.

Biaya infrastruktur dan pemeliharaan sering kali diremehkan.

Kesenjangan keamanan dan kemampuan observasi dapat tumbuh seiring dengan semakin kompleksnya sistem.

Peta Jalan Implementasi

1

Tentukan target latensi, kualitas, dan biaya sebelum penerapan.

2

Tolok ukur dalam kondisi beban dan data yang realistis.

3

Pemantauan instrumen untuk kesalahan, penyimpangan, dan dampak pengguna.

4

Siapkan jalur rollback dan respons insiden sebelum melakukan penskalaan.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adversarial Examples and Robustness quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Jaringan Permusuhan Generatif

Pertanyaan yang sering diajukan

What is Adversarial Examples and Robustness?

Contoh adversarial adalah masukan yang terganggu oleh perubahan kecil yang sering kali tidak terlihat sehingga menyebabkan model membuat prediksi yang salah dan meyakinkan. Kekokohan adalah bidang yang didedikasikan untuk bertahan melawan ancaman tersebut, dan hal ini mengungkapkan kesenjangan yang mendalam antara persepsi mesin dan manusia.

Apa contoh permusuhan?

Contoh permusuhan menambahkan gangguan kecil yang dibuat dengan hati-hati yang hampir tidak disadari oleh manusia, tetapi menipu model hingga menghasilkan kesalahan dengan tingkat keyakinan tinggi.

Apa yang membedakan serangan 'kotak putih' dengan serangan 'kotak hitam'?

Penyerang white-box mengetahui modelnya dan dapat menggunakan gradiennya; penyerang kotak hitam hanya melihat masukan dan keluaran.

Pertahanan apa yang paling banyak digunakan untuk meningkatkan ketahanan musuh?

Pelatihan permusuhan menambah pembelajaran dengan masukan yang terganggu dalam kasus terburuk, diformulasikan sebagai optimasi min-maks, dan merupakan pertahanan terkuat yang dapat diandalkan, meskipun dapat mengurangi akurasi bersih.

Mengapa 'keteralihan' contoh-contoh yang bermusuhan menjadi perhatian?

Karena contoh-contoh permusuhan berpindah antar model, penyerang dapat menyusunnya pada model pengganti dan berhasil menyerang target yang tidak dapat mereka periksa.

Apa analogi model bahasa besar dari contoh-contoh permusuhan?

Pembobolan penjara dan suntikan cepat adalah masukan yang dibuat untuk memanipulasi LLM menjadi perilaku yang tidak aman atau tidak diinginkan, sejajar dengan serangan musuh dalam penglihatan.