Keracunan Data dan Serangan Pintu Belakang
Keracunan data merusak model dengan merusak data pelatihannya, dan serangan pintu belakang menyembunyikan pemicu rahasia yang membuat model berperilaku buruk saat diperintahkan.
Ikhtisar
They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.
Menyelam Lebih Dalam
Serangan keracunan dibagi menjadi dua tujuan besar. Serangan ketersediaan bertujuan untuk menurunkan keakuratan keseluruhan dengan memasukkan contoh yang salah label atau rusak. Serangan bertarget dan serangan pintu belakang lebih licik: model bekerja dengan sempurna pada masukan normal tetapi menghasilkan keluaran yang dipilih penyerang setiap kali pemicu tersembunyi muncul, seperti potongan piksel kecil, frasa tertentu, atau tanda air yang tidak terlihat. Pekerjaan BadNets menunjukkan pengklasifikasi tanda berhenti yang membaca tanda yang diberi stiker sebagai 'batas kecepatan'. Sistem modern terekspos karena mereka melatih data berskala web. Para peneliti menunjukkan bahwa membeli domain kadaluarsa di balik sebagian kecil URL kumpulan data dapat meracuni kumpulan data gambar populer dengan harga beberapa ratus dolar. Model bahasa juga dapat di-backdoor melalui penyempurnaan data atau contoh instruksi yang beracun.
Wawasan Teknis
Pintu belakang yang diberi label bersih sangat berbahaya: sampel yang diracuni tetap memiliki label yang benar dan terlihat normal bagi peninjau manusia, namun sampel tersebut menyematkan fitur pemicu yang dipelajari model untuk dikaitkan dengan kelas target. Kesimpulannya, menyajikan pemicu membalikkan prediksi sementara akurasi bersih tetap tinggi, sehingga validasi standar tidak pernah menangkapnya. Pertahanannya mencakup pengelompokan aktivasi, tanda tangan spektral, rekonstruksi pemicu, dan pemeriksaan asal data.
Dampak Strategis
Risk and safety
Kerugian akibat AI yang bersifat bencana dan sehari-hari bergantung pada siapa yang memahami risikonya dan siapa yang dapat bertindak.
Clearer decisions
Literasi masyarakat dan profesional menentukan apakah kebijakan keselamatan yang kuat memungkinkan secara politis.
Cutting through hype
Penjelasan yang jelas mengurangi penangkapan oleh hype, PR laboratorium, dan teater etika yang tidak jelas.
Masa Depan Keracunan Data dan Serangan Pintu Belakang
Karena rantai pasokan bergantung pada data yang tergores, anak timbangan yang telah dilatih sebelumnya, dan penyesuaian pihak ketiga, keracunan kini berubah dari teori menjadi ancaman nyata terhadap rantai pasokan. Harapkan penandatanganan kumpulan data dan standar asal, pelatihan ketahanan tersertifikasi yang membatasi kerusakan dari sejumlah titik beracun, dan pemindaian model secara terus-menerus sebelum penerapan. Regulator dan kerangka keamanan seperti MITER ATLAS mulai menganggap keracunan sebagai risiko pembelajaran mesin kelas satu.
Implementasi Dunia Nyata
Model visi untuk mobil self-driving yang salah membaca tanda berhenti sebagai tanda batas kecepatan ketika ada stiker pemicu kecil
Meracuni kumpulan data gambar publik secara murah dengan membajak domain kedaluwarsa yang menampung sebagian kecil URL gambarnya
Melakukan backdoor pada model penyelesaian kode sehingga frasa prompt tersembunyi membuatnya memasukkan kode yang tidak aman
Merusak umpan balik pelatihan crowdsourcing filter spam sehingga email berbahaya tertentu lolos
Risiko & Pagar Pembatas
Memperlakukan risiko eksistensial sebagai fiksi ilmiah sementara kemampuan bertambah.
Membingungkan keamanan produk permukaan dengan penyelarasan dalam otonomi tinggi.
Membiarkan audiens non-Inggris dan non-ahli hanya memiliki sumber berkualitas rendah.
Peta Jalan Implementasi
Pisahkan risiko bahaya, penyalahgunaan, dan hilangnya kendali/ketidakselarasan produk.
Tanyakan bukti apa yang akan mengubah pandangan Anda mengenai jangka waktu dan tingkat keparahannya.
Lebih memilih sumber primer dan evaluasi konkrit dibandingkan klaim pemasaran.
Identifikasi satu jalur tindakan: karier, kebijakan, pendanaan, atau keterampilan – bukan hanya kesadaran.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Poisoning and Backdoor Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Data Sintetis
Pertanyaan yang sering diajukan
What is Data Poisoning and Backdoor Attacks?
Keracunan data merusak model dengan merusak data pelatihannya, dan serangan pintu belakang menyembunyikan pemicu rahasia yang membuat model berperilaku buruk saat diperintahkan. Hal ini penting karena semakin banyak model yang belajar dari data hasil pengumpulan (crowdsourced) yang dapat dikontaminasi oleh penyerang secara diam-diam.
Apa yang membedakan serangan pintu belakang dengan serangan keracunan ketersediaan umum?
Model pintu belakang bertindak normal pada masukan yang bersih dan menghasilkan keluaran target penyerang hanya ketika pemicu tersembunyi muncul.
Mengapa serangan backdoor clean-label sulit dideteksi?
Karena contoh beracun memiliki label yang benar dan tampak biasa saja, tinjauan manusia dan akurasi validasi standar tidak menandainya.
Apa yang ditunjukkan oleh penelitian BadNets?
BadNets menunjukkan pengklasifikasi rambu lalu lintas pintu belakang yang salah membaca rambu berhenti yang ditandai dengan stiker kecil.
Bagaimana para peneliti menunjukkan bahwa kumpulan data berskala web dapat diracuni dengan harga murah?
Karena kumpulan data mereferensikan gambar berdasarkan URL, pembelian domain lama memungkinkan penyerang mengontrol gambar tersebut dengan biaya yang kecil.
Manakah dari berikut ini yang merupakan pertahanan yang diakui terhadap serangan pintu belakang?
Pertahanan menganalisis aktivasi internal untuk memisahkan contoh yang beracun dan yang bersih, di antara metode deteksi lainnya.