PANDUAN Masyarakat

Keracunan Data dan Serangan Pintu Belakang

Keracunan data merusak model dengan merusak data pelatihannya, dan serangan pintu belakang menyembunyikan pemicu rahasia yang membuat model berperilaku buruk saat diperintahkan.

2 min readTerakhir diperbarui

Ikhtisar

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Menyelam Lebih Dalam

Serangan keracunan dibagi menjadi dua tujuan besar. Serangan ketersediaan bertujuan untuk menurunkan keakuratan keseluruhan dengan memasukkan contoh yang salah label atau rusak. Serangan bertarget dan serangan pintu belakang lebih licik: model bekerja dengan sempurna pada masukan normal tetapi menghasilkan keluaran yang dipilih penyerang setiap kali pemicu tersembunyi muncul, seperti potongan piksel kecil, frasa tertentu, atau tanda air yang tidak terlihat. Pekerjaan BadNets menunjukkan pengklasifikasi tanda berhenti yang membaca tanda yang diberi stiker sebagai 'batas kecepatan'. Sistem modern terekspos karena mereka melatih data berskala web. Para peneliti menunjukkan bahwa membeli domain kadaluarsa di balik sebagian kecil URL kumpulan data dapat meracuni kumpulan data gambar populer dengan harga beberapa ratus dolar. Model bahasa juga dapat di-backdoor melalui penyempurnaan data atau contoh instruksi yang beracun.

Wawasan Teknis

Pintu belakang yang diberi label bersih sangat berbahaya: sampel yang diracuni tetap memiliki label yang benar dan terlihat normal bagi peninjau manusia, namun sampel tersebut menyematkan fitur pemicu yang dipelajari model untuk dikaitkan dengan kelas target. Kesimpulannya, menyajikan pemicu membalikkan prediksi sementara akurasi bersih tetap tinggi, sehingga validasi standar tidak pernah menangkapnya. Pertahanannya mencakup pengelompokan aktivasi, tanda tangan spektral, rekonstruksi pemicu, dan pemeriksaan asal data.

Dampak Strategis

Risk and safety

Kerugian akibat AI yang bersifat bencana dan sehari-hari bergantung pada siapa yang memahami risikonya dan siapa yang dapat bertindak.

Clearer decisions

Literasi masyarakat dan profesional menentukan apakah kebijakan keselamatan yang kuat memungkinkan secara politis.

Cutting through hype

Penjelasan yang jelas mengurangi penangkapan oleh hype, PR laboratorium, dan teater etika yang tidak jelas.

Masa Depan Keracunan Data dan Serangan Pintu Belakang

Karena rantai pasokan bergantung pada data yang tergores, anak timbangan yang telah dilatih sebelumnya, dan penyesuaian pihak ketiga, keracunan kini berubah dari teori menjadi ancaman nyata terhadap rantai pasokan. Harapkan penandatanganan kumpulan data dan standar asal, pelatihan ketahanan tersertifikasi yang membatasi kerusakan dari sejumlah titik beracun, dan pemindaian model secara terus-menerus sebelum penerapan. Regulator dan kerangka keamanan seperti MITER ATLAS mulai menganggap keracunan sebagai risiko pembelajaran mesin kelas satu.

Implementasi Dunia Nyata

Model visi untuk mobil self-driving yang salah membaca tanda berhenti sebagai tanda batas kecepatan ketika ada stiker pemicu kecil

Meracuni kumpulan data gambar publik secara murah dengan membajak domain kedaluwarsa yang menampung sebagian kecil URL gambarnya

Melakukan backdoor pada model penyelesaian kode sehingga frasa prompt tersembunyi membuatnya memasukkan kode yang tidak aman

Merusak umpan balik pelatihan crowdsourcing filter spam sehingga email berbahaya tertentu lolos

Risiko & Pagar Pembatas

Memperlakukan risiko eksistensial sebagai fiksi ilmiah sementara kemampuan bertambah.

Membingungkan keamanan produk permukaan dengan penyelarasan dalam otonomi tinggi.

Membiarkan audiens non-Inggris dan non-ahli hanya memiliki sumber berkualitas rendah.

Peta Jalan Implementasi

1

Pisahkan risiko bahaya, penyalahgunaan, dan hilangnya kendali/ketidakselarasan produk.

2

Tanyakan bukti apa yang akan mengubah pandangan Anda mengenai jangka waktu dan tingkat keparahannya.

3

Lebih memilih sumber primer dan evaluasi konkrit dibandingkan klaim pemasaran.

4

Identifikasi satu jalur tindakan: karier, kebijakan, pendanaan, atau keterampilan – bukan hanya kesadaran.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Pertanyaan yang sering diajukan

What is Data Poisoning and Backdoor Attacks?

Keracunan data merusak model dengan merusak data pelatihannya, dan serangan pintu belakang menyembunyikan pemicu rahasia yang membuat model berperilaku buruk saat diperintahkan. Hal ini penting karena semakin banyak model yang belajar dari data hasil pengumpulan (crowdsourced) yang dapat dikontaminasi oleh penyerang secara diam-diam.

Apa yang membedakan serangan pintu belakang dengan serangan keracunan ketersediaan umum?

Model pintu belakang bertindak normal pada masukan yang bersih dan menghasilkan keluaran target penyerang hanya ketika pemicu tersembunyi muncul.

Mengapa serangan backdoor clean-label sulit dideteksi?

Karena contoh beracun memiliki label yang benar dan tampak biasa saja, tinjauan manusia dan akurasi validasi standar tidak menandainya.

Apa yang ditunjukkan oleh penelitian BadNets?

BadNets menunjukkan pengklasifikasi rambu lalu lintas pintu belakang yang salah membaca rambu berhenti yang ditandai dengan stiker kecil.

Bagaimana para peneliti menunjukkan bahwa kumpulan data berskala web dapat diracuni dengan harga murah?

Karena kumpulan data mereferensikan gambar berdasarkan URL, pembelian domain lama memungkinkan penyerang mengontrol gambar tersebut dengan biaya yang kecil.

Manakah dari berikut ini yang merupakan pertahanan yang diakui terhadap serangan pintu belakang?

Pertahanan menganalisis aktivasi internal untuk memisahkan contoh yang beracun dan yang bersih, di antara metode deteksi lainnya.