Ekstraksi Model dan Serangan Mencuri
Serangan ekstraksi model memungkinkan musuh mengkloning model AI eksklusif hanya dengan menanyakan API publiknya dan melatih peniru untuk mendapatkan jawabannya.
Ikhtisar
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Menyelam Lebih Dalam
Serangan ekstraksi model (atau pencurian model) memperlakukan model yang diterapkan sebagai oracle. Penyerang mengirimkan masukan, mencatat keluaran, dan melatih model pengganti untuk meniru perilaku tersebut. Karena model target itu sendiri adalah fungsi yang dipelajari yang memetakan input ke output, menyalin pasangan input-output dalam jumlah yang cukup dapat merekonstruksi perkiraan yang mendekati tanpa pernah melihat bobot asli atau data pelatihan. Para peneliti telah mencuri batas-batas keputusan pengklasifikasi gambar dan bahkan mendapatkan kembali bobot yang tepat dari lapisan-lapisan kecil. Pada tahun 2024, sebuah tim menunjukkan bagian dari lapisan penyematan model produksi OpenAI dan Google dapat diekstraksi dengan harga di bawah beberapa ratus dolar. Salinan yang dicuri melemahkan layanan berbayar, mengabaikan filter keamanan, dan memungkinkan serangan kotak putih lebih lanjut seperti membuat contoh yang bermusuhan.
Wawasan Teknis
Semakin kaya respons API, semakin murah pencuriannya. Mengembalikan vektor probabilitas penuh atau logit akan membocorkan lebih banyak informasi per kueri dibandingkan satu label teratas, sehingga penyerang merekonstruksi batasan dengan kueri yang lebih sedikit. Strategi pembelajaran aktif memilih pertanyaan paling informatif yang mendekati batasan keputusan. Hasil penting menunjukkan bahwa menanyakan jumlah dimensi keluaran dapat memulihkan lapisan proyeksi linier akhir secara tepat melalui aljabar linier, karena lapisan tersebut secara efektif merupakan matriks rentang respons.
Dampak Strategis
Risk and safety
Kerugian akibat AI yang bersifat bencana dan sehari-hari bergantung pada siapa yang memahami risikonya dan siapa yang dapat bertindak.
Clearer decisions
Literasi masyarakat dan profesional menentukan apakah kebijakan keselamatan yang kuat memungkinkan secara politis.
Cutting through hype
Penjelasan yang jelas mengurangi penangkapan oleh hype, PR laboratorium, dan teater etika yang tidak jelas.
Masa Depan Ekstraksi Model dan Serangan Pencurian
Pertahanan beralih dari pemblokiran ke deteksi dan degradasi: pembatasan kecepatan, mengembalikan keluaran yang dibulatkan atau hanya 1 teratas, menambahkan kebisingan yang dikalibrasi, perilaku model watermarking sehingga salinan yang dicuri dapat diambil sidik jarinya, dan memantau pola kueri untuk tanda tangan ekstraksi. Harapkan peraturan dan ketentuan perizinan yang memperlakukan ekstraksi sebagai pencurian, ditambah penelitian aktif terhadap arsitektur yang terbukti sulit untuk diekstraksi. Ketika model menjadi lebih besar, ekstraksi penuh tetap mahal, namun ekstraksi sebagian komponen berharga dan kloning gaya distilasi akan tetap menjadi ancaman komersial dan keamanan yang terus-menerus.
Implementasi Dunia Nyata
Sebuah startup menanyakan API pengenalan gambar berbayar milik pesaing ribuan kali dan melatih klon gratis yang mereplikasi keakuratannya.
Peneliti keamanan mengekstrak lapisan proyeksi penyematan akhir dari model bahasa produksi menggunakan kueri API yang dibuat dengan cermat dan hanya memakan biaya beberapa ratus dolar.
Penyerang mengkloning pengklasifikasi spam atau penipuan secara lokal sehingga mereka dapat menyelidikinya secara offline dan membuat masukan yang dapat diandalkan untuk menghindari deteksi.
Vendor cloud menambahkan pemantauan tingkat kueri yang menandai akun yang pola aksesnya cocok dengan ekstraksi pembelajaran aktif dan membatasi responsnya.
Risiko & Pagar Pembatas
Memperlakukan risiko eksistensial sebagai fiksi ilmiah sementara kemampuan bertambah.
Membingungkan keamanan produk permukaan dengan penyelarasan dalam otonomi tinggi.
Membiarkan audiens non-Inggris dan non-ahli hanya memiliki sumber berkualitas rendah.
Peta Jalan Implementasi
Pisahkan risiko bahaya, penyalahgunaan, dan hilangnya kendali/ketidakselarasan produk.
Tanyakan bukti apa yang akan mengubah pandangan Anda mengenai jangka waktu dan tingkat keparahannya.
Lebih memilih sumber primer dan evaluasi konkrit dibandingkan klaim pemasaran.
Identifikasi satu jalur tindakan: karier, kebijakan, pendanaan, atau keterampilan – bukan hanya kesadaran.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Serangan Inferensi Keanggotaan
Pertanyaan yang sering diajukan
What is Model Extraction and Stealing Attacks?
Serangan ekstraksi model memungkinkan musuh mengkloning model AI eksklusif hanya dengan menanyakan API publiknya dan melatih peniru untuk mendapatkan jawabannya. Hal ini penting karena perusahaan menghabiskan jutaan model pelatihan yang dapat didekati dengan harga beberapa ribu panggilan API.
Apa ide inti di balik serangan ekstraksi model?
Ekstraksi memperlakukan model yang diterapkan sebagai oracle: penyerang mengumpulkan pasangan input-output dan melatih model peniru untuk meniru perilaku tersebut, tanpa pernah mengakses bobot aslinya.
Mengapa mengembalikan vektor probabilitas penuh membuat ekstraksi lebih mudah daripada hanya mengembalikan label 1 teratas?
Setiap vektor probabilitas penuh mengungkap lebih banyak permukaan keputusan internal model dibandingkan satu label, sehingga memungkinkan penyerang merekonstruksi batasan dengan kueri yang lebih sedikit.
Teknik pertahanan manakah yang secara langsung mengurangi kebocoran informasi per kueri?
Memperkasar keluaran, misalnya hanya mengembalikan label teratas atau probabilitas yang dibulatkan, mengurangi sinyal yang diberikan setiap respons kepada penyerang, sehingga meningkatkan biaya ekstraksi.
Hasil tahun 2024 menunjukkan bahwa penyerang dapat memulihkan bagian mana dari model bahasa produksi dengan harga murah?
Para peneliti menunjukkan bahwa lapisan proyeksi linier akhir dapat dipulihkan dengan biaya beberapa ratus dolar, karena responsnya mencakup matriks yang dapat dipulihkan.
Mengapa model pengganti yang dicuri lebih berbahaya daripada sekadar kehilangan pendapatan?
Setelah penyerang memiliki salinan lokal, mereka dapat menyelidikinya dengan bebas untuk merancang masukan permusuhan atau serangan penghindaran yang juga menipu sistem asli yang diterapkan.