Toplum REHBERİ

Model Çıkarma ve Çalma Saldırıları

Model çıkarma saldırıları, bir saldırganın yalnızca genel API'sini sorgulayarak ve bir taklitçiyi yanıtlar konusunda eğiterek özel bir AI modelini klonlamasına olanak tanır.

2 min readSon güncelleme

Genel Bakış

It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.

Derin Dalış

Bir model çıkarma (veya model çalma) saldırısı, konuşlandırılan modeli bir kehanet olarak ele alır. Saldırgan girdileri gönderir, çıktıları kaydeder ve davranışı taklit etmek için yedek bir model eğitir. Hedef modelin kendisi girdileri çıktılara eşleyen öğrenilmiş bir fonksiyon olduğundan, yeterli miktarda girdi-çıktı çiftinin kopyalanması, orijinal ağırlıkları veya eğitim verilerini hiç görmeden yakın bir yaklaşımı yeniden oluşturabilir. Araştırmacılar görüntü sınıflandırıcıların karar sınırlarını çaldılar ve hatta küçük katmanların tam ağırlıklarını bile kurtardılar. 2024 yılında bir ekip, OpenAI ve Google üretim modelinin bazı kısımlarını, katmanların birkaç yüz doların altında bir fiyata çıkarılabileceğini gösterdi. Çalınan kopyalar ücretli hizmetlerin altını çiziyor, güvenlik filtrelerini atlıyor ve rakip örnekler oluşturmak gibi daha fazla beyaz kutu saldırılarına olanak tanıyor.

Teknik Bilgi

API yanıtı ne kadar zengin olursa hırsızlık da o kadar ucuz olur. Tam olasılık vektörleri veya logitleri döndürmek, sorgu başına tek bir ilk 1 etiketinden çok daha fazla bilgi sızdırır, böylece saldırganlar sınırları daha az sorguyla yeniden oluşturur. Aktif öğrenme stratejileri, karar sınırlarına yakın en bilgilendirici sorguları seçer. Dönüm noktası niteliğindeki bir sonuç, çıktı boyutu sayımının hemen üzerindeki sorgulamanın, son doğrusal projeksiyon katmanını tam olarak doğrusal cebir yoluyla kurtarabildiğini gösterdi, çünkü bu katman, yanıtları kapsayan etkili bir matristir.

Stratejik Etki

Risk and safety

Yıkıcı ve günlük yapay zeka zararları, kimin riskleri anladığı ve kimin harekete geçebileceğine bağlıdır.

Daha net kararlar

Kamu ve profesyonel okuryazarlık, güçlü bir güvenlik politikasının politik olarak mümkün olup olmadığını şekillendirir.

Cutting through hype

Açık açıklamalar abartılı reklamların, laboratuvar halkla ilişkiler uygulamalarının ve belirsiz etik tiyatrosunun etkisi altına girmeyi azaltır.

Model Çıkarma ve Çalma Saldırılarının Geleceği

Savunmalar, engellemeden algılama ve bozulmaya doğru kayıyor: hız sınırlama, yuvarlatılmış veya yalnızca ilk 1 çıkışları döndürme, kalibre edilmiş gürültü ekleme, çalınan kopyaların parmak izinin alınabilmesi için model davranışına filigran ekleme ve imzaların çıkarılması için sorgu modellerinin izlenmesi. Çıkarmayı hırsızlık olarak ele alan düzenleme ve lisans koşullarının yanı sıra, çıkarılmasının zor olduğu kanıtlanabilen mimarilere yönelik aktif araştırmalar yapılmasını bekleyebilirsiniz. Modeller büyüdükçe, tam çıkarma maliyetli olmaya devam edecek, ancak değerli bileşenlerin kısmi çıkarılması ve damıtma tarzı klonlama kalıcı bir ticari ve güvenlik tehdidi olmaya devam edecek.

Gerçek Dünya Uygulaması

Yeni kurulan bir şirket, bir rakibin ücretli görüntü tanıma API'sini binlerce kez sorguluyor ve doğruluğunu kopyalayan ücretsiz bir klonu eğitiyor.

Güvenlik araştırmacıları, yalnızca birkaç yüz dolara mal olan, özenle hazırlanmış API sorgularını kullanarak bir üretim dili modelinin son yerleştirme-projeksiyon katmanını çıkarıyor.

Saldırgan, bir spam veya dolandırıcılık sınıflandırıcısını yerel olarak klonlayarak onu çevrimdışı olarak inceleyebilir ve tespit edilmekten güvenilir bir şekilde kaçan girdiler oluşturabilir.

Bir bulut satıcısı, erişim düzeni aktif öğrenme çıkarımıyla eşleşen bir hesabı işaretleyen ve yanıtlarını kısıtlayan sorgu hızı izleme özelliği ekler.

Riskler ve Korkuluklar

Yetenekleri artırırken varoluşsal riski bilim kurgu olarak ele almak.

Yüzey ürün güvenliğini yüksek özerklik altında hizalamayla karıştırmak.

İngilizce olmayan ve uzman olmayan izleyici kitlesini yalnızca düşük kaliteli kaynaklarla bırakmak.

Uygulama Yol Haritası

1

Ürün zararları, yanlış kullanım ve kontrol kaybı/yanlış hizalama risklerini ayırın.

2

Hangi kanıtların zaman çizelgeleri ve ciddiyet konusundaki görüşünüzü değiştireceğini sorun.

3

Pazarlama iddiaları yerine birincil kaynakları ve somut değerlendirmeleri tercih edin.

4

Tek bir eylem yolu belirleyin: kariyer, politika, finansman veya beceriler; yalnızca farkındalık değil.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Model Extraction and Stealing Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Üyelik Çıkarımı Saldırıları

Sık sorulan sorular

What is Model Extraction and Stealing Attacks?

Model çıkarma saldırıları, bir saldırganın yalnızca genel API'sini sorgulayarak ve bir taklitçiyi yanıtlar konusunda eğiterek özel bir AI modelini klonlamasına olanak tanır. Bu önemlidir çünkü şirketler, birkaç bin API çağrısının fiyatına yaklaşabilecek milyonlarca eğitim modeli harcıyor.

Model çıkarma saldırısının ardındaki temel fikir nedir?

Çıkarma, dağıtılan modeli bir kehanet gibi ele alır: Saldırgan, giriş-çıkış çiftlerini toplar ve orijinal ağırlıklara hiç erişmeden davranışı taklit edecek bir taklit modeli eğitir.

Neden tam olasılık vektörlerini döndürmek, çıkarmayı yalnızca ilk 1 etiketi döndürmekten daha kolay hale getiriyor?

Her tam olasılık vektörü, modelin dahili karar yüzeyi hakkında tek bir etiketten çok daha fazlasını ortaya çıkarır ve saldırganın sınırı daha az sorguyla yeniden yapılandırmasına olanak tanır.

Hangi savunma tekniği sorgu başına sızdırılan bilgileri doğrudan azaltır?

Çıktıların kabalaştırılması, örneğin yalnızca en üstteki etiketi veya yuvarlatılmış olasılıkları döndürmek, her yanıtın saldırgana verdiği sinyali azaltır ve çıkarma maliyetini artırır.

2024'teki bir sonuç, saldırganların üretim dili modelinin hangi bölümünü tam olarak ucuza kurtarabileceğini gösterdi?

Araştırmacılar, son doğrusal projeksiyon katmanının tam olarak birkaç yüz dolara kurtarılabileceğini gösterdi çünkü yanıtları kurtarılabilir bir matrisi kapsıyordu.

Çalınan bir ikame model, gelir kaybının ötesinde neden tehlikelidir?

Saldırganlar yerel bir kopyaya sahip olduklarında, orijinal konuşlandırılmış sistemi de kandıracak düşmanca girdiler veya saldırı saldırıları tasarlamak için onu özgürce inceleyebilirler.