Model Çıkarma ve Çalma Saldırıları
Model çıkarma saldırıları, bir saldırganın yalnızca genel API'sini sorgulayarak ve bir taklitçiyi yanıtlar konusunda eğiterek özel bir AI modelini klonlamasına olanak tanır.
Genel Bakış
It matters because companies spend millions training models that can be approximated for the price of a few thousand API calls.
Derin Dalış
Bir model çıkarma (veya model çalma) saldırısı, konuşlandırılan modeli bir kehanet olarak ele alır. Saldırgan girdileri gönderir, çıktıları kaydeder ve davranışı taklit etmek için yedek bir model eğitir. Hedef modelin kendisi girdileri çıktılara eşleyen öğrenilmiş bir fonksiyon olduğundan, yeterli miktarda girdi-çıktı çiftinin kopyalanması, orijinal ağırlıkları veya eğitim verilerini hiç görmeden yakın bir yaklaşımı yeniden oluşturabilir. Araştırmacılar görüntü sınıflandırıcıların karar sınırlarını çaldılar ve hatta küçük katmanların tam ağırlıklarını bile kurtardılar. 2024 yılında bir ekip, OpenAI ve Google üretim modelinin bazı kısımlarını, katmanların birkaç yüz doların altında bir fiyata çıkarılabileceğini gösterdi. Çalınan kopyalar ücretli hizmetlerin altını çiziyor, güvenlik filtrelerini atlıyor ve rakip örnekler oluşturmak gibi daha fazla beyaz kutu saldırılarına olanak tanıyor.
Teknik Bilgi
API yanıtı ne kadar zengin olursa hırsızlık da o kadar ucuz olur. Tam olasılık vektörleri veya logitleri döndürmek, sorgu başına tek bir ilk 1 etiketinden çok daha fazla bilgi sızdırır, böylece saldırganlar sınırları daha az sorguyla yeniden oluşturur. Aktif öğrenme stratejileri, karar sınırlarına yakın en bilgilendirici sorguları seçer. Dönüm noktası niteliğindeki bir sonuç, çıktı boyutu sayımının hemen üzerindeki sorgulamanın, son doğrusal projeksiyon katmanını tam olarak doğrusal cebir yoluyla kurtarabildiğini gösterdi, çünkü bu katman, yanıtları kapsayan etkili bir matristir.
Stratejik Etki
Risk and safety
Yıkıcı ve günlük yapay zeka zararları, kimin riskleri anladığı ve kimin harekete geçebileceğine bağlıdır.
Daha net kararlar
Kamu ve profesyonel okuryazarlık, güçlü bir güvenlik politikasının politik olarak mümkün olup olmadığını şekillendirir.
Cutting through hype
Açık açıklamalar abartılı reklamların, laboratuvar halkla ilişkiler uygulamalarının ve belirsiz etik tiyatrosunun etkisi altına girmeyi azaltır.
Model Çıkarma ve Çalma Saldırılarının Geleceği
Savunmalar, engellemeden algılama ve bozulmaya doğru kayıyor: hız sınırlama, yuvarlatılmış veya yalnızca ilk 1 çıkışları döndürme, kalibre edilmiş gürültü ekleme, çalınan kopyaların parmak izinin alınabilmesi için model davranışına filigran ekleme ve imzaların çıkarılması için sorgu modellerinin izlenmesi. Çıkarmayı hırsızlık olarak ele alan düzenleme ve lisans koşullarının yanı sıra, çıkarılmasının zor olduğu kanıtlanabilen mimarilere yönelik aktif araştırmalar yapılmasını bekleyebilirsiniz. Modeller büyüdükçe, tam çıkarma maliyetli olmaya devam edecek, ancak değerli bileşenlerin kısmi çıkarılması ve damıtma tarzı klonlama kalıcı bir ticari ve güvenlik tehdidi olmaya devam edecek.
Gerçek Dünya Uygulaması
Yeni kurulan bir şirket, bir rakibin ücretli görüntü tanıma API'sini binlerce kez sorguluyor ve doğruluğunu kopyalayan ücretsiz bir klonu eğitiyor.
Güvenlik araştırmacıları, yalnızca birkaç yüz dolara mal olan, özenle hazırlanmış API sorgularını kullanarak bir üretim dili modelinin son yerleştirme-projeksiyon katmanını çıkarıyor.
Saldırgan, bir spam veya dolandırıcılık sınıflandırıcısını yerel olarak klonlayarak onu çevrimdışı olarak inceleyebilir ve tespit edilmekten güvenilir bir şekilde kaçan girdiler oluşturabilir.
Bir bulut satıcısı, erişim düzeni aktif öğrenme çıkarımıyla eşleşen bir hesabı işaretleyen ve yanıtlarını kısıtlayan sorgu hızı izleme özelliği ekler.
Riskler ve Korkuluklar
Yetenekleri artırırken varoluşsal riski bilim kurgu olarak ele almak.
Yüzey ürün güvenliğini yüksek özerklik altında hizalamayla karıştırmak.
İngilizce olmayan ve uzman olmayan izleyici kitlesini yalnızca düşük kaliteli kaynaklarla bırakmak.
Uygulama Yol Haritası
Ürün zararları, yanlış kullanım ve kontrol kaybı/yanlış hizalama risklerini ayırın.
Hangi kanıtların zaman çizelgeleri ve ciddiyet konusundaki görüşünüzü değiştireceğini sorun.
Pazarlama iddiaları yerine birincil kaynakları ve somut değerlendirmeleri tercih edin.
Tek bir eylem yolu belirleyin: kariyer, politika, finansman veya beceriler; yalnızca farkındalık değil.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Extraction and Stealing Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Üyelik Çıkarımı Saldırıları
Sık sorulan sorular
What is Model Extraction and Stealing Attacks?
Model çıkarma saldırıları, bir saldırganın yalnızca genel API'sini sorgulayarak ve bir taklitçiyi yanıtlar konusunda eğiterek özel bir AI modelini klonlamasına olanak tanır. Bu önemlidir çünkü şirketler, birkaç bin API çağrısının fiyatına yaklaşabilecek milyonlarca eğitim modeli harcıyor.
Model çıkarma saldırısının ardındaki temel fikir nedir?
Çıkarma, dağıtılan modeli bir kehanet gibi ele alır: Saldırgan, giriş-çıkış çiftlerini toplar ve orijinal ağırlıklara hiç erişmeden davranışı taklit edecek bir taklit modeli eğitir.
Neden tam olasılık vektörlerini döndürmek, çıkarmayı yalnızca ilk 1 etiketi döndürmekten daha kolay hale getiriyor?
Her tam olasılık vektörü, modelin dahili karar yüzeyi hakkında tek bir etiketten çok daha fazlasını ortaya çıkarır ve saldırganın sınırı daha az sorguyla yeniden yapılandırmasına olanak tanır.
Hangi savunma tekniği sorgu başına sızdırılan bilgileri doğrudan azaltır?
Çıktıların kabalaştırılması, örneğin yalnızca en üstteki etiketi veya yuvarlatılmış olasılıkları döndürmek, her yanıtın saldırgana verdiği sinyali azaltır ve çıkarma maliyetini artırır.
2024'teki bir sonuç, saldırganların üretim dili modelinin hangi bölümünü tam olarak ucuza kurtarabileceğini gösterdi?
Araştırmacılar, son doğrusal projeksiyon katmanının tam olarak birkaç yüz dolara kurtarılabileceğini gösterdi çünkü yanıtları kurtarılabilir bir matrisi kapsıyordu.
Çalınan bir ikame model, gelir kaybının ötesinde neden tehlikelidir?
Saldırganlar yerel bir kopyaya sahip olduklarında, orijinal konuşlandırılmış sistemi de kandıracak düşmanca girdiler veya saldırı saldırıları tasarlamak için onu özgürce inceleyebilirler.