Toplum REHBERİ

Veri Zehirlenmesi ve Arka Kapı Saldırıları

Veri zehirlenmesi, eğitim verilerine müdahale ederek modeli bozar ve arka kapı saldırıları, modelin komut verildiğinde hatalı davranmasına neden olan gizli bir tetikleyiciyi gizler.

2 min readSon güncelleme

Genel Bakış

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Derin Dalış

Zehirleme saldırıları iki geniş hedefe ayrılır. Kullanılabilirlik saldırıları, yanlış etiketlenmiş veya bozuk örnekleri enjekte ederek genel doğruluğu azaltmayı amaçlar. Hedefli ve arka kapı saldırıları daha sinsidir: Model normal girdilerde mükemmel performans gösterir ancak küçük bir piksel yaması, belirli bir ifade veya görünmez bir filigran gibi gizli bir tetikleyici ortaya çıktığında saldırganın seçtiği bir çıktı üretir. BadNets çalışması, etiketle işaretlenmiş bir işareti 'hız sınırı' olarak okuyan bir dur işareti sınıflandırıcısını gösterdi. Modern sistemler, web ölçeğindeki veriler üzerinde eğitim aldıkları için açığa çıkar. Araştırmacılar, çok küçük bir veri kümesi URL'si arkasındaki süresi dolmuş alan adlarını satın almanın, popüler görüntü veri kümelerini birkaç yüz dolara zehirleyebileceğini gösterdi. Dil modellerine, zehirli ince ayar verileri veya talimat örnekleri yoluyla da arka kapı açılabilir.

Teknik Bilgi

Temiz etiketli bir arka kapı özellikle tehlikelidir: Zehirli örnekler doğru etiketleri korur ve insan incelemecilere normal görünür, ancak yine de modelin bir hedef sınıfla ilişkilendirmeyi öğrendiği bir tetikleyici özelliği içerirler. Çıkarımda, tetiğin sunulması öngörüyü tersine çevirirken temiz doğruluk yüksek kalır, dolayısıyla standart doğrulama onu asla yakalayamaz. Savunmalar arasında aktivasyon kümelemesi, spektral imzalar, tetikleyicinin yeniden yapılandırılması ve veri kaynağı kontrolleri yer alır.

Stratejik Etki

Risk and safety

Yıkıcı ve günlük yapay zeka zararları, kimin riskleri anladığı ve kimin harekete geçebileceğine bağlıdır.

Daha net kararlar

Kamu ve profesyonel okuryazarlık, güçlü bir güvenlik politikasının politik olarak mümkün olup olmadığını şekillendirir.

Cutting through hype

Açık açıklamalar abartılı reklamların, laboratuvar halkla ilişkiler uygulamalarının ve belirsiz etik tiyatrosunun etkisi altına girmeyi azaltır.

Veri Zehirlenmesinin ve Arka Kapı Saldırılarının Geleceği

Tedarik zincirleri kazınmış verilere, önceden eğitilmiş ağırlıklara ve üçüncü taraf ince ayarlarına dayandığından, zehirlenme teoriden gerçek bir tedarik zinciri tehdidine dönüşüyor. Veri kümesi imzalama ve kaynak standartları, sabit sayıda zehirli noktadan kaynaklanan hasarı sınırlandıran sertifikalı sağlamlık eğitimi ve dağıtımdan önce modellerin sürekli arka kapı taramasının yapılmasını bekleyebilirsiniz. Düzenleyiciler ve MITRE ATLAS gibi güvenlik çerçeveleri, zehirlenmeyi birinci sınıf bir makine öğrenimi riski olarak ele almaya başlıyor.

Gerçek Dünya Uygulaması

Küçük bir etiket tetikleyici mevcut olduğunda dur işaretini yanlış okuyan, hız sınırı işareti olarak okuyan sürücüsüz otomobillere yönelik bir görüntü modeli

Resim URL'lerinin bir kısmını barındıran, süresi dolmuş alan adlarını ele geçirerek herkese açık bir resim veri kümesini ucuz bir şekilde zehirlemek

Gizli bir istem ifadesinin güvenli olmayan kod eklemesini sağlayacak şekilde bir kod tamamlama modeline arka kapı açmak

Bir spam filtresinin kitle kaynaklı eğitim geri bildirimini bozarak belirli kötü amaçlı e-postaların sızmasını sağlamak

Riskler ve Korkuluklar

Yetenekleri artırırken varoluşsal riski bilim kurgu olarak ele almak.

Yüzey ürün güvenliğini yüksek özerklik altında hizalamayla karıştırmak.

İngilizce olmayan ve uzman olmayan izleyici kitlesini yalnızca düşük kaliteli kaynaklarla bırakmak.

Uygulama Yol Haritası

1

Ürün zararları, yanlış kullanım ve kontrol kaybı/yanlış hizalama risklerini ayırın.

2

Hangi kanıtların zaman çizelgeleri ve ciddiyet konusundaki görüşünüzü değiştireceğini sorun.

3

Pazarlama iddiaları yerine birincil kaynakları ve somut değerlendirmeleri tercih edin.

4

Tek bir eylem yolu belirleyin: kariyer, politika, finansman veya beceriler; yalnızca farkındalık değil.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Sentetik Veriler

Sık sorulan sorular

What is Data Poisoning and Backdoor Attacks?

Veri zehirlenmesi, eğitim verilerine müdahale ederek modeli bozar ve arka kapı saldırıları, modelin komut verildiğinde hatalı davranmasına neden olan gizli bir tetikleyiciyi gizler. Bunlar önemlidir çünkü modeller, saldırganların sessizce kirletebileceği, derlenmiş, kitle kaynaklı verilerden giderek daha fazla ders almaktadır.

Arka kapı saldırısını genel kullanılabilirlik zehirlenmesi saldırısından ayıran şey nedir?

Arka kapılı modeller temiz girdilerle normal şekilde hareket eder ve yalnızca gizli tetikleyici ortaya çıktığında saldırganın hedef çıktısını üretir.

Temiz etiketli arka kapı saldırılarının tespit edilmesi neden zor?

Zehirli örnekler doğru etiketlere sahip olduğundan ve sıradan göründüklerinden, insan incelemesi ve standart doğrulama doğruluğu bunları işaretlemez.

BadNets araştırması neyi meşhur etti?

BadNets, küçük bir çıkartmayla işaretlenmiş dur işaretlerini yanlış okuyan, arka kapılı bir trafik işareti sınıflandırıcısını gösterdi.

Araştırmacılar web ölçeğindeki veri kümelerinin ucuza zehirlenebileceğini nasıl gösterdi?

Veri kümeleri resimlere URL'ye göre referans verdiğinden, süresi geçmiş alan adlarının satın alınması, saldırganların bu resimleri küçük bir maliyet karşılığında kontrol etmesine olanak tanır.

Bunlardan hangisi arka kapı saldırılarına karşı tanınan bir savunmadır?

Savunmalar, diğer tespit yöntemlerinin yanı sıra, zehirlenmiş örnekleri temiz örneklerden ayırmak için dahili aktivasyonları analiz eder.