Teknik KILAVUZ

Karşıt Örnekler ve Sağlamlık

Karşıt örnekler, bir modelin kendinden emin, yanlış tahminler yapmasına neden olan küçük, çoğunlukla algılanamayan değişikliklerle bozulan girdilerdir.

2 min readSon güncelleme

Genel Bakış

Robustness is the field dedicated to defending against them, and it reveals deep gaps between machine and human perception.

Derin Dalış

2013-2014'te araştırmacılar, bir görüntüye dikkatle hazırlanmış, neredeyse görünmez bir gürültü modeli eklemenin, bir sınıflandırıcıyı "panda"dan "şebekeye" büyük bir güvenle çevirebileceğini gösterdi. Bu karşıt örnekler, sinir ağlarının yüksek boyutlu uzayda kırılgan olan karar sınırlarını öğrendiği gerçeğinden yararlanıyor. Saldırılar genellikle beyaz kutudur (saldırgan modeli bilir ve FGSM ve PGD'de olduğu gibi degradeleri kullanır) veya kara kutudur (yalnızca çıktılar görünür). Çarpıcı bir şekilde, rakip örnekler sıklıkla farklı modeller arasında aktarılarak dahili erişim olmadan saldırılara olanak tanıyor. Tehlike pratiktir: Fiziksel dünyadaki çıkartmalar dur işareti dedektörlerini kandırabilir ve hızlı enjeksiyon 'jailbreak'leri dil modeli analogudur. Sağlamlık araştırması, en kötü durumda, düşmanca tedirginliklerde bile doğru şekilde davranan modeller arar.

Teknik Bilgi

Çoğu saldırı gradyan tabanlıdır: FGSM, girişe göre kayıp gradyanının işareti yönünde tek bir adım atarken, PGD bunu orijinal girişin etrafındaki küçük sınırlı (örneğin, L-sonsuz) bir top içinde yineler. Bilinen en güçlü savunma, minimum-maksimum problem olarak formüle edilen, rakip örnekler üzerinde yeniden eğitim veren çekişmeli eğitimdir: en kötü durum tedirginliğine karşı kaybı en aza indirin. Sağlamlığı artırır ancak genellikle temiz doğruluk ve hesaplamaya mal olur.

Stratejik Etki

Maliyet ve bütçe

Mimari kararlar yıllarca performansı ve işletme maliyetini etkiler.

Daha net kararlar

Teknik eğitim, ekiplerin yalnızca en yenisini değil, doğru yığını seçmesine de yardımcı olur.

Quality control

Daha iyi mühendislik seçenekleri, üretimdeki güvenilirlik olaylarını azaltır.

Karşıt Örneklerin ve Sağlamlığın Geleceği

Yapay zeka güvenlik açısından kritik sistemlere girdikçe sağlamlık da akademik meraktan mühendislik gereksinimlerine doğru ilerliyor. Sınır dahilindeki herhangi bir bozulmanın çıktıyı değiştiremeyeceğini matematiksel olarak garanti eden sertifikalı savunmalar ve jailbreak ve hızlı enjeksiyon gibi büyük dil modellerinin karşılaştığı daha geniş, sınırlandırılması daha zor saldırılara karşı dayanıklılık üzerinde çalışmalar devam etmektedir. En kötü durum güvenilirliğini göstermek için otonom sürüş, güvenlik ve sağlık hizmetlerinde kullanılan modeller için standartlaştırılmış rakip karşılaştırmalar, kırmızı ekip oluşturma hatları ve düzenleyici baskılar bekleyebilirsiniz.

Gerçek Dünya Uygulaması

Araştırmacılar bir dur işaretinin üzerine küçük fiziksel çıkartmalar yerleştirdiler ve bu da görüntü modelinin bunu bir hız sınırı işareti olarak yanlış okumasına neden oldu ve sürücüsüz araçlara yönelik gerçek dünyada bir tehdit olduğunu gösterdi.

Güvenlik ekipleri, yüz tanımayı, kimlik eşleşmesinden kaçan veya kandıran, gözlük veya giysilere basılmış düşmanca yamalarla kırmızı takım olarak kullanıyor.

Spam ve kötü amaçlı yazılım filtreleri, sınıflandırıcıları geçerken kötü amaçlı yükleri koruyan, zararlı girdilerle incelenir.

LLM geliştiricileri, modelleri güvenlik talimatlarını göz ardı ederek kandıran, rakip örneklerin dil benzeri olan hızlı enjeksiyon 'jailbreak'lerine karşı savunma yapıyor.

Riskler ve Korkuluklar

Bir kıyaslamayı optimize etmek daha geniş sistem zayıflıklarını gizleyebilir.

Altyapı ve bakım maliyetleri genellikle hafife alınır.

Sistemler karmaşıklaştıkça güvenlik ve gözlemlenebilirlik boşlukları büyüyebilir.

Uygulama Yol Haritası

1

Uygulamadan önce gecikmeyi, kaliteyi ve maliyet hedeflerini tanımlayın.

2

Gerçekçi yük ve veri koşulları altında kıyaslama yapın.

3

Hatalar, sapmalar ve kullanıcı etkisi için cihaz izleme.

4

Ölçeklendirmeden önce geri alma ve olay müdahale yollarını hazırlayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Adversarial Examples and Robustness quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Üretken Rekabet Ağları

Sık sorulan sorular

What is Adversarial Examples and Robustness?

Karşıt örnekler, bir modelin kendinden emin, yanlış tahminler yapmasına neden olan küçük, çoğunlukla algılanamayan değişikliklerle bozulan girdilerdir. Sağlamlık, bunlara karşı savunmaya adanmış bir alandır ve makine ile insan algısı arasındaki derin uçurumları ortaya çıkarır.

Düşman bir örnek nedir?

Çelişkili örnekler, insanların zar zor fark ettiği ancak modeli yüksek güvenirlik hatalarına düşüren küçük, dikkatle hazırlanmış karışıklıkları ekler.

'Beyaz kutu' saldırısını 'kara kutu' saldırısından ayıran nedir?

Beyaz kutu saldırganları modeli bilir ve onun geçişlerini kullanabilir; kara kutu saldırganları yalnızca giriş ve çıkışları görür.

Rakiplerin sağlamlığını geliştirmek için en yaygın kullanılan savunma nedir?

Çekişmeli eğitim, minimum-maksimum optimizasyon olarak formüle edilmiş en kötü durumdaki rahatsız edici girdilerle öğrenmeyi artırır ve temiz doğruluğu azaltabilmesine rağmen en güçlü güvenilir savunmadır.

Karşıt örneklerin 'aktarılabilirliği' neden endişe verici?

Rakip örnekler modeller arasında aktarıldığı için, bir saldırgan bunları bir yedek model üzerinde işleyebilir ve inceleyemediği bir hedefe başarılı bir şekilde saldırabilir.

Karşıt örneklerin geniş dil modeli analoğu nedir?

Jailbreak'ler ve hızlı enjeksiyonlar, bir LLM'yi güvenli olmayan veya istenmeyen davranışlara yönlendiren, görüşteki rakip saldırılara paralel olan, hazırlanmış girdilerdir.