Ne oldu?
Beş araştırmacı, RAG kanalındaki hassas varlıkları bulmak, bunları takma adlarla değiştirmek ve yalnızca gizlenmiş metni harici bir büyük dil modeline iletmek için küçük bir yerel model kullanan bir çerçeve olan SEAG'ı açıklayan bir ön baskı yayınladı. Yazarlar, oluşturdukları iki veri seti üzerinde kendi değerlendirme sonuçlarını raporlamaktadır.
13 Ağustos 2026'da gönderilen ve arXiv:2608.12675 olarak listelenen bir ön baskı, kullanıcıların bu sorgularda veya bunları yanıtlamak için alınan belgelerde bulunan gizli ayrıntıları açıklamadan güçlü üçüncü taraf dil modellerine sorgu göndermesine olanak tanıyan bir çerçeve olan Hassas Varlık Takma Ad Oluşturucu'yu veya SEAG'ı açıklamaktadır. Listelenen yazarlar Saleh Almohaimeed, Saad Almohaimeed, Mousa Jari, Fahad Alotaibi ve Khalid A. Alobaid'dir. Makale, Kriptografi ve Güvenlik alanında ikincil bir listeyle Yapay Zeka kapsamında dosyalanmıştır ve gönderi yorumlarında, makalenin Knowledge-Based Systems dergisine gönderildiği belirtilmektedir. Hakem incelemesinden geçmemiştir.
Yazarlar sorunu, mevcut RAG gizlilik araştırmasının büyük ölçüde atladığı bir sorun olarak çerçeveliyor. Yazdıkları araştırma, ilk etapta yetkisiz kullanıcıların hassas verilere erişmesini önlemeye odaklandı. Onların endişesi boru hattının diğer ucudur: oluşturmanın harici bir sağlayıcı tarafından gerçekleştirildiği, erişimle zenginleştirilmiş bir kurulumda, hem kullanıcının sorusu hem de alınan pasajlar bu sağlayıcıya iletilir ve kötüye kullanılabilecek veya istenmeyen amaçlarla erişilebilecek gizli bilgiler içerebilir. Özette herhangi bir sağlayıcının adı belirtilmez veya belirli bir olay açıklanmaz.
SEAG'ın tanımladığı mekanizma, harici çağrıdan önce çalışan hafif bir modeldir. Özete göre, hassas varlıkların yerini tespit ediyor, her biri için karşılık gelen bir takma ad üretiyor ve bir varlık değiştirme tablosu oluşturuyor. Bu tablo daha sonra harici oluşturucuya herhangi bir şey iletilmeden önce hem kullanıcının sorgusunda hem de alınan belgelerde hassas sözcüklerin yerine geçmek için uygulanır. Özet, cevabın kullanıcı için orijinal terimlerine nasıl geri döndürüldüğünü açıklamamaktadır, ancak çerçevenin doğru bir cevap döndürme yönündeki belirtilen hedefi, ters bir eşleme adımını ima etmektedir.
Yazarlar, yaklaşımı değerlendirmek için iki veri kümesi oluşturduklarını söylüyorlar: biri SEAG modellerinde varlık değiştirme tabloları oluşturacak şekilde ince ayar yapmak için kullanıldı, ikincisi ise çerçeveyi uçtan uca değerlendirmek için kullanıldı. Başlık sonuçları, Kullanıcı metriği adını verdikleri, modelin hassas bilgileri harici oluşturucudan gizli tutarken kullanıcıya doğru yanıt verme yeteneği olarak tanımladıkları şey aracılığıyla ifade edilir. Özette, bu ölçüme göre tüm SEAG modellerinin %80'in üzerinde doğruluk elde ettiği belirtiliyor. Özette hiçbir temel karşılaştırma, veri kümesi boyutu, etki alanı veya dil belirtilmemiştir.
Ayrı bir analiz, modellerin belirli bir belgedeki her hassas varlığı gizleyip gizleyemediğini ölçtü. Burada özette Qwen-3 için %77,83, LLaMA-3.2 için %76,73 ve Phi-4 için %74,91 toplam doğruluk bildiriliyor ve sonuç iyi bir performans olarak tanımlanıyor. Özette, bu rakamların belge başına mı yoksa varlık başına mı hesaplandığı ya da değerlendirme verileri oluşturulurken duyarlılığın nasıl tanımlandığı ve etiketlendiği belirtilmemektedir. Yukarıdaki her sayı yazarların kendi bildirdiği sonuçtur; hiçbiri bağımsız olarak çoğaltılmamıştır ve arXiv liste sayfası kodun veya iki veri kümesinin yayınlandığını göstermemektedir.
Kaynak ayrıntıları: arxiv.org ↗
Neden önemli?
Hassas belgeleri alabilecek en çok yayınlanmış RAG gizlilik çalışması adresleri. Bu belge farklı bir teşhiri hedeflemektedir: Alınan metin ve kullanıcının sorgusu, yanıtı oluşturan üçüncü taraf modele iletilir. Bu, kurumsal yapay zeka dağıtımlarının rutin, sözleşmeye bağlı olarak yönetilen bir parçasıdır ve bu sınırdaki teknik azaltma, tek başına erişim kontrolünden farklı bir yaklaşımdır.
Makalenin tanımladığı maruziyet egzotik olmaktan ziyade sıradandır. Dahili belge depolarını barındırılan bir sınır modeline bağlayan kuruluşlar, her soru sorulduğunda bu belgelerin parçalarını sağlayıcıya gönderir. Bu aktarım genellikle işlem hattındaki herhangi bir şeyden ziyade sözleşmelere, veri işleme şartlarına ve saklama ayarlarına tabidir. Talep çevreden ayrılmadan önce tanımlama ayrıntılarını soyan bir teknik, aynı riski farklı bir yönden ele alır ve bunu müşterinin, sağlayıcının işbirliği olmadan uygulayabileceği bir şekilde yapar.
Aliasing aynı zamanda redaksiyondan anlamlı derecede farklı bir tasarım tercihidir. Bir adın silinmesi, modelin, alınan çeşitli pasajlardaki varlıklar arasındaki ilişkiler hakkında akıl yürütmesi için ihtiyaç duyduğu bilgiyi ortadan kaldırır. Tutarlı bir yer tutucunun değiştirilmesi metnin dilbilgisi ve referans yapısını bozulmadan tutar, böylece harici model kimin ne yaptığını takip edebilir, ardından kullanıcı tarafı yanıtı geri haritalandırır. Yaklaşımın argümanı budur; Bunun bedeli, gizlenmiş metnin hala çevre bağlamını taşımasıdır; bu da dikkatli bir okuyucunun neyin gizlendiğini tahmin etmek için kullanabileceği materyalin tam olarak aynısıdır.
Bildirilen gizleme oranları, bunun bugün nasıl kullanılabileceğine dair pratik tavanı belirliyor. Modele bağlı olarak vakaların kabaca beşte biri ile dörtte biri, her hassas varlığın saklanması çıtasını karşılayamadı. Sağlık kayıtları, yasal dosyalar veya mali veriler gibi düzenlenmiş ortamlarda, sızdırılan tek bir tanımlayıcı, uyumluluk rejimlerinin önlemek için yazıldığının ifşasını teşkil edebilir; bu nedenle, yetmişli yılların ortalarından yükseklerine kadar olan bir rakam, tek başına bir garanti yerine birkaç katman arasında bir katman olarak kullanımı desteklemektedir. Makalenin kendi çerçevesi bir araştırma sonucudur, bir dağıtım tavsiyesi değil.
Daha genel anlamda belge, erişim erişim kontrolü ve anında enjeksiyona ilişkin daha iyi oluşturulmuş çalışmanın yanı sıra, model sağlayıcının kendisinin de tehdit yüzeyinin bir parçası olarak ele alındığı gözle görülür bir değişimin parçası. Bu aynı zamanda maliyet açısından takip edilmeye değer bir modele de uyuyor: küçük, yerel olarak çalıştırılan bir modeli, harici büyük bir modelin önünde mahremiyet dolgusu olarak kullanmak. Bu model işe yararsa, hassas iş yüklerinin ya tamamen kendi kendine barındırılan modellerde kalması ya da tamamen gönderilmesi gerektiğini varsayan kuruluşların hesaplamaları değişir.
İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?
Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.
What is the basic training objective of a large language model like the one behind ChatGPT?
Bundan sonra ne izlenecek?
Bildirilen sayıların, makalenin gönderildiği dergide hakem incelemesinden geçip geçmediği, oluşturulan iki veri kümesinin ve herhangi bir kodun yayınlanıp yayınlanmadığı ve çerçevenin, yalnızca soruyu yanıtlayan bir model yerine, takma adlı varlıkları aktif olarak yeniden tanımlamaya çalışan rakip bir harici modele karşı test edilip edilmediği.
İzlenecek ilk şey akran değerlendirmesidir. Gönderim notunda makalenin Bilgi Tabanlı Sistemler'e gönderildiği belirtiliyor; böylece incelemeciler iki veri kümesinin nasıl oluşturulduğunu, hassas varlıkların nasıl etiketlendiğini ve rapor edilen doğrulukların daha katı bir tanım altında geçerli olup olmadığını araştırma şansına sahip olacak. Veri kümelerinin ve herhangi bir uygulama kodunun yayınlanması da aynı derecede önemli olacaktır çünkü ne Kullanıcı metriği ne de tam gizleme ölçüsü bunlar olmadan bağımsız olarak kontrol edilemez.
İkincisi, karşıt değerlendirmedir. Özet, SEAG'ın, muhtemelen sadece soruyu yanıtlayan harici bir oluşturucudan varlıkları ne sıklıkla gizlediğini bildiriyor. Bu oluşturucu veya günlüklerine erişimi olan biri, çevreleyen bağlam, aynı kullanıcıdan gelen birden fazla sorgu arasındaki korelasyon, farklı belge yapısı veya temeldeki derlem bilgisi yoluyla takma adları aktif olarak yeniden tanımlamaya çalıştığında ne olacağını bildirmez. İşbirlikçi koşullar altında doğruluk ve saldırı altında direnç ayrı özelliklerdir.
Üçüncüsü pratik yük ve arıza modlarıdır. Her harici çağrıdan önce bir varlık algılama ve değiştirme geçişi çalıştırmak, gecikmeyi ve hesaplamayı artırır ve özette her ikisi için de ölçüm yapılmaz. Ayrıca takma adın harici modelin yanıt kalitesini ne sıklıkla bozduğu, takma ad gerçek metinle çarpıştığında kenar yumuşatma hatalarının nasıl ortaya çıktığı ve sonuçların, oluşturulan veri kümelerinin kapsadığı alan ve dillerin ötesinde genellenip genellenmeyeceği de açık değildir.
Son olarak, alımı izleyin. Kurumsal AI ara yazılımlarında veya satıcıların kendi gizlilik araçlarında takma ağ geçitleri görünüyorsa, bu, yaklaşımın bir araştırma ortamı dışında da uygulanabilir olduğuna işaret eder. İlgili soru, denetçilerin ve düzenleyicilerin API sınırında uygulanan takma ad kullanımını nasıl ele aldığıdır; üçüncü bir tarafa gönderilen gizlenmiş metnin orijinalinden önemli ölçüde farklı olarak değerlendirilip değerlendirilmediği ve bu kararın ölçülen gizleme oranı ne olursa olsun değişir.