Haberlere Geri Dön
GüvenlikAI Understanding brifing

LongGuard çalışması, güvenlik korkuluklarının uzun bağlamda güvenli olmayan giriş hatırlamalarının yarısından fazlasını kaybettiğini ortaya koyuyor

Bir arXiv makalesi, güvenlik korkuluklarının güvenli olmayan içeriği tespit etme yeteneğinin, giriş uzunluğu arttıkça keskin bir şekilde düştüğünü bildiriyor ve testlerindeki ortalama sonuçları iyileştiren eğitim gerektirmeyen azaltımlar öneriyor.

6 min readRead the primary source
Source-provided image accompanying LongGuard study finds safety guardrails lose more than half their unsafe-input recall on long context
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.27580
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Korkuluklar
Güvenli olmayan veya istenmeyen model davranışını sınırlayan kurallar, kontroller ve kontroller.
Geri çağırma
Bir modelin doğru şekilde tanımladığı gerçek pozitiflerin oranı.
Hiperparametre
Öğrenme oranı, toplu iş boyutu veya derinlik gibi eğitimden önce belirlenen bir yapılandırma değeri.
Kendinizi test edinYapay Zeka Etiği Sınavı

Ne oldu?

Bir arXiv makalesi, uzun girişlerde güvenlik korkuluklarını değerlendirmek ve analiz etmek için bir çerçeve olan LongGuard'ı tanıtmaktadır. Yazarlar, 15 korkuluk ve 0,25 bin ile 32 bin token arasındaki bağlam uzunluğu aralığında, güvenli olmayan girdi hatırlamanın monoton bir şekilde ortalama %50'den fazla düştüğünü bildiriyor. Analizleri, düşüşün tek başına başarısızlığa neden olan uzunluktan ziyade, daha uzun bağlamda zararlı bir pasajın seyrelmesine atfediyor. Belgede Parçalanmış Algılama, Dikkat Kafa Keskinleştirme ve bağlama duyarlı bir yönlendirme protokolü öneriliyor ve beş kıyaslamada iki yapılandırma için ortalama %22 ve %13'lük iyileştirmeler rapor ediliyor.

27 Ağustos 2026'da arXiv'ye gönderilen makale, LongGuard'ı büyük dil modelleri için güvenlik korkuluklarındaki arızaları değerlendirmeye, açıklamaya ve azaltmaya yönelik bir çerçeve olarak sunuyor. 0,25 bin ile 32 bin jeton arasında değişen bağlam uzunluğundaki bir ızgara üzerinde "Samanlıkta Güvenlik İğnesi" görevini tanımlar. Bu kurulumda, çevredeki içeriğin içine güvenli olmayan bir geçiş yerleştirilerek araştırmacıların, toplam girdi arttıkça tespitin nasıl değiştiğini incelemelerine olanak sağlanır. Yazarlar 15 ana korkuluktan elde edilen sonuçları rapor ediyor ve güvenli olmayan geri çağırmanın monoton bir şekilde ortalama %50'den fazla düştüğünü söylüyor. Kaynak bir arXiv özeti olduğundan, bunlar bağımsız olarak belirlenmiş bulgulardan ziyade makalenin yazarları tarafından öne sürülen iddialardır.

Yazarlar, başarısızlığın güvenli olmayan geçişin orantılı seyreltilmesiyle bağlantılı olduğunu iddia etmek için eşleştirilmiş "İyi Niyetli Doldurma ve İğne-Tekrarlama" tasarımını kullanıyor. Makalenin açıklamasına göre sorun, yalnızca daha uzun bir girdinin doğası gereği daha zor olması değil: zararlı "iğne", iyi huylu malzeme eklendikçe çevredeki bağlamdan daha küçük bir pay alıyor. Özet, araştırmacıların daha sonra altı korkulukta dikkat, mantık ve davranış arasında üç aşamalı bir ilişkinin izini sürdüğünü söylüyor. Güvenli olmayan geçişe yönelik dikkatin seyreldiğini, buna paralel olarak güvenli ve güvenli olmayan logitler arasındaki farkın daraldığını ve nihai tespit kararının çöktüğünü bildiriyorlar. Özette, bu dikkat-logit-davranış zincirinin uzunluk dikkate alındıktan sonra tutarlı kaldığı belirtiliyor.

LongGuard ayrıca korkuluk davranışı konusunda uzmanlaşmış seyrek bir grup kurtarma kafasını izole ettiğini de bildiriyor. Yazarlar, bu kafaların, altta yatan temel modellere göre kısmi özgüllük gösterdiğini tanımlamaktadır. Bu analize dayanarak, eğitim gerektirmeyen iki azaltım öneriyorlar: Parçalanmış Algılama veya CD ve Dikkat Kafa Bileme veya AHS. Ayrıca, bağlam uzunluğuna ve denetimin hangi tarafının incelendiğine göre yapılandırmaları seçen bir dağıtım protokolü olan Bağlama Duyarlı Hiperparametre Yönlendirmeyi veya CAHR'yi de tanıtıyorlar. Sentetik verileri, uzun bağlamlı saldırıları ve akıl yürütme modeli çıktılarını kapsayan beş kıyaslama karşısında makale, CAHR-CD'nin altı korkuluk ortalamasını %22 oranında iyileştirdiğini, CAHR-AHS'nin ise bunu %13 oranında iyileştirdiğini bildiriyor. Özette, kod ve verilerin çevrimiçi olarak mevcut olduğu belirtiliyor ancak bu iddiaların değerlendirilmesi için gereken uygulama ayrıntıları burada sağlanmıyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Güvenlik filtreleri genellikle kısa istemlerle test edilirken, gerçek uygulamalar giderek daha uzun konuşmaları, alınan belgeleri ve genişletilmiş muhakeme izlerini işler. Makalenin bulguları genellenirse, kısa girdi değerlendirmelerinde iyi performans gösteren bir korkuluk, zararlı içerik çok daha uzun bir girdiye yerleştirildiğinde önemli ölçüde daha az güvenilir hale gelebilir. Önerilen azaltımlar dikkat çekicidir çünkü yazarlar bunları eğitim gerektirmeyen olarak tanımlamaktadır, ancak kaynak bunların performansını rapor edilen kıyaslamaların dışında belirlememektedir.

Pratik kaygı, korkulukların genel olarak nasıl değerlendirildiği ile dil modeli sistemlerinin nasıl kullanılabileceği arasındaki uyumsuzluktur. Kısa bir güvenlik testi, zararlı bir talebi ön plana çıkarabilir. Bunun aksine, uzun bağlamlı sistemler, taleple birlikte uzun süreli konuşmalar, alınan materyaller veya oluşturulan akıl yürütmeleri alabilir. LongGuard'ın rapor ettiği sonuçlar, zararlı içeriğin büyük miktarda zararsız bağlam içindeki göreceli konumunun, bir güvenlik filtresinin onu tespit edip etmediğini etkileyebileceğini öne sürüyor. Bu, yalnızca performans veya maliyet hususlarından ziyade bağlam uzunluğu ve kompozisyonu güvenlik sınırının bir parçası haline getirecektir.

Makalenin mekanik açıklaması önemlidir çünkü olası bir mühendislik arıza moduna işaret etmektedir. Yazarları, sonucu yalnızca daha uzun girdiler ile daha zayıf tespit arasındaki bir korelasyon olarak tanımlamıyor; Güvenli olmayan geçişe olan ilginin azaldığı, güvenli olmayan-güvenli logit marjının daraldığı ve davranışsal kararın başarısız olduğu bağlantılı bir dizi rapor ediyorlar. Bu zincir test edilen sistemlerin ötesine geçerse, geliştiricilerin denetim için tek bir uçtan uca geçiş oranından daha spesifik bir hedefi olabilir. Bildirilen erişim başlığı analizi, araştırmacıların bazı korkuluk bileşenlerinin güvenlikle ilgili içeriğin yerini tespit etmek için alışılmadık derecede önemli olup olmadığını araştırmasına da yardımcı olabilir.

Önerilen azaltımlar potansiyel olarak faydalıdır çünkü makale bunları eğitim gerektirmeyen olarak nitelendirmektedir. Bu, yeni model eğitimi veya büyük etiketli veri kümeleri gerektiren yaklaşımlara göre mevcut korkuluklar üzerinde test yapılmasını daha kolay hale getirebilir. Bildirilen kazanımlar (altı korkuluk ortalamasında CAHR-CD için %22 ve CAHR-AHS için %13) makalenin kıyaslama kurulumu içerisinde anlamlıdır. Ancak bunlar üretimde eşdeğer bir iyileşmenin garantisi olarak okunmamalıdır. Kaynak, rakamların göreceli mi yoksa mutlak kazanç mı olduğunu söylemiyor, verilen metinde bireysel korkuluk sonuçlarını listelemiyor ve gecikme, bilgi işlem kullanımı veya zararsız içerik işleme üzerindeki etkileri açıklamıyor.

Bu nedenle kamu güvenliğinin önemi doğrulamaya bağlıdır. Bir korkuluk hatası, temeldeki dil modelinin kendisi zararlı içerik üretmediğinde bile önemli olabilir; çünkü bir isteğin veya çıktının devam etmesine izin verilip verilmediğine karar vermek için bir tarama katmanı kullanılabilir. LongGuard, sentetik veriler ve uzun bağlamlı saldırılar da dahil olmak üzere kasıtlı olarak yapılandırılmış koşullar altında tespite odaklanır. Kaynak, sıradan kullanıcı trafiğinde aynı modelin ne sıklıkta meydana geldiğini, saldırganların bu modeli güvenilir bir şekilde kullanıp kullanamayacağını veya diğer güvenlik önlemlerinin kaçırılan içeriği yakalayıp yakalayamayacağını belirlemez.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
İnteraktif Konsept Kontrolü+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Bundan sonra ne izlenecek?

Kilit soru, LongGuard'ın sonuçlarının bağımsız veri kümelerinde, korkuluk uygulamalarında ve gerçek dağıtım ayarlarında yeniden üretilip üretilmeyeceğidir. Beş kıyaslama, temel konfigürasyon, istatistiksel değişkenlik ve gecikme, maliyet, yanlış pozitifler ve yanlış negatifler dahil olmak üzere önerilen yöntemlerin getirdiği ödünler hakkında daha fazla ayrıntıya ihtiyaç vardır. Kaynak, azaltımların operasyonel sistemlerdeki zararlı çıktıları önlediğini ortaya koymuyor ve hangi korkulukların veya bağlam türlerinin en çok etkilendiğini tanımlamıyor.

Bağımsız çoğaltma ilk test olmalıdır. Araştırmacılar, bildirilen geri çağırma düşüşünün farklı güvenlik veri kümeleri, diller, girdi yapıları ve güvenli olmayan geçişin yerleşimleri ile ortaya çıkıp çıkmadığını incelemelidir. Sağlanan kaynak 15 korkuluğu, tam olarak beş kriteri, temel olarak kullanılan modelleri veya ortalamalar etrafındaki istatistiksel belirsizliği tanımlamıyor. Bu ayrıntılar, sonucun ne kadar geniş kapsamlı genelleştirilebileceğini belirleyecektir.

Değerlendiriciler ayrıca tespit iyileştirmelerini genel güvenlik iyileştirmelerinden ayırmalıdır. Bir korkuluk, daha güvenli olmayan geçişleri tespit edebilir, aynı zamanda zararsız girdilerdeki yanlış pozitifleri artırabilir, önemli miktarda işlem süresi ekleyebilir veya meşru uzun belgelerin işlenmesini kötüleştirebilir. Özet, ortalama kıyaslama kazanımlarını rapor ediyor ancak ilgili hata değişimlerini, kaynak gereksinimlerini veya önerilen yöntemlerin normal faydayı koruyup korumadığını belirtmiyor. Ayrıca CD, AHS ve CAHR'ın, işletim varsayımlarını değiştirmeden mevcut denetleme hatlarıyla birleştirilip birleştirilemeyeceği de söylenmiyor.

Dağıtım kanıtı başka bir bilinmeyendir. CAHR, yapılandırmaların bağlam uzunluğuna ve denetim tarafına göre seçilmesi olarak tanımlanıyor ancak kaynak, yönlendirme kararının nasıl verildiğini, eşiklerinin nasıl seçildiğini veya makalenin ızgarasında temsil edilmeyen bağlam uzunluklarında nasıl davrandığını açıklamıyor. Gerçek sistemler aynı zamanda birden fazla filtre, erişim katmanı ve model çağrısı içerebilir; bunların herhangi biri rapor edilen dikkati ve logit davranışını değiştirebilir. Bu tür ortamlarda yapılacak testler, iddia edilen eğitim gerektirmeyen avantajın operasyonel kısıtlamalara dayanıp dayanamayacağını gösterecektir.

Son olarak, kod ve veri yayımı tekrarlanabilirlik ve denetlenebilirlik açısından incelenmelidir. Kaynak, bunların çevrimiçi olarak mevcut olduğunu söylüyor ancak sağlanan materyal, bunları incelemek için bir bağlantı veya yeterli bilgi sağlamıyor. Sonuçlar bağımsız olarak kontrol edilene kadar LongGuard'ı, mevcut korkulukların üretimde genel olarak başarısız olduğunun veya önerilen hafifletici önlemlerin uygulamaya hazır olduğunun kanıtı olarak değil, sonuç niteliğindeki bir araştırma iddiası ve makul bir uzun bağlam zayıflığına ilişkin bir uyarı olarak ele almak en iyisidir.

İlgili kılavuzlar ve testler

Yapay Zeka EtiğiYapay Zeka Modellerinin AçıklamasıTransformatörlerYapay Zeka EğitimiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınYapay zeka düzenleme izleyicisini takip edin
Bunu yararlı buldunuz mu?