Haberlere Geri Dön
GüvenlikAI Understanding brifing

Çalışma, Yüksek Lisans nefret söylemi taramasının Urduca metinlerde daha az tutarlı olduğunu ortaya koyuyor

Bir arXiv ön baskısı, beş büyük dil modelinin Urduca metinler ve İngilizce çevirilerdeki zararlı içerik sınıflandırmalarını değiştirdiğini ve ölçülebilir bir "Urduca'da Kaçırılan" güvenlik açığını ortaya çıkardığını bildirmektedir.

5 min readRead the primary source
Source-page capture accompanying Study finds LLM hate-speech screening is less consistent in Urdu scripts
Birincil kaynak belgeKaynak kaydedildi
Yayıncı
arxiv.org
Kaynak bağlantısı
arxiv.orghttps://arxiv.org/abs/2608.24191
Kaynak türü
Birincil belge – doğrudan okuduğumuz resmi bir duyuru, belge, dosyalama veya birinci taraf sayfası.
Bağlam60 saniyede bunu anlayın

Buradan başlayın

Anahtar terimler

Büyük Dil Modeli (LLM)
Metin oluşturmak ve analiz etmek için çok büyük metin toplulukları üzerinde eğitilmiş bir dil modeli.
API (Uygulama Programlama Arayüzü)
Bir yazılım sisteminin başka bir sisteme istek göndermesi ve bu sistemden yanıt alması için yapılandırılmış bir yol.
Veri kümesi
Eğitim, doğrulama veya test için kullanılan yapılandırılmış veya yapılandırılmamış örneklerden oluşan bir koleksiyon.
Kendinizi test edinYapay Zeka Etiği Sınavı

Ne oldu?

Bir arXiv ön baskısı, Nastaliq Urduca, Roman Urduca, İngilizce ve kod anahtarlamalı Urduca-İngilizce'yi kapsayan altı veri kümesi üzerinde GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 ve Llama-3.1'i test etti. Yazarlar, orijinal Urduca alfabeli içerik ile İngilizce çeviriler arasında sınıflandırmaların değiştiğini, bazı zararlı içeriklerin Urduca'da normal kabul edildiğini bildirdi. Makale ayrıca ALW/WOAH tutanaklarının dokuz basımındaki 205 makale arasında özel bir Urduca makale bulunmadığını da bildiriyor.

25 Ağustos 2026'da arXiv'ye gönderilen makale, büyük dil modellerinin nefret söylemini Urdu alfabesi biçimleri arasında tutarlı bir şekilde sınıflandırıp sınıflandırmadığını inceliyor. Deneyi beş modeli (GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 ve Llama-3.1) ve Nastaliq Urduca, Roman Urduca, İngilizce ve kod anahtarlamalı Urduca-İngilizce'yi kapsayan altı veri kümesini kapsıyor. Kaynak, çalışmayı bir ürün lansmanı veya belirli bir platform olayının raporu olmaktan ziyade, kodlar arası güvenlik tutarsızlığının araştırılması olarak sunuyor.

Yazarlar, orijinal senaryodaki içerik sınıflandırmalarını İngilizce çevirilerin sınıflandırmalarıyla karşılaştırırlar. Beş Urdu alfabesi veri kümesinde Gemini 2.5 Flash için %15,9 ile Qwen-2.5 için %31,6 arasında değişen etiket kararsızlıklarını rapor ediyorlar. Makalenin terminolojisinde, "Urduca'da Kaçırılan" durumu, İngilizce çeviride zararlı olarak işaretlenen ancak orijinal Urduca alfabesinde normal olarak sınıflandırılan içeriktir.

Rapor edilen Urduca'da Kaçırılanlar oranları %2,4 ile %9,9 arasında değişmektedir ve modeller genelinde ortalama %4,3'tür. Özette, daha küçük açık ağırlıklı modellerin, teste dahil edilen sınır kapalı modellere göre önemli ölçüde daha yüksek istikrarsızlık ve kaçırılan hasar oranları gösterdiği belirtiliyor. Bunlar yazarlar tarafından bildirilen sonuçlardır; Sağlanan kaynak, temel örnekleri, veri kümesi başına dökümleri, güven aralıklarını veya istatistiksel testleri sağlamaz.

Makale ayrıca Urduca güvenlik değerlendirmesiyle ilgili araştırma kayıtlarını da inceliyor. Özete göre yazarlar, ACL Antoloji API'sini kullanarak dokuz ALW/WOAH basımında 205 makaleyi sıraladılar ve bu dönemde sıfır özel Urduca makale buldular. Kaynak, söz konusu listeye dahil edilme kriterlerinin tamamını tanımlamıyor veya ilgili çalışmanın başka mekanlar, etiketler veya araştırma kategorileri altında yer alıp almadığını açıklamıyor.

Kaynak ayrıntıları: arxiv.org ↗

Neden önemli?

Çalışma, bir içerik denetleme sisteminin, İngilizce çevirilerle test edildiğinde doğrudan Urduca'yı ele aldığından daha güvenli görünebileceğini öne sürüyor. Bu, çok dilli kullanıcılara hizmet veren platformlar ve hizmetler için pratik bir değerlendirme sorunu yaratır: toplam güvenlik puanları, belirli komut dosyalarında veya dil türlerinde yoğunlaşan hataları gizleyebilir. Bulgular, tek bir arXiv ön baskısından elde edilen iddialardır ve ölçülen oranların, test edilen veri kümeleri ve modellerin ötesinde ne kadar genelleştirildiğini belirlemez.

Buradaki temel sonuç, güvenlik değerlendirmesinin yalnızca metnin ne anlama geldiğine değil, dilin nasıl temsil edildiğine de bağlı olabileceğidir. Bir denetleme modeli esas olarak İngilizce veya çevrilmiş materyal üzerinde test edilirse, ölçülen performansı, kullanıcılar Urdu alfabesiyle yazarken ortaya çıkan hataları ortaya çıkarmayabilir. Bu nedenle bir sistem, maddi olarak farklı girdileri eşit olmayan bir şekilde ele alırken güven verici toplu sonuçlar alabilir.

Bu önemlidir, çünkü içerik denetimi genellikle materyalin engellenip engellenmediğine, iletilmesine veya izin verilmesine karar vermek için kullanılır. Bildirilen Urduca'da Kaçırılan modeli, yön açısından önemli bir başarısızlığı tanımlamaktadır: çeviriden sonra zararlı olarak değerlendirilen metin, bazen orijinal senaryoda normal olarak iletilmiştir. Çalışma, bu tür vakaların gerçek dünya platformlarında ne sıklıkta meydana geldiğini, ne tür konuşmaların söz konusu olduğunu veya hangi sonuçların takip edildiğini göstermiyor; dolayısıyla pratik etkisi, niceliksel bir zarar tahmininden ziyade belgelenmiş bir değerlendirme kaygısı olarak tanımlanmalıdır.

Çalışma aynı zamanda güvenlik ekiplerine somut bir ölçüm sözlüğü de sağlıyor. Genel doğruluk veya uyum, komut dosyaları arasındaki anlaşmazlıkları gizleyebilirken, komut dosyaları arası bir karşılaştırma ve Urduca'da Kaçırılan oranı, gözden kaçan zararlı içeriğin belirli bir sınıfını açığa çıkarabilir. Bu tür önlemler, kuruluşların dil kapsamını denetlemesine, model versiyonlarını karşılaştırmasına ve çeviriye dayalı testlerin nerede yetersiz olduğunu belirlemesine yardımcı olabilir. Kaynak, önerilen puanın tam bir güvenlik ölçüsü olduğunu iddia etmiyor.

Açık ağırlıklı ve kapalı modeller arasında bildirilen boşluk, kuruluşların çok dilli yönetim sistemlerini nasıl seçtiğini veya kullandığını etkileyebilir, ancak karşılaştırma dikkatli olmayı gerektirir. Modeller eğitim verileri, ayarlama, erişim koşulları ve varsayılan davranış açısından farklılık gösterebilir ve özet, farkın nedenini izole etmek için yeterli metodolojik ayrıntı sağlamaz. Bu nedenle makale, tek bir model kategorisinin evrensel olarak daha güvenli olduğu yönünde genel bir sonucu değil, model ve senaryo kapsamının incelenmesini desteklemektedir.

Interactive Mechanism

İnteraktif Mekanizma: Aslında Nasıl Çalışıyor?

Bu gelişmenin arkasında yatan teknolojiyi etkileşimli olarak keşfedin.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
İnteraktif Konsept Kontrolü+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Bundan sonra ne izlenecek?

Bundan sonraki önemli sorular, sonuçların akran incelemesi ve kopyalamadan sağ çıkıp çıkmadığı, veri kümelerinin nasıl bir araya getirildiği ve etiketlendiği ve aynı modelin mevcut üretim sistemlerinde görünüp görünmediğidir. Araştırmacılar ve dağıtımcılar ayrıca Roman Urduca'yı, kod değiştirmeyi, bölgesel çeşitliliği, çeviri kalitesini ve model güncellemelerini ayrı ayrı incelemelidir. Kaynak, hangi uyarıların, denetleme eşiklerinin, örnekleme prosedürlerinin veya hafifletme yöntemlerinin rapor edilen tutarsızlığı azaltacağını belirlemez.

İlk belirsizlik metodolojiktir. Sağlanan kaynak bir arXiv v1 ön baskısıdır; çalışmanın hakem incelemesini tamamladığının kanıtı değildir. Okuyucuların rapor edilen yüzdelerin ne kadar sağlam olduğuna karar vermek için makalenin tam veri seti boyutlarına, etiket tanımlarına, açıklama prosedürlerine, çeviri sürecine, istemlere, kod çözme ayarlarına ve istatistiksel analize ihtiyacı vardır.

Çoğaltma özellikle önemli olacaktır. Çalışma, adlandırılmış beş modeli ve belirli bir veri kümesi kümesini test ediyor ancak özette, oranların daha yeni model sürümlerini, diğer denetleme sistemlerini, ek Urduca çeşitlerini veya ilgili dilleri ve yazıları kapsayıp kapsamadığı belirlenmiyor. Ayrıca hataların belirli konularda, nefret söylemi biçimlerinde, yazım kalıplarında veya kod değiştirme düzeylerinde yoğunlaşıp yoğunlaşmadığını da göstermiyor.

Dağıtımcılar, İngilizce çeviriyi yeterli bir vekil olarak ele almak yerine, orijinal komut dosyası girişlerini doğrudan test eden değerlendirmeleri izlemelidir. Yararlı bir takip çalışması, zaman içinde senaryoya özgü sonuçları karşılaştırabilir, yanlış pozitifleri gözden kaçırılan zararların yanı sıra raporlayabilir ve hafifletme değişikliklerinin bir dil çeşitliliğini bozmadan diğerini iyileştirip iyileştirmediğini test edebilir. Kaynak, doğrulanmış bir müdahaleyi tanımlamıyor.

Araştırma kapsamı bulgusu aynı zamanda doğrulamayı da garanti eder. Yazarlar, dokuz ALW/WOAH baskısında 205 makalede sıfır özel Urduca makale rapor ediyor, ancak özet, tam arama kaydını sunmuyor veya "özel Urduca"nın nasıl tanımlandığını açıklamıyor. Gelecekteki denetimler bu kriterleri tekrarlanabilir hale getirmeli ve yargılama dışındaki çalışmaları incelemelidir. O zamana kadar makalenin desteklediği en güçlü sonuç, Urdu alfabesinin kapsamının yüksek lisans güvenlik testlerinde açık ölçümü hak ettiğidir.

İlgili kılavuzlar ve testler

Yapay Zeka EtiğiYapay Zeka Modellerinin AçıklamasıYapay Zeka EğitimiBildiklerinizi test edin; ücretsiz bir yapay zeka testini deneyinSözlüğümüzde bir yapay zeka terimine bakınYapay zeka düzenleme izleyicisini takip edin
Bunu yararlı buldunuz mu?