Kembali ke Berita
KeselamatanAI Understanding taklimat

Kajian mendapati saringan ucapan benci LLM kurang konsisten dalam skrip Urdu

Pracetak arXiv melaporkan bahawa lima model bahasa besar mengubah klasifikasi kandungan berbahaya merentas skrip Urdu dan terjemahan bahasa Inggeris, mendedahkan jurang keselamatan "Missed-in-Urdu" yang boleh diukur.

5 min readRead the primary source
Source-page capture accompanying Study finds LLM hate-speech screening is less consistent in Urdu scripts
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.24191
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Set data
Koleksi contoh berstruktur atau tidak berstruktur yang digunakan untuk latihan, pengesahan atau ujian.
Uji diri andaKuiz Etika AI

Apa yang berlaku

Pracetak arXiv telah menguji GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 dan Llama-3.1 pada enam set data yang meliputi Nastaliq Urdu, Urdu Urdu dan kod Roman-Inggeris Urdu. Penulis melaporkan bahawa klasifikasi berubah antara kandungan asal skrip Urdu dan terjemahan bahasa Inggeris, dengan beberapa kandungan berbahaya diluluskan seperti biasa dalam bahasa Urdu. Akhbar itu juga melaporkan mendapati tiada kertas Urdu khusus merentasi 205 kertas kerja dalam sembilan edisi prosiding ALW/WOAH.

Makalah itu, yang diserahkan kepada arXiv pada 25 Ogos 2026, mengkaji sama ada model bahasa besar mengklasifikasikan ucapan benci secara konsisten merentas bentuk skrip Urdu. Percubaannya meliputi lima model—GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 dan Llama-3.1—dan enam set data merangkumi Nastaliq Urdu dan kod Urdu Inggeris. Sumber membentangkan kerja sebagai penyiasatan tentang ketidakkonsistenan keselamatan skrip silang, bukannya sebagai pelancaran produk atau laporan insiden platform tertentu.

Penulis membandingkan klasifikasi kandungan dalam skrip asalnya dengan klasifikasi terjemahan bahasa Inggeris. Mereka melaporkan ketidakstabilan label merentas lima set data skrip Urdu antara 15.9% untuk Gemini 2.5 Flash hingga 31.6% untuk Qwen-2.5. Dalam terminologi makalah itu, kes "Missed-in-Urdu" ialah kandungan yang dibenderakan sebagai berbahaya dalam terjemahan bahasa Inggeris tetapi diklasifikasikan sebagai biasa dalam skrip Urdu asalnya.

Kadar Missed-in-Urdu yang dilaporkan adalah antara 2.4% hingga 9.9%, dengan median 4.3% merentas model. Abstrak mengatakan model berat terbuka yang lebih kecil menunjukkan ketidakstabilan yang jauh lebih tinggi dan kadar bahaya terlepas daripada model tertutup sempadan yang disertakan dalam ujian. Ini adalah hasil yang dilaporkan oleh pengarang; sumber yang dibekalkan tidak memberikan contoh asas, pecahan setiap set data, selang keyakinan atau ujian statistik.

Kertas itu juga mengkaji rekod penyelidikan sekitar penilaian keselamatan Urdu. Menurut abstrak, pengarang menggunakan API Antologi ACL untuk menghitung 205 kertas kerja dalam sembilan edisi ALW/WOAH dan mendapati sifar kertas Urdu khusus dalam tempoh itu. Sumber itu tidak mengenal pasti setiap kriteria kemasukan dalam penghitungan itu atau menjelaskan sama ada kerja yang berkaitan mungkin muncul di bawah tempat, label atau kategori penyelidikan lain.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Kajian itu mencadangkan bahawa sistem penyederhanaan kandungan boleh kelihatan lebih selamat apabila diuji melalui terjemahan bahasa Inggeris berbanding apabila ia mengendalikan bahasa Urdu secara langsung. Itu mewujudkan masalah penilaian praktikal untuk platform dan perkhidmatan yang melayani pengguna berbilang bahasa: markah keselamatan agregat mungkin menyembunyikan kegagalan yang tertumpu pada skrip atau jenis bahasa tertentu. Penemuan adalah tuntutan daripada pracetak arXiv tunggal dan tidak menentukan sejauh mana kadar yang diukur digeneralisasikan melebihi set data dan model yang diuji.

Implikasi utamanya ialah penilaian keselamatan boleh bergantung pada cara bahasa diwakili, bukan sahaja pada maksud teks. Jika model penyederhanaan diuji terutamanya pada bahasa Inggeris atau bahan terjemahan, prestasi yang diukur mungkin tidak mendedahkan kegagalan yang berlaku apabila pengguna menulis dalam skrip Urdu. Oleh itu, sistem boleh menerima keputusan agregat yang meyakinkan sambil mengendalikan input yang berbeza secara material secara tidak sekata.

Itu penting kerana penyederhanaan kandungan sering digunakan untuk memutuskan sama ada bahan disekat, ditingkatkan atau dibenarkan. Corak Missed-in-Urdu yang dilaporkan menggambarkan kegagalan yang penting secara arah: teks dinilai berbahaya selepas terjemahan kadangkala diluluskan seperti biasa dalam skrip asal. Kajian itu tidak menunjukkan kekerapan kes sedemikian berlaku dalam platform dunia sebenar, jenis pertuturan yang terlibat, atau akibat yang diikuti, jadi impak praktikalnya harus diterangkan sebagai kebimbangan penilaian yang didokumenkan dan bukannya anggaran bahaya yang diukur.

Kerja ini juga memberikan pasukan keselamatan perbendaharaan kata ukuran konkrit. Ketepatan atau persetujuan keseluruhan boleh menyembunyikan percanggahan antara skrip, manakala perbandingan skrip silang dan kadar Terlepas-dalam-Urdu boleh mendedahkan satu kelas kandungan berbahaya yang terlepas. Langkah sedemikian boleh membantu organisasi mengaudit liputan bahasa, membandingkan versi model dan mengenal pasti di mana ujian berasaskan terjemahan tidak mencukupi. Sumber itu tidak mendakwa bahawa markah yang dicadangkan adalah metrik keselamatan yang lengkap.

Jurang yang dilaporkan antara model berwajaran terbuka dan tertutup boleh mempengaruhi cara organisasi memilih atau menggunakan sistem penyederhanaan berbilang bahasa, tetapi perbandingan memerlukan penjagaan. Model mungkin berbeza dalam data latihan, penalaan, keadaan capaian dan tingkah laku lalai, dan abstrak tidak memberikan perincian metodologi yang mencukupi untuk mengasingkan punca perbezaan. Oleh itu, makalah ini menyokong penelitian terhadap model dan liputan skrip, bukan kesimpulan menyeluruh bahawa satu kategori model adalah lebih selamat secara universal.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Semakan Konsep Interaktif+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Apa yang perlu ditonton seterusnya

Soalan seterusnya yang penting ialah sama ada keputusan itu bertahan dalam semakan dan replikasi rakan sebaya, cara set data dipasang dan dilabelkan, dan sama ada corak yang sama muncul dalam sistem pengeluaran semasa. Penyelidik dan pelaksana juga harus memeriksa Roman Urdu, penukaran kod, variasi serantau, kualiti terjemahan dan kemas kini model secara berasingan. Sumber tidak menetapkan gesaan, ambang penyederhanaan, prosedur pensampelan atau kaedah mitigasi yang akan mengurangkan ketidakkonsistenan yang dilaporkan.

Ketidakpastian pertama adalah metodologi. Sumber yang dibekalkan ialah pracetak arXiv v1, bukan bukti bahawa kerja itu telah menyelesaikan semakan rakan sebaya. Pembaca memerlukan saiz set data kertas penuh, takrifan label, prosedur anotasi, proses terjemahan, gesaan, tetapan penyahkodan dan analisis statistik untuk menilai sejauh mana keteguhan peratusan yang dilaporkan.

Replikasi akan menjadi sangat penting. Kajian itu menguji lima model bernama dan set set data tertentu, tetapi abstrak tidak menentukan sama ada kadar tersebut dilanjutkan kepada versi model yang lebih baharu, sistem penyederhanaan lain, variasi Urdu tambahan atau bahasa dan skrip berkaitan. Ia juga tidak menunjukkan sama ada ralat tertumpu pada topik tertentu, bentuk ucapan benci, corak ejaan atau tahap penukaran kod.

Penyebar harus melihat penilaian yang menguji input skrip asal secara langsung dan bukannya menganggap terjemahan bahasa Inggeris sebagai proksi yang mencukupi. Kerja susulan yang berguna akan membandingkan hasil khusus skrip dari semasa ke semasa, melaporkan positif palsu bersama bahaya yang tidak dijawab, dan menguji sama ada perubahan mitigasi meningkatkan satu variasi bahasa tanpa merendahkan yang lain. Sumber tidak mengenal pasti campur tangan yang disahkan.

Penemuan liputan penyelidikan juga memerlukan pengesahan. Penulis melaporkan sifar kertas Urdu khusus dalam 205 kertas dalam sembilan edisi ALW/WOAH, tetapi abstrak itu tidak memberikan rekod carian lengkap atau menerangkan cara "Urdu berdedikasi" ditakrifkan. Audit masa depan harus menjadikan kriteria tersebut boleh diterbitkan semula dan memeriksa kerja di luar prosiding. Sehingga itu, kesimpulan yang disokong paling kukuh kertas itu ialah liputan skrip Urdu patut diukur secara eksplisit dalam ujian keselamatan LLM.

Panduan & kuiz berkaitan

Etika AIModel AI DiterangkanLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak peraturan AI
Adakah ini berguna?