العودة إلى الأخبار
الأمانAI Understanding إحاطة

وجدت الدراسة أن فحص خطاب الكراهية في LLM أقل اتساقًا في النصوص الأردية

تشير نسخة أولية من arXiv إلى أن خمسة نماذج لغوية كبيرة غيرت تصنيفات المحتوى الضار عبر النصوص الأوردية والترجمات الإنجليزية، مما يكشف عن فجوة أمان قابلة للقياس "لم يتم الرد عليها باللغة الأردية".

5 min readRead the primary source
Source-page capture accompanying Study finds LLM hate-speech screening is less consistent in Urdu scripts
وثيقة المصدر الأساسيتم تسجيل المصدر
الناشر
arxiv.org
رابط المصدر
arxiv.orghttps://arxiv.org/abs/2608.24191
نوع المصدر
المستند الأساسي - إعلان رسمي أو ورقة أو ملف أو صفحة الطرف الأول التي نقرأها مباشرة.
السياقافهم هذا في 60 ثانية

ابدأ هنا

المصطلحات الرئيسية

نموذج اللغة الكبير (LLM)
نموذج لغة تم تدريبه على مجموعات نصية ضخمة لإنشاء النص وتحليله.
API (واجهة برمجة التطبيقات)
طريقة منظمة لنظام برمجي واحد لإرسال الطلبات إلى نظام آخر وتلقي الاستجابات منه.
مجموعة البيانات
مجموعة من الأمثلة المنظمة أو غير المنظمة المستخدمة للتدريب أو التحقق من الصحة أو الاختبار.
اختبر نفسكمسابقة أخلاقيات الذكاء الاصطناعي

ماذا حدث

تم اختبار النسخة الأولية من arXiv GPT-4o وClaude Sonnet 4.5 وGemini 2.5 Flash وQwen-2.5 وLlama-3.1 على ست مجموعات بيانات تغطي Nastaliq Urdu وRoman Urdu والإنجليزية والأردية-الإنجليزية ذات التبديل البرمجي. أفاد المؤلفون أن التصنيفات تغيرت بين محتوى النص الأصلي باللغة الأردية والترجمات الإنجليزية، مع تمرير بعض المحتوى الضار كالمعتاد باللغة الأردية. تشير الورقة أيضًا إلى عدم العثور على أي أوراق بحثية مخصصة باللغة الأردية في 205 أوراق بحثية في تسعة إصدارات من إجراءات ALW/WOAH.

تدرس الورقة المقدمة إلى arXiv في 25 أغسطس 2026 ما إذا كانت نماذج اللغة الكبيرة تصنف خطاب الكراهية بشكل متسق عبر أشكال النص الأردية. تغطي تجربتها خمسة نماذج - GPT-4o، وClaude Sonnet 4.5، وGemini 2.5 Flash، وQwen-2.5، وLlama-3.1 - وست مجموعات بيانات تشمل Nastaliq Urdu، وRoman Urdu، والإنجليزية، والأردية-الإنجليزية ذات التبديل البرمجي. يقدم المصدر العمل كتحقيق في عدم اتساق أمان النص المتقاطع، وليس كإطلاق منتج أو تقرير عن حادثة منصة معينة.

يقارن المؤلفون تصنيفات المحتوى في نصه الأصلي مع تصنيفات الترجمات الإنجليزية. لقد أبلغوا عن عدم استقرار التسمية عبر مجموعات البيانات الخمس المكتوبة باللغة الأردية والتي تتراوح من 15.9% لـ Gemini 2.5 Flash إلى 31.6% لـ Qwen-2.5. في مصطلحات البحث، الحالة "المفقودة باللغة الأردية" هي المحتوى الذي تم وضع علامة عليه على أنه ضار في الترجمة الإنجليزية ولكن يتم تصنيفه على أنه عادي في نصه الأصلي باللغة الأردية.

تتراوح معدلات الضياع في اللغة الأردية المُبلغ عنها من 2.4% إلى 9.9%، بمتوسط ​​4.3% عبر النماذج. يقول الملخص إن النماذج الأصغر حجمًا ذات الوزن المفتوح أظهرت عدم استقرار أعلى بكثير ومعدلات ضرر ضائعة مقارنة بالنماذج المغلقة الحدودية المضمنة في الاختبار. هذه هي النتائج التي أبلغ عنها المؤلفون؛ لا يقدم المصدر المقدم الأمثلة الأساسية أو التوزيعات لكل مجموعة بيانات أو فترات الثقة أو الاختبارات الإحصائية.

تتناول الورقة أيضًا سجل البحث حول تقييم السلامة باللغة الأردية. وفقًا للملخص، استخدم المؤلفون ACL Anthology API لتعداد 205 ورقة بحثية عبر تسعة إصدارات ALW/WOAH ولم يعثروا على أي أوراق بحثية مخصصة للغة الأردية خلال تلك الفترة. لا يحدد المصدر كل معايير التضمين في هذا التعداد أو يشرح ما إذا كان العمل ذو الصلة قد ظهر ضمن أماكن أو تسميات أو فئات بحث أخرى.

تفاصيل المصدر: arxiv.org ↗

لماذا يهم

تشير الدراسة إلى أن نظام إدارة المحتوى يمكن أن يبدو أكثر أمانًا عند اختباره من خلال الترجمات الإنجليزية مقارنة بالتعامل مع اللغة الأردية مباشرة. وهذا يخلق مشكلة تقييم عملية للمنصات والخدمات التي تخدم مستخدمين متعددي اللغات: فقد تؤدي درجات الأمان الإجمالية إلى إخفاء حالات الفشل التي تتركز في نصوص معينة أو أنواع لغوية معينة. النتائج عبارة عن ادعاءات من نسخة مسبقة واحدة من arXiv ولا تحدد مدى تعميم المعدلات المقاسة بما يتجاوز مجموعات البيانات والنماذج التي تم اختبارها.

والنتيجة المركزية هي أن تقييم السلامة يمكن أن يعتمد على كيفية تمثيل اللغة، وليس فقط على ما يعنيه النص. إذا تم اختبار نموذج الإشراف بشكل أساسي على اللغة الإنجليزية أو على مواد مترجمة، فقد لا يكشف أدائه المقاس عن حالات الفشل التي تحدث عندما يكتب المستخدمون باللغة الأردية. وبالتالي يمكن للنظام أن يحصل على نتائج إجمالية مطمئنة بينما يتعامل مع مدخلات مختلفة ماديًا بشكل غير متساو.

وهذا مهم لأن الإشراف على المحتوى غالبًا ما يُستخدم لتحديد ما إذا كانت المادة محظورة أو متصاعدة أو مسموح بها. يصف نموذج Missed-in-Urdu الذي تم الإبلاغ عنه فشلًا مهمًا من الناحية الاتجاهية: النص الذي تم الحكم عليه بأنه ضار بعد الترجمة تم تمريره أحيانًا كالمعتاد في النص الأصلي. ولا تظهر الدراسة عدد المرات التي تحدث فيها مثل هذه الحالات في منصات العالم الحقيقي، أو ما هي أنواع الكلام التي تنطوي عليها، أو ما هي العواقب التي تلت ذلك، لذلك ينبغي وصف تأثيرها العملي باعتباره مصدر قلق تقييمي موثق بدلا من تقدير كمي للضرر.

كما يمنح العمل فرق السلامة مفردات قياس ملموسة. يمكن أن تؤدي الدقة العامة أو الاتفاق إلى إخفاء الخلافات بين النصوص البرمجية، بينما يمكن أن تؤدي مقارنة النصوص المتقاطعة ومعدل الأخطاء في اللغة الأردية إلى الكشف عن فئة معينة من المحتوى الضار الذي لم يتم تجاهله. يمكن أن تساعد مثل هذه التدابير المؤسسات على تدقيق التغطية اللغوية ومقارنة إصدارات النماذج وتحديد الأماكن التي لا يكون فيها الاختبار القائم على الترجمة كافيًا. لا يدعي المصدر أن النتيجة المقترحة هي مقياس أمان كامل.

يمكن أن تؤثر الفجوة المبلغ عنها بين النماذج ذات الوزن المفتوح والنماذج المغلقة على كيفية اختيار المؤسسات أو نشر أنظمة الإشراف متعددة اللغات، ولكن المقارنة تتطلب العناية. قد تختلف النماذج في بيانات التدريب والضبط وشروط الوصول والسلوك الافتراضي، ولا يوفر الملخص تفاصيل منهجية كافية لعزل سبب الاختلاف. ولذلك تدعم الورقة التدقيق في تغطية النموذج والنص، وليس الاستنتاج الشامل بأن فئة واحدة من النماذج أكثر أمانًا عالميًا.

Interactive Mechanism

الآلية التفاعلية: كيف تعمل فعليًا

استكشف التكنولوجيا الأساسية وراء هذا التطور بشكل تفاعلي.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
التحقق من المفهوم التفاعلي+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

ماذا تشاهد بعد ذلك

والأسئلة المهمة التالية هي ما إذا كانت النتائج ستنجو من مراجعة النظراء والتكرار، وكيف تم تجميع مجموعات البيانات وتصنيفها، وما إذا كان النمط نفسه يظهر في أنظمة الإنتاج الحالية. يجب على الباحثين والقائمين بالنشر أيضًا فحص اللغة الأردية الرومانية، وتبديل التعليمات البرمجية، والتنوع الإقليمي، وجودة الترجمة، وتحديثات النماذج بشكل منفصل. ولا يحدد المصدر أي المحفزات أو عتبات الاعتدال أو إجراءات أخذ العينات أو طرق التخفيف من شأنها أن تقلل من عدم الاتساق المبلغ عنه.

عدم اليقين الأول هو منهجي. المصدر المقدم هو نسخة أولية مطبوعة من arXiv v1، وليس دليلاً على أن العمل قد اكتمل مراجعة النظراء. يحتاج القراء إلى أحجام مجموعة البيانات الكاملة للورقة، وتعريفات الملصقات، وإجراءات التعليق التوضيحي، وعملية الترجمة، والمطالبات، وإعدادات فك التشفير، والتحليل الإحصائي للحكم على مدى قوة النسب المئوية المبلغ عنها.

سيكون النسخ المتماثل ذا أهمية خاصة. تختبر الدراسة خمسة نماذج مسماة ومجموعة معينة من مجموعات البيانات، لكن الملخص لا يحدد ما إذا كانت المعدلات تمتد إلى إصدارات النماذج الأحدث، أو أنظمة الإشراف الأخرى، أو أصناف الأوردو الإضافية أو اللغات والنصوص ذات الصلة. كما أنه لا يوضح ما إذا كانت الأخطاء تتركز في موضوعات معينة، أو أشكال خطاب الكراهية، أو أنماط التهجئة، أو مستويات تبديل الرموز.

يجب على القائمين على النشر مراقبة التقييمات التي تختبر مدخلات النص الأصلي مباشرةً بدلاً من التعامل مع الترجمة الإنجليزية كبديل كافٍ. من شأن أعمال المتابعة المفيدة مقارنة النتائج الخاصة بالنص مع مرور الوقت، والإبلاغ عن النتائج الإيجابية الخاطئة إلى جانب الأضرار المفقودة، واختبار ما إذا كانت تغييرات التخفيف تؤدي إلى تحسين مجموعة متنوعة من اللغات دون تدهور لغة أخرى. المصدر لا يحدد التدخل الذي تم التحقق من صحته.

إن نتائج التغطية البحثية تستحق التحقق أيضًا. أبلغ المؤلفون عن عدم وجود أي أوراق بحثية مخصصة باللغة الأردية في 205 أوراق بحثية عبر تسعة إصدارات ALW/WOAH، لكن الملخص لا يوفر سجل البحث الكامل أو يشرح كيفية تعريف "الأوردو المخصصة". وينبغي لعمليات التدقيق المستقبلية أن تجعل هذه المعايير قابلة للتكرار وفحص العمل خارج الإجراءات. حتى ذلك الحين، فإن أقوى استنتاج مدعوم في الورقة هو أن تغطية النص باللغة الأردية تستحق قياسًا واضحًا في اختبار السلامة في ماجستير إدارة الأعمال.

الأدلة والاختبارات ذات الصلة

أخلاقيات الذكاء الاصطناعيشرح نماذج الذكاء الاصطناعيتدريب الذكاء الاصطناعياختبر ما تعرفه – جرّب اختبارًا مجانيًا للذكاء الاصطناعيابحث عن مصطلح الذكاء الاصطناعي في قاموسنااتبع تعقب تنظيم الذكاء الاصطناعي
وجدت هذا مفيدا؟