Terug naar Nieuws
BeveiligingAI Understanding-briefing

Uit onderzoek blijkt dat LLM-screening op haatspraak minder consistent is in Urdu-scripts

Een preprint van arXiv meldt dat vijf grote taalmodellen de classificaties van schadelijke inhoud in Urdu-scripts en Engelse vertalingen hebben gewijzigd, waardoor een meetbare veiligheidskloof voor ‘Missed-in-Urdu’ aan het licht is gekomen.

5 min readRead the primary source
Source-page capture accompanying Study finds LLM hate-speech screening is less consistent in Urdu scripts
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.24191
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

Groot taalmodel (LLM)
Een taalmodel dat is getraind op enorme tekstcorpora om tekst te genereren en te analyseren.
API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Gegevensset
Een verzameling gestructureerde of ongestructureerde voorbeelden die worden gebruikt voor training, validatie of testen.
Test jezelfAI-ethiekquiz

Wat is er gebeurd

Een arXiv-voordruk testte GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 en Llama-3.1 op zes datasets voor Nastaliq Urdu, Roman Urdu, Engels en code-geschakeld Urdu-Engels. De auteurs melden dat de classificaties zijn veranderd tussen de originele Urdu-scriptinhoud en Engelse vertalingen, waarbij sommige schadelijke inhoud als normaal wordt doorgegeven in het Urdu. De krant rapporteert ook dat er geen speciale Urdu-papers zijn gevonden in 205 papers in negen edities van de ALW/WOAH-procedures.

Het artikel, ingediend bij arXiv op 25 augustus 2026, onderzoekt of grote taalmodellen haatzaaiende uitlatingen consistent classificeren in Urdu-scriptvormen. Het experiment omvat vijf modellen – GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5 en Llama-3.1 – en zes datasets verspreid over Nastaliq Urdu, Roman Urdu, Engels en code-geschakeld Urdu-Engels. De bron presenteert het werk als een onderzoek naar inconsistentie in de veiligheid tussen scripts, en niet als een productlancering of een rapport van een specifiek platformincident.

De auteurs vergelijken classificaties van inhoud in het originele script met classificaties van Engelse vertalingen. Ze rapporteren labelinstabiliteit in de vijf Urdu-script-datasets, variërend van 15,9% voor Gemini 2.5 Flash tot 31,6% voor Qwen-2.5. In de terminologie van het artikel is een ‘Missed-in-Urdu’-geval inhoud die in de Engelse vertaling als schadelijk is gemarkeerd, maar in het oorspronkelijke Urdu-schrift als normaal is geclassificeerd.

De gerapporteerde gemiste-in-Urdu-percentages variëren van 2,4% tot 9,9%, met een mediaan van 4,3% voor alle modellen. De samenvatting zegt dat kleinere open-weight-modellen aanzienlijk hogere instabiliteits- en gemiste schadepercentages vertoonden dan de frontier-closed-modellen die in de test waren opgenomen. Dit zijn resultaten gerapporteerd door de auteurs; de aangeleverde bron bevat niet de onderliggende voorbeelden, uitsplitsingen per , betrouwbaarheidsintervallen of statistische tests.

Het artikel onderzoekt ook het onderzoeksverslag rond de Urdu-veiligheidsevaluatie. Volgens de samenvatting gebruikten de auteurs de ACL Anthology API om 205 artikelen in negen ALW/WOAH-edities op te sommen en vonden ze in die periode geen speciale Urdu-artikelen. De bron identificeert niet elk inclusiecriterium in die opsomming en legt ook niet uit of relevant werk mogelijk onder andere locaties, labels of onderzoekscategorieën is verschenen.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

De studie suggereert dat een content-moderatiesysteem veiliger kan lijken wanneer het wordt getest via Engelse vertalingen dan wanneer het rechtstreeks met Urdu omgaat. Dat schept een praktisch evaluatieprobleem voor platforms en diensten die meertalige gebruikers bedienen: geaggregeerde veiligheidsscores kunnen fouten verbergen die geconcentreerd zijn in bepaalde scripts of taalvariëteiten. De bevindingen zijn beweringen uit een enkele arXiv-voordruk en geven niet aan hoe breed de gemeten percentages generaliseren buiten de geteste datasets en modellen.

De centrale implicatie is dat veiligheidsevaluatie kan afhangen van de manier waarop taal wordt weergegeven, en niet alleen van wat de tekst betekent. Als een moderatiemodel voornamelijk op Engels of vertaald materiaal wordt getest, is het mogelijk dat de gemeten prestaties geen fouten aan het licht brengen die optreden wanneer gebruikers in het Urdu-script schrijven. Een systeem zou daarom geruststellende totaalresultaten kunnen behalen, terwijl wezenlijk verschillende inputs ongelijkmatig worden verwerkt.

Dat is belangrijk omdat contentmoderatie vaak wordt gebruikt om te beslissen of materiaal wordt geblokkeerd, geëscaleerd of toegestaan. Het gerapporteerde Missed-in-Urdu-patroon beschrijft een richtinggevend belangrijke fout: tekst die na vertaling als schadelijk werd beschouwd, werd soms als normaal doorgegeven in het originele script. Het onderzoek laat niet zien hoe vaak dergelijke gevallen voorkomen op platforms in de echte wereld, om welke soorten spraak het ging, of welke consequenties daaruit volgden. Daarom moet de praktische impact ervan worden omschreven als een gedocumenteerd evaluatieprobleem in plaats van een gekwantificeerde schatting van de schade.

Het werk geeft veiligheidsteams ook een concreet meetvocabulaire. Algehele nauwkeurigheid of overeenstemming kunnen meningsverschillen tussen scripts verbergen, terwijl een cross-script-vergelijking en een Gemist-in-Urdu-percentage één specifieke klasse van gemiste schadelijke inhoud aan het licht kunnen brengen. Dergelijke maatregelen kunnen organisaties helpen de taaldekking te controleren, modelversies te vergelijken en te identificeren waar op vertalingen gebaseerde tests onvoldoende zijn. De bron beweert niet dat de voorgestelde score een volledige veiligheidsmaatstaf is.

De gerapporteerde kloof tussen open-weight en gesloten modellen zou van invloed kunnen zijn op de manier waarop organisaties meertalige moderatiesystemen kiezen of inzetten, maar de vergelijking vereist voorzichtigheid. De modellen kunnen verschillen wat betreft trainingsgegevens, afstemming, toegangsvoorwaarden en standaardgedrag, en de samenvatting biedt niet voldoende methodologische details om de oorzaak van het verschil te isoleren. Het artikel ondersteunt daarom onderzoek naar de dekking van modellen en scripts, en niet de algemene conclusie dat één modelcategorie universeel veiliger is.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
Interactieve conceptcheck+10 Points
AI Ethics Quiz

Why can ethical evaluation not be reduced to one model score?

Wat je nu moet bekijken

De belangrijke volgende vragen zijn of de resultaten peer review en replicatie overleven, hoe de datasets zijn samengesteld en gelabeld, en of hetzelfde patroon voorkomt in de huidige productiesystemen. Onderzoekers en uitvoerders moeten ook Romeins Urdu, codewisseling, regionale variatie, vertaalkwaliteit en modelupdates afzonderlijk onderzoeken. De bron stelt niet vast welke aanwijzingen, moderatiedrempels, bemonsteringsprocedures of mitigatiemethoden de gerapporteerde inconsistentie zouden verminderen.

De eerste onzekerheid is methodologisch van aard. De aangeleverde bron is een preprint van arXiv v1, geen bewijs dat het werk peer review heeft ondergaan. Lezers hebben de datasetgroottes, labeldefinities, annotatorprocedures, vertaalproces, aanwijzingen, decoderingsinstellingen en statistische analyses van het volledige artikel nodig om te beoordelen hoe robuust de gerapporteerde percentages zijn.

Replicatie zal vooral belangrijk zijn. De studie test vijf genoemde modellen en een specifieke set datasets, maar de samenvatting geeft niet aan of de tarieven zich uitstrekken tot nieuwere modelversies, andere moderatiesystemen, aanvullende Urdu-variëteiten of verwante talen en scripts. Het laat ook niet zien of fouten geconcentreerd zijn in bepaalde onderwerpen, vormen van haatzaaiende uitlatingen, spellingspatronen of niveaus van code-switching.

Implementeerders moeten letten op evaluaties die originele scriptinvoer rechtstreeks testen, in plaats van Engelse vertalingen als voldoende proxy te beschouwen. Nuttig vervolgwerk zou scriptspecifieke resultaten in de loop van de tijd kunnen vergelijken, valse positieven naast gemiste schade kunnen rapporteren en kunnen testen of mitigatieveranderingen de ene taalvariëteit verbeteren zonder de andere te verslechteren. De bron identificeert geen gevalideerde interventie.

De bevinding van de onderzoeksdekking rechtvaardigt ook verificatie. De auteurs rapporteren nul toegewijde Urdu-artikelen in 205 artikelen verspreid over negen ALW/WOAH-edities, maar de samenvatting biedt niet het volledige zoekrecord en legt niet uit hoe “toegewijd Urdu” werd gedefinieerd. Toekomstige audits moeten deze criteria reproduceerbaar maken en werk buiten de procedure onderzoeken. Tot die tijd is de sterkst ondersteunde conclusie van het artikel dat de dekking van Urdu-scripts expliciete metingen verdient bij LLM-veiligheidstests.

Gerelateerde gidsen en quizzen

AI-ethiekAI-modellen uitgelegdAI-trainingTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-regelgevingstracker
Vond je dit nuttig?