Wat is er gebeurd
Onderzoekers Yucheng Du en Xiyang Hu onderzochten waarom op instructie afgestemde taalmodellen soms vragen beantwoorden die geen geldig antwoord hebben, zoals het berekenen van cot(-540°) of het evalueren van (1).startswith("1"). In modellen variërend van 1,7 miljard tot 70 miljard parameters rapporteren ze dat ze een verborgen richting hebben gevonden die antwoordbare aanwijzingen scheidt van structureel onmogelijke aanwijzingen. Het artikel stelt dat dit aangeeft dat er sprake is van herkenning, maar dat er geen betrouwbaar verband bestaat met onthouding.
Het artikel richt zich op een specifiek betrouwbaarheidsprobleem: grote taalmodellen beantwoorden vragen die structureel niet te beantwoorden zijn in plaats van te weigeren te antwoorden. Voorbeelden hiervan zijn de trigonometrische uitdrukking cot(-540°) en de code-uitdrukking (1).startswith("1"). De auteurs onderscheiden dit falen van gewone feitelijke fouten: de vraag is of er überhaupt een geldig antwoord bestaat binnen de structuur van de vraag.
Du en Hu rapporteren experimenten met op instructie afgestemde modellen die 1,7 miljard tot 70 miljard parameters omvatten. Ze zeggen dat één enkele lineaire richting in de verborgen toestanden van de modellen de beantwoordbare aanwijzingen scheidt van structureel onmogelijke wiskundige en codeeraanwijzingen. In de interpretatie van de auteurs laat deze scheiding zien dat de modellen onmogelijkheid vertegenwoordigen voordat ze een reactie genereren.
De gerapporteerde herkenningsrichting stond bijna loodrecht op wat de krant de canonieke richting van veiligheidsweigering noemt, die de auteurs associëren met getrainde weigering van schadelijke inhoud. Een richting die zich bewust is van de invaliditeit, gedefinieerd vanuit gedrag binnen het domein, lag dichter bij de herkenningsrichting, maar was er slechts gedeeltelijk mee in lijn en bleef vrijwel loodrecht op de richting van veiligheidsweigering.
De auteurs melden ook dat generatie-tijdsturing in de herkenningsrichting het invaliditeitsbewuste gedrag in beide richtingen en op een dosis-responsieve manier op structurele wiskunde- en codecellen veranderde. Willekeurige aanwijzingen produceerden niet hetzelfde gerapporteerde effect. Vergelijkingen tussen basismodellen en op instructies afgestemde modellen suggereerden verder dat de lage-cosinusgeometrie al aanwezig was op het eindpunt van de voortraining. Het artikel concludeert dat het falen beter kan worden verklaard als een routeringsfout dan als een coderingsfout: het model heeft een bruikbaar signaal dat er geen toelaatbaar antwoord is, maar het weigeringspad is niet afgestemd op het gebruik ervan.
Waarom het ertoe doet
Het resultaat daagt een eenvoudige verklaring uit dat modellen onmogelijke vragen beantwoorden omdat ze het probleem niet kunnen herkennen. Als de interpretatie van het artikel klopt, kan het verbeteren van de betrouwbaarheid routerings- of besluitvormingsmechanismen vereisen die een intern onmogelijkheidsignaal omzetten in een expliciete weigering of verduidelijking. Het onderzoek is echter een preprint-onderzoeksrapport en de samenvatting ervan geeft niet aan hoe breed de bevindingen generaliseren buiten de geteste wiskunde- en codeprompts of -modellen.
Het praktische belang van de bewering in het artikel is de voorgestelde diagnose. Als een model niet kan weergeven dat een prompt onmogelijk is, hebben ontwikkelaars mogelijk betere trainingsgegevens of representaties nodig. Maar als het model dat signaal al uitdraagt en er niet naar handelt, kan het interventiepunt in plaats daarvan het verband zijn tussen interne herkenning, responsselectie en onthouding.
Dat onderscheid is van belang omdat een vloeiend antwoord op een onmogelijke vraag nuttiger kan lijken dan een weigering, terwijl het fundamenteel ongeldig is. Een systeem dat structurele onmogelijkheid onderkent, zou in plaats daarvan kunnen stellen dat de prompt geen aanvaardbaar antwoord heeft, de relevante beperking kunnen uitleggen of de gebruiker kunnen vragen de invoer te corrigeren. De bron rapporteert geen geïmplementeerd product of een aangetoonde verbetering in de gebruikersresultaten, dus deze toepassingen blijven eerder implicaties dan gevestigde resultaten.
De vergelijking met veiligheidsweigering is ook consequent. Het artikel rapporteert dat de interne richting die verband houdt met het herkennen van onmogelijke aanwijzingen bijna loodrecht staat op een richting die verband houdt met het weigeren van schadelijke inhoud. Dat suggereert dat het behandelen van alle weigeringen als één generieke mogelijkheid belangrijke verschillen kan missen tussen weigeren omdat de inhoud onveilig is en zich onthouden omdat een vraag verkeerd is geformuleerd of geen geldige oplossing heeft.
De bevindingen moeten met duidelijke grenzen worden gelezen. De bron biedt geen modelnamen, benchmarkgroottes, nauwkeurigheidstabellen, foutpercentages, stuurkosten of onafhankelijke replicatie. Het laat niet zien dat elk model dezelfde geometrie heeft, dat de gerapporteerde richtingen stabiel zijn in verschillende talen of modaliteiten, of dat sturing ongewenste veranderingen in behulpzaamheid vermijdt. Het artikel wordt geïdentificeerd als geaccepteerd voor EMNLP 2026, maar het aangeleverde materiaal blijft een arXiv-samenvatting en geeft op zichzelf niet de volledige kracht van de beweringen aan.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
Wat je nu moet bekijken
De belangrijkste follow-up is of het gerapporteerde herkenningssignaal bredere tests overleeft en kan worden gebruikt in geïmplementeerde systemen zonder legitieme antwoorden te onderdrukken. Het artikel meldt dat sturen in de richting het gedrag in beide richtingen en op een dosisafhankelijke manier veranderde, terwijl willekeurige richtingen dat niet deden. Verder onderzoek zou moeten uitwijzen of deze interventie de kalibratie in de echte wereld verbetert, hoe vaak het onnodige weigeringen oplevert en of de geometrie verandert na latere training.
Een centrale vraag is de reikwijdte. De gerapporteerde experimenten hebben betrekking op structurele wiskunde- en codeprompts, maar de samenvatting zegt niet of hetzelfde herkennings- en routeringspatroon voorkomt in alledaagse feitelijke vragen, dubbelzinnige instructies, gereedschapsgebruik of multimodale systemen. Het testen van deze instellingen zou uitwijzen of de voorgestelde diagnose een beperkte eigenschap van geselecteerde aanwijzingen is of een breder modelgedrag.
Het stuurresultaat verdient een zorgvuldige replicatie. De auteurs rapporteren bidirectioneel, dosisafhankelijk gedrag bij het sturen in de herkenningsrichting en geen vergelijkbaar effect vanuit willekeurige richtingen. Vervolgstudies zouden moeten meten of een dergelijke sturing de onthouding op een nuttig werkingspunt verbetert, of dat het valse weigeringen creëert, de stijl van antwoorden verandert, of kwetsbaar wordt tussen modelversies en decoderingsinstellingen.
Ontwikkelaars en beoordelaars moeten ook letten op betere statistieken die onderscheid maken tussen erkenning en actie. Een model kan intern een onmogelijke vraag detecteren, maar deze toch beantwoorden, of weigeren zonder correct te identificeren waarom. Evaluaties die zowel het herkenningssignaal van het model als het uiteindelijke gedrag ervan registreren, zouden de routeringsfouthypothese van het artikel directer kunnen testen.
Er blijven belangrijke onbekenden bestaan over training en inzet. De bron stelt niet vast of na de training de herkennings- en weigeringsroutes op betrouwbare wijze op elkaar kunnen worden afgestemd, of de interventie toegang vereist tot verborgen toestanden die niet beschikbaar zijn via een API, of hoe de aanpak zou interageren met veiligheidswaarborgen. Deze vragen zullen bepalen of het resultaat een praktische betrouwbaarheidstechniek wordt of een verklarende bevinding blijft over modelinternals.