Terug naar Nieuws
InnovatieAI Understanding-briefing

Uit onderzoek blijkt dat LLM's onmogelijke vragen kunnen herkennen, maar zich vaak niet onthouden

Een artikel dat is geaccepteerd voor EMNLP 2026 meldt dat taalmodellen weergeven of sommige wiskunde- en codevragen structureel beantwoord kunnen worden, maar er niet in slagen dat signaal om te zetten in weigeringsgedrag.

5 min readRead the primary source
Source-provided image accompanying Study finds LLMs can recognize impossible questions but often fail to abstain
Primair brondocumentBron opgenomen
Uitgever
arxiv.org
Bronlink
arxiv.orghttps://arxiv.org/abs/2608.29109
Brontype
Primair document: een officiële aankondiging, document, dossier of first-party pagina die we rechtstreeks lezen.
ContextBegrijp dit in 60 seconden

Begin hier

Sleuteltermen

API (Applicatieprogrammeringsinterface)
Een gestructureerde manier waarop het ene softwaresysteem verzoeken kan verzenden naar en antwoorden kan ontvangen van een ander systeem.
Na de training
Trainingsstappen toegepast na de voortraining, zoals het afstemmen van instructies, het optimaliseren van voorkeuren en het afstemmen van de veiligheid.
Kalibratie
Hoe goed de betrouwbaarheidsscores van een model overeenkomen met de werkelijke correctheidskansen.
Test jezelfQuiz over AI-modellen uitgelegd

Wat is er gebeurd

Onderzoekers Yucheng Du en Xiyang Hu onderzochten waarom op instructie afgestemde taalmodellen soms vragen beantwoorden die geen geldig antwoord hebben, zoals het berekenen van cot(-540°) of het evalueren van (1).startswith("1"). In modellen variërend van 1,7 miljard tot 70 miljard parameters rapporteren ze dat ze een verborgen richting hebben gevonden die antwoordbare aanwijzingen scheidt van structureel onmogelijke aanwijzingen. Het artikel stelt dat dit aangeeft dat er sprake is van herkenning, maar dat er geen betrouwbaar verband bestaat met onthouding.

Het artikel richt zich op een specifiek betrouwbaarheidsprobleem: grote taalmodellen beantwoorden vragen die structureel niet te beantwoorden zijn in plaats van te weigeren te antwoorden. Voorbeelden hiervan zijn de trigonometrische uitdrukking cot(-540°) en de code-uitdrukking (1).startswith("1"). De auteurs onderscheiden dit falen van gewone feitelijke fouten: de vraag is of er überhaupt een geldig antwoord bestaat binnen de structuur van de vraag.

Du en Hu rapporteren experimenten met op instructie afgestemde modellen die 1,7 miljard tot 70 miljard parameters omvatten. Ze zeggen dat één enkele lineaire richting in de verborgen toestanden van de modellen de beantwoordbare aanwijzingen scheidt van structureel onmogelijke wiskundige en codeeraanwijzingen. In de interpretatie van de auteurs laat deze scheiding zien dat de modellen onmogelijkheid vertegenwoordigen voordat ze een reactie genereren.

De gerapporteerde herkenningsrichting stond bijna loodrecht op wat de krant de canonieke richting van veiligheidsweigering noemt, die de auteurs associëren met getrainde weigering van schadelijke inhoud. Een richting die zich bewust is van de invaliditeit, gedefinieerd vanuit gedrag binnen het domein, lag dichter bij de herkenningsrichting, maar was er slechts gedeeltelijk mee in lijn en bleef vrijwel loodrecht op de richting van veiligheidsweigering.

De auteurs melden ook dat generatie-tijdsturing in de herkenningsrichting het invaliditeitsbewuste gedrag in beide richtingen en op een dosis-responsieve manier op structurele wiskunde- en codecellen veranderde. Willekeurige aanwijzingen produceerden niet hetzelfde gerapporteerde effect. Vergelijkingen tussen basismodellen en op instructies afgestemde modellen suggereerden verder dat de lage-cosinusgeometrie al aanwezig was op het eindpunt van de voortraining. Het artikel concludeert dat het falen beter kan worden verklaard als een routeringsfout dan als een coderingsfout: het model heeft een bruikbaar signaal dat er geen toelaatbaar antwoord is, maar het weigeringspad is niet afgestemd op het gebruik ervan.

Brongegevens: arxiv.org ↗

Waarom het ertoe doet

Het resultaat daagt een eenvoudige verklaring uit dat modellen onmogelijke vragen beantwoorden omdat ze het probleem niet kunnen herkennen. Als de interpretatie van het artikel klopt, kan het verbeteren van de betrouwbaarheid routerings- of besluitvormingsmechanismen vereisen die een intern onmogelijkheidsignaal omzetten in een expliciete weigering of verduidelijking. Het onderzoek is echter een preprint-onderzoeksrapport en de samenvatting ervan geeft niet aan hoe breed de bevindingen generaliseren buiten de geteste wiskunde- en codeprompts of -modellen.

Het praktische belang van de bewering in het artikel is de voorgestelde diagnose. Als een model niet kan weergeven dat een prompt onmogelijk is, hebben ontwikkelaars mogelijk betere trainingsgegevens of representaties nodig. Maar als het model dat signaal al uitdraagt ​​en er niet naar handelt, kan het interventiepunt in plaats daarvan het verband zijn tussen interne herkenning, responsselectie en onthouding.

Dat onderscheid is van belang omdat een vloeiend antwoord op een onmogelijke vraag nuttiger kan lijken dan een weigering, terwijl het fundamenteel ongeldig is. Een systeem dat structurele onmogelijkheid onderkent, zou in plaats daarvan kunnen stellen dat de prompt geen aanvaardbaar antwoord heeft, de relevante beperking kunnen uitleggen of de gebruiker kunnen vragen de invoer te corrigeren. De bron rapporteert geen geïmplementeerd product of een aangetoonde verbetering in de gebruikersresultaten, dus deze toepassingen blijven eerder implicaties dan gevestigde resultaten.

De vergelijking met veiligheidsweigering is ook consequent. Het artikel rapporteert dat de interne richting die verband houdt met het herkennen van onmogelijke aanwijzingen bijna loodrecht staat op een richting die verband houdt met het weigeren van schadelijke inhoud. Dat suggereert dat het behandelen van alle weigeringen als één generieke mogelijkheid belangrijke verschillen kan missen tussen weigeren omdat de inhoud onveilig is en zich onthouden omdat een vraag verkeerd is geformuleerd of geen geldige oplossing heeft.

De bevindingen moeten met duidelijke grenzen worden gelezen. De bron biedt geen modelnamen, benchmarkgroottes, nauwkeurigheidstabellen, foutpercentages, stuurkosten of onafhankelijke replicatie. Het laat niet zien dat elk model dezelfde geometrie heeft, dat de gerapporteerde richtingen stabiel zijn in verschillende talen of modaliteiten, of dat sturing ongewenste veranderingen in behulpzaamheid vermijdt. Het artikel wordt geïdentificeerd als geaccepteerd voor EMNLP 2026, maar het aangeleverde materiaal blijft een arXiv-samenvatting en geeft op zichzelf niet de volledige kracht van de beweringen aan.

Interactive Mechanism

Interactief mechanisme: hoe het eigenlijk werkt

Ontdek interactief de onderliggende technologie achter deze ontwikkeling.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interactieve conceptcheck+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Wat je nu moet bekijken

De belangrijkste follow-up is of het gerapporteerde herkenningssignaal bredere tests overleeft en kan worden gebruikt in geïmplementeerde systemen zonder legitieme antwoorden te onderdrukken. Het artikel meldt dat sturen in de richting het gedrag in beide richtingen en op een dosisafhankelijke manier veranderde, terwijl willekeurige richtingen dat niet deden. Verder onderzoek zou moeten uitwijzen of deze interventie de kalibratie in de echte wereld verbetert, hoe vaak het onnodige weigeringen oplevert en of de geometrie verandert na latere training.

Een centrale vraag is de reikwijdte. De gerapporteerde experimenten hebben betrekking op structurele wiskunde- en codeprompts, maar de samenvatting zegt niet of hetzelfde herkennings- en routeringspatroon voorkomt in alledaagse feitelijke vragen, dubbelzinnige instructies, gereedschapsgebruik of multimodale systemen. Het testen van deze instellingen zou uitwijzen of de voorgestelde diagnose een beperkte eigenschap van geselecteerde aanwijzingen is of een breder modelgedrag.

Het stuurresultaat verdient een zorgvuldige replicatie. De auteurs rapporteren bidirectioneel, dosisafhankelijk gedrag bij het sturen in de herkenningsrichting en geen vergelijkbaar effect vanuit willekeurige richtingen. Vervolgstudies zouden moeten meten of een dergelijke sturing de onthouding op een nuttig werkingspunt verbetert, of dat het valse weigeringen creëert, de stijl van antwoorden verandert, of kwetsbaar wordt tussen modelversies en decoderingsinstellingen.

Ontwikkelaars en beoordelaars moeten ook letten op betere statistieken die onderscheid maken tussen erkenning en actie. Een model kan intern een onmogelijke vraag detecteren, maar deze toch beantwoorden, of weigeren zonder correct te identificeren waarom. Evaluaties die zowel het herkenningssignaal van het model als het uiteindelijke gedrag ervan registreren, zouden de routeringsfouthypothese van het artikel directer kunnen testen.

Er blijven belangrijke onbekenden bestaan ​​over training en inzet. De bron stelt niet vast of na de training de herkennings- en weigeringsroutes op betrouwbare wijze op elkaar kunnen worden afgestemd, of de interventie toegang vereist tot verborgen toestanden die niet beschikbaar zijn via een API, of hoe de aanpak zou interageren met veiligheidswaarborgen. Deze vragen zullen bepalen of het resultaat een praktische betrouwbaarheidstechniek wordt of een verklarende bevinding blijft over modelinternals.

Gerelateerde gidsen en quizzen

AI-modellen uitgelegdChatGPT & LLM'sAI-ethiekAI-trainingTest wat je weet: probeer een gratis AI-quizZoek een AI-term op in onze woordenlijstVolg de AI-modelreleasetracker
Vond je dit nuttig?