Cosa è successo
EleutherAI ha pubblicato una retrospettiva di Aletheia’s Quest, una competizione del luglio 2026 in cui 19 team hanno sviluppato metodi per rilevare comportamenti ingannevoli nei modelli di intelligenza artificiale. L'organizzazione ha inoltre rilasciato i suoi metodi di rilevamento più performanti e una batteria di valutazione da 6.168 righe che copre diverse forme di inganno.
EleutherAI afferma che Aletheia’s Quest è stato organizzato da Cadenza Labs e National Deep Inference Fabric, con il finanziamento di Schmidt Sciences. Le squadre hanno gareggiato in percorsi separati black-box e white-box sui modelli Qwen 3.5, Gemma 3 e Nemotron 3 Super che andavano da 27 miliardi a 120 miliardi di parametri, comprese le ottimizzazioni LoRA che hanno cambiato lo stile e la verbosità delle risposte ingannevoli. La traccia della scatola nera consentiva l'accesso alla conversazione e un giudice fidato Qwen 3.5 9B separato; la traccia white-box ha aggiunto l’accesso alle attivazioni del modello sospetto o alle probabilità logit.
Il rilevatore finale del team EleutherAI ha utilizzato un giudice di fiducia in diverse fasi. Per prima cosa ha risposto alla domanda di fondo senza vedere la risposta del modello sospetto, poi ha convertito tale risposta in affermazioni fattuali e infine ha valutato se qualsiasi affermazione fosse falsa o fuorviante. La squadra ha anche scambiato l'ordine di risposta in due passaggi di valutazione per ridurre gli effetti dell'ordine. La sua versione white-box ha aggiunto un segnale di autovalutazione e una sonda di attivazione condizionale per casi di utilizzo di strumenti senza affermazioni fattuali facilmente verificabili.
Nelle classifiche di validazione, il team riporta un AUROC medio di 0,926 per il metodo black-box e di 0,945 per il metodo white-box in sei combinazioni modello-set di dati. La retrospettiva dice che un'altra squadra, il SAIN Groningen, lo ha successivamente superato nell'ultimo giorno, raggiungendo circa 0,95 AUROC nei test black-box e 0,97 nei test white-box. Quella non era necessariamente la classifica finale: la fonte dice che i piazzamenti finali dovevano essere determinati utilizzando dati di test non pubblicati.
EleutherAI sta rilasciando i suoi metodi più efficaci e un repository chiamato Gauntlet. La batteria contiene 28 distribuzioni e 6.168 righe che coprono bugie fattuali, negazioni della conoscenza, custodia segreta, sandbagging, occultamento di agenti, tratti nascosti, allucinazioni e cambiamenti nel modo in cui vengono espresse le affermazioni ingannevoli. L'organizzazione afferma che due ricercatori hanno prodotto e valutato circa 290 moduli rilevatori in 27 distribuzioni di valutazione nell'arco di circa un mese, con agenti di codifica che gestiscono gran parte dell'implementazione e dell'esecuzione dell'esperimento.
Dettagli della fonte: blog.eleuther.ai ↗
Perché è importante
I risultati suggeriscono che un modello linguistico affidabile più debole può identificare molte risposte ingannevoli da una sola conversazione, senza accesso alle attivazioni interne del modello sospetto. Ma la retrospettiva mostra anche perché quell’apparente successo potrebbe non essere generalizzato: i risultati dei benchmark dipendevano in larga misura dal tipo di inganno, e le indagini interne a volte hanno ottenuto risultati peggiori del caso su set di dati non familiari.
La scoperta pratica più importante è che il monitoraggio tramite scatola nera ha funzionato molto meglio di quanto i ricercatori si aspettassero. Un giudice fidato a volte identificava l’inganno senza leggere i dettagli interni del modello sospetto, e la fonte afferma che questo approccio ha funzionato in molti scenari del concorso. Ciò è importante perché l’accesso interno non è disponibile per la maggior parte dei sistemi commerciali distribuiti, rendendo in linea di principio più semplice applicare il monitoraggio a livello di conversazione.
Il risultato non dimostra che un giudice fidato possa determinare in modo affidabile se un sistema di intelligenza artificiale mente in generale. L’analisi di EleutherAI ha rilevato che i giudici potrebbero sfruttare la conoscenza condivisa tra i modelli. In un test costruito, ogni modello sospetto ha dato la stessa risposta – “Mi dispiace, non conosco la risposta a questa domanda” – ma i giudici hanno previsto se il modello sospetto conoscesse effettivamente la risposta. La fonte riporta AUROC compresi tra 0,66 e 0,76, e circa 0,82 quando è stata utilizzata direttamente la capacità del giudice di rispondere alla domanda.
Questo comportamento può essere utile per rilevare alcune smentite di conoscenza, ma può anche far sembrare che un rilevatore comprenda la convinzione privata di un modello sospetto quando utilizza principalmente dati di addestramento o modelli di risposta correlati. EleutherAI afferma che in alcuni casi i modelli del sospettato e del giudice non sono riusciti a condividere la conoscenza e non stabilisce che il metodo si trasferisca a modelli con dati di addestramento o procedure post-addestramento sostanzialmente diversi.
La retrospettiva mette in discussione anche la definizione di menzogna data dal concorso. Aletheia’s Quest ha etichettato una risposta ingannevole quando un modello ha generato un’affermazione che si credeva considerasse falsa, anche senza prove che intendesse ingannare qualcuno. EleutherAI sostiene che l'uso ordinario di "mentire" generalmente include un destinatario e l'intenzione di far credere a quella persona la falsa affermazione. Questa distinzione influisce sul modo in cui i set di dati vengono etichettati e su ciò che un rilevatore deve trovare.
Meccanismo interattivo: come funziona realmente
Esplora la tecnologia alla base di questo sviluppo in modo interattivo.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Cosa guardare dopo
Le principali domande irrisolte sono se i rilevatori di bugie possano identificare omissioni, resoconti distorti e obiettivi nascosti nei compiti a lungo termine degli agenti di intelligenza artificiale, e se i valutatori indipendenti possano costruire test che non premino il semplice controllo dei fatti o sfruttare la conoscenza condivisa tra i modelli. La classifica finale dei test privati di Aletheia non era ancora disponibile nella fonte.
Il passo successivo più importante è verificare l’inganno che non può essere ridotto a una falsa frase fattuale. La fonte afferma che gli agenti a lungo orizzonte possono trarre in inganno attraverso omissioni, resoconti selettivi, riassunti distorti o obiettivi nascosti. Questi casi sono più difficili da etichettare perché potrebbe non esserci una singola frase che possa essere confrontata con una risposta stabilita.
I ricercatori dovrebbero anche esaminare se i rilevatori rimangono affidabili tra famiglie di modelli, messa a punto, compiti e stili di conversazione. EleutherAI riferisce che ogni sonda lineare testata ha funzionato bene in alcuni scenari, ma non è stata al di sotto del caso in altri, a volte invertendo sistematicamente la relazione prevista tra il suo punteggio e l’inganno. Un rilevatore che funziona bene su un benchmark può quindi creare una falsa fiducia se utilizzato al di fuori di quella distribuzione.
Il guanto di sfida può aiutare, ma il suo valore dipenderà dalla replica indipendente e dal fatto che i futuri set di dati contengano credenze realmente nascoste, comportamenti strategici e traiettorie realistiche degli agenti. La fonte non fornisce risultati dal set di test privati inediti, dati di distribuzione nel mondo reale, tassi di falsi positivi per gli utenti o prove che questi rilevatori identifichino inganni intenzionali piuttosto che errori fattuali, allucinazioni o parole insolite.
Il settore avrà bisogno anche di una governance più chiara attorno a giudici fidati. Un giudice più forte potrebbe rilevare segnali più sottili, ma l’addestramento di modelli condivisi potrebbe produrre una monocultura algoritmica in cui i modelli deducono le conoscenze o le abitudini degli altri senza fornire un audit affidabile. EleutherAI propone sonde e instradamenti di rilevatori più granulari, ma la fonte li presenta come direzioni di ricerca future piuttosto che come soluzioni convalidate.