Ce sa întâmplat
EleutherAI a publicat o retrospectivă a Aletheia’s Quest, o competiție din iulie 2026 în care 19 echipe au dezvoltat metode pentru detectarea comportamentului înșelător în modelele AI. Organizația a lansat, de asemenea, cele mai performante metode de detectare și o baterie de evaluare cu 6.168 de rânduri care acoperă mai multe forme de înșelăciune.
EleutherAI spune că Aletheia’s Quest a fost organizat de Cadenza Labs și National Deep Inference Fabric, cu finanțare de la Schmidt Sciences. Echipele au concurat pe piese separate cu cutie neagră și cutie albă pe modelele Qwen 3.5, Gemma 3 și Nemotron 3 Super, variind de la 27 la 120 de miliarde de parametri, inclusiv melodii fine LoRA care au schimbat stilul și verbozitatea răspunsurilor înșelătoare. Piesa cu casetă neagră a permis accesul la conversație și un judecător de încredere Qwen 3.5 9B separat; pista cutie albă a adăugat acces la activările modelului suspect sau la probabilitățile de logare.
Detectorul final al echipei EleutherAI a folosit un judecător de încredere în mai multe etape. Mai întâi a răspuns la întrebarea de bază fără a vedea răspunsul modelului suspect, apoi a convertit acel răspuns în afirmații de fapt și, în cele din urmă, a evaluat dacă vreo afirmație era cu încredere falsă sau înșelătoare. Echipa a schimbat, de asemenea, ordinea de răspuns în două treceri de jurizare pentru a reduce efectele ordinii. Versiunea sa cutie albă a adăugat un semnal de autoevaluare și o sondă de activare condiționată pentru cazurile de utilizare a instrumentelor fără afirmații factuale ușor de verificat.
Pe clasamentele de validare, echipa raportează un AUROC mediu de 0,926 pentru metoda casetei negre și 0,945 pentru metoda casetei albe în șase combinații model-set de date. Retrospectiva spune că o altă echipă, SAIN Groningen, a depășit-o mai târziu în ultima zi, ajungând la aproximativ 0,95 AUROC la testarea cutie neagră și 0,97 la testarea cutie albă. Acestea nu erau neapărat clasamentele finale: sursa spune că pozițiile finale trebuiau determinate folosind date de testare nepublicate.
EleutherAI lansează cele mai puternice metode ale sale și un depozit numit gauntlet. Bateria conține 28 de distribuții și 6.168 de rânduri care acoperă minciuni faptice, negarea cunoștințelor, păstrarea secretelor, sandbagging, ascundere agentică, trăsături ascunse, halucinații și schimbări în modul în care sunt exprimate afirmațiile înșelătoare. Organizația spune că doi cercetători au produs și evaluat aproximativ 290 de module detectoare în 27 de distribuții de evaluare timp de aproximativ o lună, agenții de codificare care se ocupă de o mare parte a implementării și execuției experimentului.
Detalii sursa: blog.eleuther.ai ↗
De ce contează
Rezultatele sugerează că un model de limbaj de încredere mai slab poate identifica multe răspunsuri înșelătoare doar dintr-o conversație, fără acces la activările interne ale modelului suspect. Dar retrospectiva arată, de asemenea, de ce acel succes aparent s-ar putea să nu se generalizeze: rezultatele benchmark-ului depind în mare măsură de tipul de înșelăciune, iar sondele interne au avut uneori rezultate mai proaste decât șansa pe seturi de date necunoscute.
Cea mai puternică constatare practică este că monitorizarea cutiei negre a funcționat mult mai bine decât se așteptau cercetătorii. Un judecător de încredere a identificat uneori înșelăciunea fără a citi elementele interne ale modelului suspect, iar sursa spune că această abordare a funcționat în multe dintre scenariile concursului. Acest lucru contează deoarece accesul intern nu este disponibil pentru majoritatea sistemelor comerciale implementate, ceea ce face ca monitorizarea la nivel de conversație să fie mai ușor de aplicat, în principiu.
Rezultatul nu arată că un judecător de încredere poate determina în mod fiabil dacă un sistem AI minte în general. Analiza proprie a EleutherAI a constatat că judecătorii ar putea exploata cunoștințele partajate între modele. Într-un test construit, fiecare model suspect a dat răspunsul identic – „Îmi pare rău, nu știu răspunsul la acesta” – totuși judecătorii au prezis dacă modelul suspect știa cu adevărat răspunsul. Sursa raportează AUROC între 0,66 și 0,76 și aproximativ 0,82 atunci când capacitatea judecătorului de a răspunde la întrebare a fost utilizată direct.
Acest comportament poate fi util pentru detectarea unor refuzuri de cunoștințe, dar poate face, de asemenea, ca un detector să pară să înțeleagă credința privată a unui model suspect atunci când utilizează în principal date de antrenament corelate sau modele de răspuns. EleutherAI spune că modelele suspecților și judecătorilor nu au reușit să împărtășească cunoștințele în unele cazuri și nu stabilește că metoda se transferă la modele cu date de antrenament sau proceduri post-formare substanțial diferite.
De asemenea, retrospectiva contestă definiția de minciună a concursului. Aletheia’s Quest a etichetat un răspuns înșelător atunci când un model a generat o declarație pe care se credea că o consideră falsă, chiar și fără dovezi că intenționează să inducă în eroare pe cineva. EleutherAI susține că utilizarea obișnuită a „minciunii” include, în general, un destinatar și o intenție de a face acea persoană să creadă afirmația falsă. Această distincție afectează modul în care seturile de date sunt etichetate și ceea ce i se cere unui detector să găsească.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Ce să urmărești în continuare
Principalele întrebări nerezolvate sunt dacă detectorii de minciuni pot identifica omisiunile, raportările distorsionate și obiectivele ascunse în sarcinile de lungă durată ale agentului AI și dacă evaluatorii independenți pot construi teste care nu recompensează simpla verificare a faptelor sau exploatează cunoștințele partajate între modele. Clasamentele finale ale testelor private ale Aletheia nu erau încă disponibile în sursă.
Următorul pas cel mai important este testarea înșelăciunii care nu poate fi redusă la o propoziție faptică falsă. Sursa spune că agenții cu orizont lung pot induce în eroare prin omisiune, raportare selectivă, rezumate distorsionate sau obiective ascunse. Aceste cazuri sunt mai greu de etichetat, deoarece este posibil să nu existe o singură propoziție care să poată fi verificată cu un răspuns stabilit.
Cercetătorii ar trebui să examineze, de asemenea, dacă detectorii rămân fiabili în familiile de modele, reglajele fine, sarcinile și stilurile de conversație. EleutherAI raportează că fiecare sondă liniară testată a funcționat bine în unele scenarii, dar a scăzut sub șansa în altele, inversând uneori sistematic relația așteptată dintre scorul său și înșelăciune. Prin urmare, un detector care funcționează bine la un punct de referință poate crea o încredere falsă atunci când este utilizat în afara acelei distribuții.
Mănușul poate ajuta, dar valoarea sa va depinde de replicarea independentă și de dacă seturile de date viitoare conțin credințe cu adevărat ascunse, comportament strategic și traiectorii realiste ale agenților. Sursa nu oferă rezultate din setul de testare privat nelansat, date de implementare din lumea reală, rate de fals pozitive pentru utilizatori sau dovezi că acești detectori identifică înșelăciune intenționată mai degrabă decât eroarea faptică, halucinația sau formularea neobișnuită.
Domeniul va avea nevoie, de asemenea, de o guvernare mai clară în jurul judecătorilor de încredere. Un judecător mai puternic poate detecta semnale mai subtile, dar antrenamentul de model partajat ar putea produce o monocultură algoritmică în care modelele deduce cunoștințele sau obiceiurile reciproce fără a oferi un audit de încredere. EleutherAI propune mai multe sonde granulare și rutarea detectorului, dar sursa le prezintă ca direcții de cercetare viitoare, mai degrabă decât soluții validate.