Tillbaka till Nyheter
InnovationAI Understanding genomgång

Paper introducerar "Shadow Evaluations": AI-agenter gjorde tekniken men misslyckades med två forskningsfrågor

Ett förtryck med 24 författare fick frontier AI-agenter att försöka de centrala forskningsfrågorna i två opublicerade NeurIPS 2026-inlämningar, och sedan fick tidningarnas egna författare betygsätta resultaten. Agenterna skötte ingenjörsarbetet utan hjälp under sex dagar men avvisades otvetydigt i forskningen.

6 min readRead the primary source
Source-provided image accompanying Paper Introduces "Shadow Evaluations": AI Agents Did the Engineering but Failed Two Research Questions
Primärt källdokumentKälla inspelad
Förläggare
arxiv.org
Källlänk
arxiv.orghttps://arxiv.org/abs/2607.27191
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

Artificiell intelligens (AI)
Det breda fältet för att bygga system som utför uppgifter som kräver mönsterigenkänning, resonemang, språk eller beslutsfattande.
Maskininlärning (ML)
Metoder som gör att system kan lära sig mönster från data och förbättras över tid.
AI-styrning
Policyer, standarder och tillsynsmekanismer som styr hur AI utvecklas och används i samhället.
Testa dig självAI Agents Quiz

Vad hände

Ett förtryck som publicerades på arXiv den 29 juli 2026 och reviderades den 7 augusti föreslår ett nytt sätt att mäta framstegen mot automatiserad AI-forskning: ge en agent den centrala öppna frågan om en högkvalitativ opublicerad tidning och låt den tidningens originalförfattare betygsätta resultatet. I två försök slutförde gränsagenter konstruktionen utan mänsklig hjälp men avvisades av de mänskliga väghyvlarna, och författarna identifierade fem återkommande fellägen.

Ett förtryck på arXiv, inlämnat 29 juli 2026 och reviderat den 7 augusti 2026, frågar om AI-agenter kan bedriva öppen AI-forskning. Den bär 24 listade författare, inklusive Peter Kirgis, Sayash Kapoor, Helen Toner, Gillian Hadfield, Seth Lazar, Rishi Bommasani och Arvind Narayanan, och är arkiverad under artificiell intelligens, datorer och samhälle och maskininlärning. Dess centrala bidrag är en mätmetod som författarna kallar en "skuggutvärdering": en agent får den centrala, öppna forskningsfrågan om en högkvalitativ men opublicerad artikel, och tidningens originalförfattare betygsätter sedan vad agenten producerar.

Författarna placerar detta som ett tredje alternativ mellan två befintliga tillvägagångssätt som de beskriver som otillräckliga. Aktuella agentutvärderingar, skriver de, antingen testar agenter på smala, verifierbara uppgifter - som genom sin konstruktion utesluter öppen forskning - eller skickar in AI-genererade papper för blind peer review, som de karakteriserar som överansträngda, stokastiska och lider av dålig recensionskvalitet. Skuggutvärderingar använder istället de personer som redan känner till problemet, dess litteratur och dess fallgropar som betygsättare, eftersom de har ett opublicerat svar att jämföra med.

Teamet körde metoden på två opublicerade bidrag till NeurIPS 2026. Enligt sammanfattningen fick gränsagenter sex dagar och tusentals dollar i beräkning per försök. Agenterna genomförde all ingenjörskonst utan mänsklig hjälp - koden, experimenten, infrastrukturen - men kunde inte göra några betydande framsteg mot att svara på själva forskningsfrågorna. Båda resulterande artiklarna avvisades, med författarnas ord, otvetydigt av de ursprungliga författarna som agerade som granskare.

Från avskrifterna extraherar författarna fem återkommande misslyckanden: dåligt omdöme om ribban för publicerbar forskning; okreativa svar på brister i forskningsdesignen; ineffektiv backtracking från återvändsgränder; dålig resursmedvetenhet; och instruktionsdrift. De rapporterar att en robusthetskontroll med en andra modell och en andra ställning reproducerade samma fel, vilket talar emot att resultatet är en artefakt av ett visst system eller sele. Teamet säger att det släpper expertrecensioner, enkätsvar, agentförråd och loggar.

Flera saker som abstraktet inte fastställer är värda att uttrycka tydligt. Det nämner inte vilka medel, modeller eller ställningar som användes, inte heller det andra systemet i robusthetskontrollen. Den identifierar inte de två NeurIPS-inlämningarna eller deras underfält, ger en exakt beräkningssiffra bortom "tusentals dollar", beskriver betygskriteriet eller säger om väghyvlarna var blinda för det faktum att de granskade agentens utdata. Verket är ett förtryck; ingenting i källan indikerar att den har genomfört peer review. Och urvalet är två forskningsfrågor, graderade av personerna som ställde dem.

Källinformation: arxiv.org

Varför det spelar roll

Argumenten att AI-framsteg kommer att accelerera kraftigt vilar på premissen att AI-system kan ta över AI-forskningen själv. Detta är ett direkt, om än litet, bevis för att premissen inte håller än, och det skiljer de delar som agenter redan kan göra - implementering - från de delar de inte kan: att bedöma vad som är värt att publicera, omforma en felaktig studie och överge återvändsgränder.

Tidningens inramning går rakt på ett bärande antagande i nuvarande AI-prognoser. Som abstrakt uttrycker det beror prognoser för explosiva AI-framsteg på AI-agenter som automatiserar AI-forskning – slingan där bättre system bygger bättre system. Den slingan hävdas ofta och mäts sällan, eftersom det som automatiseras är exakt den typ av arbete som motstår ett poängskript. En metod som producerar ett graderat omdöme från arbetande forskare på en levande, obesvarad fråga är en mer direkt undersökning av det antagandet än benchmarkpoäng på uppgifter med kända svar.

Resultatet drar en linje genom mitten av jobbet snarare än runt det. Agenter körde flerdagars experimentella program utan uppsikt och producerade fungerande kod och resultat - det är en verklig förmåga och en meningsfull förändring från för några år sedan. Vad de inte gjorde är den del som avgör om forskning är värd att publicera: att inse att ett resultat är tunt, att hitta på en väg runt ett designfel och att veta när en attacklinje är död. För team som bestämmer var de ska placera agenter i en forsknings- eller ingenjörspipeline är den distinktionen mer genomförbar än ett samlat kapacitetspoäng.

Två av de fem fellägena generaliserar långt bortom forskning. Dålig resursmedvetenhet – att bränna en fast beräknings- eller tidsbudget utan att justera – och instruktionsdrift, där en agent gradvis slutar göra vad den ombads, är återkommande problem i alla autonoma driftsättningar med lång horisont, från flerdagars kodningsagenter till operationell automatisering. De sex dagar långa körningarna här är ovanligt långa enligt utvärderingsstandarder, och långa horisonter är just där dessa misslyckanden har utrymme att förvärra innan någon märker det.

Begränsningarna är verkliga och författarna döljer dem inte. Två fallstudier på en plats, utvärderade på en ögonblicksbild av modeller, kan inte stödja ett påstående om vad agenter kommer att kunna göra nästa år. Detta är ett nollresultat med en tidsstämpel. Författarbedömare har också ett uppenbart intresse i frågan de valt att arbeta med, och metoden förbrukar delvis sig själv: när en artikel publiceras kan dess forskningsfråga inte längre fungera som ett osynligt test. Att släppa recensionerna, arkiven och loggarna är det som gör upptäckten kontrollerbar snarare än ett anspråk på förtroende.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Vad du ska titta på härnäst

Huruvida skuggutvärderingar upprepas i större skala med förblindad, förregistrerad gradering; om nyare agenter och byggnadsställningar täpper till gapet när de körs på nytt mot de släppta förråden och loggarna; och om de fem fellägena håller under oberoende granskning och expertgranskning.

Det första du bör titta på är om skuggutvärderingar blir ett repeterbart instrument eller förblir en engångsdemonstration. Det skulle innebära fler papper över fler ställen och underfält, förregistrerade betygskriterier som överenskommits innan agenten körs och gradering förblindad för om resultatet kom från en agent eller en människa. Det skulle också innebära att man tar itu med utbudsproblemet: metoden behöver ett ständigt flöde av högkvalitativt opublicerat arbete vars författare är villiga att lägga rejäla granskningsansträngningar på en agents försök.

Det andra är om gapet stänger och hur snabbt. Eftersom agentlagren och loggarna släpps kan andra grupper köra om nyare modeller och byggnadsställningar mot samma två forskningsfrågor och jämföra direkt. Håll utkik efter huruvida förbättringar dyker upp som bättre ingenjörskonst – vilket agenterna redan gjorde – eller som rörelse på bedömningsfel, vilket är den del som tidningen säger saknas. En repris som ger fler experiment men samma avslag skulle vara en annan signal än en som producerar ett papper som de ursprungliga författarna tar på allvar.

För det tredje, oberoende granskning av de släppta artefakterna. De fem fellägena är författarnas läsning av sina egna avskrifter; andra forskare som läser samma loggar kan kategorisera haverierna på olika sätt, eller upptäcka att vissa misslyckanden spåras till ställningen och uppmaningen snarare än till modellerna. Huruvida förtrycket rensar peer review, och om dess taxonomi överlever kontakt med andra människors utvärderingar, kommer att avgöra hur mycket vikt den kan bära.

Slutligen, upptagande utanför forskarsamhället. Författarlistan inkluderar personer som arbetar direkt med AI-styrning och policy, och tidslinjer för automatiserad AI FoU-inmatning i ramverk för gränssäkerhet, kapacitetströsklar och nationella policydebatter. Se om dessa bevis citeras i dessa miljöer, och om det rapporteras korrekt: tidningen säger att dagens agenter kämpar med kritiska delar av forskningens livscykel, baserat på två fall - inte att de aldrig kan forska, och inte att den tekniska förmågan som visas är trivial.

Relaterade guider och frågesporter

AI-agenterAI:s framtidAI-modeller förklarasTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlista
Hittade du detta användbart?