Vad hände
MarkTechPost rapporterar att forskare från Meta FAIR, University of Oxford och University College London introducerade AI Research Preference Models, eller RPM, för att välja vilka experiment en AI-forskningsagent ska köra. I den rapporterade AIRS-Bench-utvärderingen förbättrade RPM genomsnittliga normaliserade poäng och nådde baslinjen för slumpmässigt urval på ungefär 15 timmar istället för 24.
MarkTechPost rapporterar att RPM:er rangordnar ej genomförda kandidatexperiment snarare än att förutsäga deras absoluta poäng. Det rapporterade systemet använder en evolutionär trädsökningsställning som kallas AIRA-dojo. En agent genererar 15 kandidatbarn parallellt, jämför dem parvis i en knockout-turnering och avrättar endast vinnaren. Jämförelserna använder tidigare utforskade kontextnoder och deras valideringspoäng.
Artikeln beskriver två varianter. RPM-en som endast kan slutföras bedömer kandidatplaner, kod och sökhistorik med en frusen förtränad språkmodell. Den agentiska RPM kör dessutom små pilotexperiment i en klonad miljö som innehåller en H200 GPU, med Python, bash och ett inlämningsverktyg. MarkTechPost rapporterar att agentväljaren endast användes för utkast- och förbättringssteg, medan felsökningsvalet återgick till slumpmässigt eftersom piloter förbrukade agentens tidsbudget.
På AIRS-Bench, som MarkTechPost beskriver som innehållande 20 offentliga text- och tabelluppgifter, var de rapporterade genomsnittliga normaliserade poängen 0,684 för slumpmässigt urval, 0,711 för endast slutledningshastigheten och 0,729 för den agentiska RPM. Installationen använde enligt uppgift Qwen3.6-27B för både experimentoperatörerna och RPM, med 10 frön och 24 timmar på en H200 per uppgift.
MarkTechPost rapporterar att båda RPM-varianterna nådde baslinjen för slumpmässigt urval på cirka 15 timmar: 14,88 timmar för endast slutledning och 15,50 timmar för agenturval. Artikeln rapporterar också resultat på 94,1 % på WinoGrande och 95,7 % på SVAMP, och beskriver dem som nya toppmoderna resultat. Dessa siffror och jämförelser är påståenden i den tillhandahållna rapporten, inte oberoende bekräftade resultat.
Artikeln säger att AIRA-dojo-ställningen och AIRS-Bench är öppen källkod och att Qwen3.6-27B är tillgänglig som öppna vikter. Den tillhandahåller ingen direkt åtkomstlänk, licensvillkor, värdtjänst, kommersiell supportinformation eller prissättning. Det levererade materialet visar inte heller att systemet är redo för allmän produktionsanvändning.
Källinformation: marktechpost.com ↗
Varför det spelar roll
Om de rapporterade resultaten håller kan valet av experiment innan exekvering göra AI-assisterad forskning mer beräkningseffektiv. Tillvägagångssättet tar itu med en praktisk flaskhals: forskningsagenter kan generera många kandidatexperiment, men att testa var och en är dyrt. Bevisen förblir begränsad till det rapporterade riktmärket och har inte bekräftats oberoende i det tillhandahållna materialet.
Det rapporterade arbetet riktar sig mot ett resursallokeringsproblem i AI-forskning snarare än att bara förbättra en modells benchmarkpoäng. En agent som kan generera fler idéer än vad ett team har råd att testa behöver ett tillförlitligt sätt att avgöra vilka experiment som förtjänar beräkning. Ett urvalsskikt kan därför påverka forskningsgenomströmningen, särskilt där utbildnings- eller utvärderingskörningar tar timmar eller dagar.
Den rapporterade jämförelsen tyder på att en viss fördel kom från att välja bland kandidater, eftersom samma Qwen3.6-27B-ryggrad användes för experimentoperatörerna och RPM:erna. MarkTechPost rapporterar en relativ ökning på 6,0 % från 0,684 till 0,711 för urval med endast slutledning och en ökning på 6,6 % till 0,729 för agenturval, men den medföljande artikeln ger inte tillräckligt med metodiska detaljer för att bedöma statistisk robusthet utöver dess angivna konfidensintervall.
Det finns meningsfulla gränser. AIRS-Bench täcker 20 offentliga text- och tabelluppgifter, och experimenten använde en enda H200-inställning, så resultaten kanske inte överförs till större forskningsprogram, annan hårdvara eller vetenskapliga domäner. Rapporten ger ingen oberoende replikering, implementeringsfallstudie eller bevis för att metoden förbättrar verkliga upptäckter snarare än benchmarkresultat.
Interaktiv mekanism: hur det faktiskt fungerar
Utforska den underliggande tekniken bakom denna utveckling interaktivt.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Vad du ska titta på härnäst
Håll utkik efter de underliggande artefakterna på papper, kod och ; replikering på ytterligare uppgifter; och bevis om huruvida vinsterna kvarstår med olika modeller, operatörer, hårdvara och forskningsdomäner. Åtkomst till de rapporterade komponenterna med öppen källkod beskrivs, men prissättning, värdtillgänglighet och produktionsstöd är inte dokumenterade.
Den mest användbara nästa kontrollen är om forskarna publicerar de underliggande dokumenten, implementerings- och utvärderingsloggarna och om externa team återskapar de rapporterade poängen och tidsbesparingarna. Den medföljande rapporten pekar på komponenter med öppen källkod men verifierar inte oberoende deras tillgänglighet eller användbarhet.
Framtida utvärderingar bör testa olika ryggradsmodeller, metoder för kandidatgenerering, uppgiftsfamiljer och beräkna budgetar. Den rapporterade agentdesignen använder också korta pilotexperiment och en medvetet överskattad återstående budget, val som kan påverka resultaten och förtjänar testning under ordinarie resursredovisning.
Potentiella användare bör behandla de rapporterade verktygen som forskningskomponenter, inte som en dokumenterad kommersiell produkt. Källan anger inget pris, servicenivåvillkor, installationskrav eller allmän tillgänglighetsangivelse. Den visar inte heller om RPM:er säkert kan hantera experiment vars misslyckanden är kostsamma eller vars valideringsmått är opålitliga.
De rapporterade WinoGrande- och SVAMP-resultaten motiverar verifiering mot de citerade tidigare baslinjerna. Artikeln tillhandahåller inte oberoende tester, detaljerade statistiska uppdelningar eller tillräckligt med information för att avgöra hur brett dessa vinster generaliserar.