Hva skjedde
OpenAI publiserte et internt øyeblikksbilde av hvordan kodingsagenter brukes av forskningsorganisasjonen. Selskapet sier at det har nådd sitt uttalte mål om en "automatisert forskerpraktikant": et system som er i stand til å utføre veldefinerte forskningsoppgaver under menneskelig ledelse, inkludert oppgaver som kan ta en dyktig forsker flere dager. OpenAI sier at det er rettet mot en automatisert AI-forsker innen mars 2028. I følge selskapets målinger økte agentbruken kraftig i løpet av 2026. I midten av august brukte medianforskeren kodingsagenter daglig til mer enn $600 per dag i slutninger beregnet til API-priser, mens 90 prosent bruker oversteg $7,0 prosent. På tvers av forskningsorganisasjonen sier OpenAI at agentens kjøretid nådde 3.1 standard åtte-timers agent-arbeidsdager for hver menneskelig arbeidsdag. OpenAI rapporterer også flere eksperimenter per aktiv eksperimentator, økende bruk av agenter for oppgaver på høyere nivå og lengre horisont, og generelt forbedrede suksessrater fra januar til juli på oppgaver med kjent utfall. Imidlertid involverte mer enn halvparten av vellykkede oppgaver å kreve fire til åtte timer med menneskelig arbeid minst én menneskelig intervensjon i løpet av de foregående seks månedene. Rapporten beskriver disse som OpenAI sine egne foreløpige målinger og interne inntrykk. Det fastslår ikke at agenter forårsaket alle observerte økninger i forskningsresultater: selskapet sier at tilgjengelig databehandling også vokste betydelig, og at flaskehalser som databehandling, oppgavevalg, evaluering, sikkerhetssjekker og integrering i kjernetreningskjøringer kan begrense den generelle fremgangen.
OpenAI sier at forskerne deres nå bruker kodeagenter i løpet av dagen, ofte i samtidige økter, og at bruken vokser raskere enn i andre OpenAI-team. Selskapet rapporterer at medianforskeren gikk fra beskjeden bruk ved inngangen til 2026 til daglig bruk i midten av august. Det gir interne utgiftsestimater på mer enn $600 per dag i slutning til API-priser for medianforskeren og mer enn $7000 per dag for 90-persentilbrukeren. Dette er ikke priser som tilbys offentligheten for en automatisert forsker.
Selskapet måler total agentdriftstid mot menneskelig arbeidskraft ved å bruke standard åtte timers arbeidsdager. Den sier at før juni 2026 var total agentdriftstid under total menneskelig arbeidskraft, men i midten av august brukte forskningsorganisasjonen 3,1 agentarbeidsdager for hver menneskelig arbeidsdag. Målingen inkluderer agenter lansert direkte av forskere og nedstrøms subagenter.
OpenAI sier at agentaktiviteten utvidet seg over seks stadier av AI-forsknings- og utviklingstaksonomien: å bestemme, designe, bygge, kjøre, analysere og kommunisere. Forsknings- og infrastrukturkode forble den dominerende kategorien, mens teknisk hjelp og overvåkingskjøringer vokste betydelig. Planlegging på høyt nivå forble en liten brøkdel av agentutdata-tokens. OpenAI sier at agenter har vært spesielt nyttige for feilsøking av intern forskningsinfrastruktur, sammenfallende med lavere oppmøte på noen menneskestyrte teknisk støtteøkter.
Rapporten sier at suksessen med kodeagentoppgaver generelt økte fra januar til juli over flere estimerte menneskelige tidsspann, men agenter trengte fortsatt betydelig styring ettersom oppgavene ble mer komplekse. Mer enn halvparten av vellykkede oppgaver på fire til åtte timer involverte en eller flere intervensjoner i løpet av de foregående seks månedene. OpenAI sier også at den har stoppet forsterkningstrening på noen siste utrullingsmodeller etter en nylig infrastrukturhendelse, gjenopprettet noen arbeidsbelastninger under sterkere restriksjoner, og pålagt ytterligere restriksjoner på eksperimenter i Astra-klassen etter foreløpige bevis på kritiske cyberegenskaper. Den rapporterer at Astra-klassens GPU-allokering falt 59,2 % den påfølgende uken, mens andre modellklasser steg med 17,2 %, og oppveide omtrent 85 % av nedgangen.
Hvorfor det betyr noe
Rapporten gir et uvanlig konkret syn på hvordan et frontier AI-laboratorium inkorporerer AI-systemer i arbeidet med å utvikle mer kapabel AI. Hvis trenden generaliserer, kan kodingsagenter flytte forskernes tid bort fra rutinemessig implementering og feilsøking av infrastruktur mot oppgaver som fortsatt er vanskeligere å automatisere, og potensielt forkorte deler av modellutviklingssyklusen. Men bevisene er bedriftsgenerert, foreløpig og fokusert på utvalgte operasjonelle beregninger i stedet for uavhengig bekreftede gevinster i vitenskapelig kvalitet eller modellkapasitet.
Rapporten er viktig fordi AI-systemene brukes i prosessen som produserer fremtidige AI-systemer, i stedet for bare å hjelpe til med rutinemessig kontorarbeid. OpenAIs tall tyder på at agentkapasitet er i ferd med å bli en meningsfull del av interne forskningsoperasjoner, med samtidig utførelse og høyere oppgavekompleksitet som endrer hvordan forskere allokerer tiden sin.
Den praktiske implikasjonen er blandet. Agenter kan redusere forsinkelser forårsaket av koding, infrastrukturfeilsøking og eksperimentoppsett, slik at forskere kan kjøre flere forsøk. Samtidig kan raskere utførelse gjøre evaluering, overvåking og sikkerhetsgjennomgang viktigere fordi feil kan produseres og spres raskere. OpenAI selv sier at fremgang i spesifikke beregninger ikke nødvendigvis vil ha samme tempo i den generelle forskningsfremgangen.
Rapporten gjør også menneskelig kontroll til en sentral betingelse. OpenAI sier at folk fortsatt setter prioriteringer, vurderer hvilke ideer og resultater de skal forfølge, og bestemmer om de skal skalere, pause eller distribuere systemer. Den erkjenner at innretting og sikkerhetsfremgang kanskje ikke holder tritt med kapasitetsfremgangen og at mer dyktige systemer kan bli vanskeligere å overvåke.
Ingen uavhengig studie, offentlig referanseindeks eller ekstern revisjon er levert i kilden. De rapporterte tallene for forbruk, kjøretid, oppgavesuksess og intervensjon bør derfor behandles som OpenAIs påstander om sin egen organisasjon, ikke som etablert bevis på at AI-forskning har blitt fremskyndet med et spesifikt målt beløp.
Interaktiv mekanisme: Hvordan det faktisk fungerer
Utforsk den underliggende teknologien bak denne utviklingen interaktivt.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Hva du skal se neste
Nøkkelspørsmålet er om høyere agentbruk oversetter til varige, uavhengig målbare forbedringer i forskningskvalitet, sikkerhet og modellutviklingshastighet. Se etter klarere definisjoner av oppgavesuksess, ekstern validering, bevis om feil og skjult menneskelig arbeid, og om de gjenværende flaskehalsene beveger seg mot beregning, evaluering, justering eller beslutningstaking. OpenAI har ikke dokumentert offentlig tilgang til disse interne arbeidsflytene eller tilhørende pris, og rapporten viser ikke at en generell automatisert forsker er tilgjengelig.
OpenAI sier at målemetodene deres fortsatt er under utvikling. Fremtidige avsløringer bør avklare hvordan oppgaver er samplet, hvordan suksess verifiseres, hvordan usikre utfall håndteres, og hvordan agentgenerert kode eller eksperimenter skilles fra arbeid som ellers ville blitt utført av mennesker.
Det viktigste manglende beviset er om agentassistert arbeid gir bedre forskningsresultater, ikke bare mer kode, eksperimenter eller tokens. Nyttig oppfølgingsbevis vil inkludere reproduserbare eksempler, feilrater, omarbeid, mislykkede eksperimenter, sikkerhetsfunn og mengden menneskelig vurdering som kreves på hvert trinn.
Rapporten sier ikke at den automatiserte forskerpraktikanten er et offentlig tilgjengelig produkt. Den gir heller ikke en forbruker- eller bedriftspris, implementeringskrav, kvalifikasjonskriterier eller utgivelsesdato. Tilgang og pris er derfor ukjent.
OpenAI sier at den vil fortsette å rapportere fremgang mot automatisert AI-forskning samtidig som den beskytter sikkerhet og proprietær informasjon. Dens fremtidige avsløringer vil vise hvor mye av den rapporterte akselerasjonen som kan vurderes uavhengig og hvordan forskningsrestriksjoner påvirker fordelingen av tilgjengelig databehandling.