Wat is er gebeurd
OpenAI heeft een interne momentopname gepubliceerd van hoe codeermiddelen door de onderzoeksorganisatie worden gebruikt. Het bedrijf zegt dat het zijn gestelde doel van een ‘geautomatiseerde onderzoeksstagiaire’ heeft bereikt: een systeem dat in staat is om onder menselijke leiding goed gedefinieerde onderzoekstaken uit te voeren, inclusief taken die een ervaren onderzoeker meerdere dagen kunnen kosten. OpenAI zegt dat het zich in maart 2028 richt op een geautomatiseerde AI-onderzoeker. Volgens metingen van het bedrijf is het gebruik van agenten in 2026 sterk toegenomen. Medio augustus gebruikte de gemiddelde onderzoeker dagelijks codeeragenten voor meer dan $600 per dag, berekend op basis van API-prijzen, terwijl de gebruiker met het 90e percentiel meer dan $7.000 per dag bedroeg. Binnen de onderzoeksorganisatie zegt OpenAI dat de runtime van agenten 3,1 standaard achturige agent-werkdagen bereikte voor elke menselijke werkdag. OpenAI rapporteert ook meer experimenten per actieve onderzoeker, een groeiend gebruik van agenten voor taken op een hoger niveau en met een langere horizon, en over het algemeen betere succespercentages van januari tot en met juli voor taken met een bekende uitkomst. Bij meer dan de helft van de succesvolle taken die naar schatting vier tot acht uur menselijk werk vergen, was in de afgelopen zes maanden ten minste één menselijke tussenkomst betrokken. Het rapport beschrijft deze als OpenAI’s eigen voorlopige metingen en interne indrukken. Het stelt niet vast dat agenten alle waargenomen stijgingen in de onderzoeksoutput hebben veroorzaakt: het bedrijf zegt dat de beschikbare rekenkracht ook aanzienlijk is toegenomen, en dat knelpunten zoals rekenkracht, taakselectie, evaluatie, veiligheidscontroles en integratie in kerntrainingen de algehele voortgang kunnen beperken.
OpenAI zegt dat zijn onderzoekers nu de hele dag codeeragenten gebruiken, vaak in gelijktijdige sessies, en dat het gebruik sneller groeit dan in andere OpenAI-teams. Het bedrijf meldt dat de gemiddelde onderzoeker van bescheiden gebruik begin 2026 overging naar dagelijks gebruik medio augustus. Het geeft interne uitgavenschattingen van meer dan $600 per dag als gevolgtrekking bij API-prijzen voor de gemiddelde onderzoeker en meer dan $7000 per dag voor de gebruiker in het 90e percentiel. Dit zijn geen prijzen die aan het publiek worden aangeboden voor een geautomatiseerde onderzoeker.
Het bedrijf meet de totale looptijd van agenten ten opzichte van menselijke arbeid op basis van standaardwerkdagen van acht uur. Er staat dat vóór juni 2026 de totale looptijd van agenten lager was dan de totale menselijke arbeid, maar medio augustus gebruikte de onderzoeksorganisatie 3,1 agent-werkdagen voor elke menselijke werkdag. De meting omvat agenten die rechtstreeks door onderzoekers en downstream-subagenten zijn gelanceerd.
OpenAI zegt dat de activiteit van agenten zich heeft uitgebreid over zes fasen van de AI-onderzoeks- en ontwikkelingstaxonomie: beslissen, ontwerpen, bouwen, uitvoeren, analyseren en communiceren. Onderzoeks- en infrastructuurcodes bleven de dominante categorie, terwijl de technische hulp en het toezicht aanzienlijk toenamen. Planning op hoog niveau bleef een klein deel van de uitvoertokens van agenten. OpenAI zegt dat agenten bijzonder nuttig zijn geweest bij het oplossen van problemen met de interne onderzoeksinfrastructuur, wat samenviel met een lagere opkomst bij sommige door mensen gerunde technische ondersteuningssessies.
Het rapport zegt dat het succes van de taken van codeeragenten over het algemeen tussen januari en juli is toegenomen over verschillende geschatte menselijke tijdsperioden, maar dat agenten nog steeds substantiële sturing nodig hadden naarmate de taken complexer werden. Bij ruim de helft van de succesvolle taken van vier tot acht uur waren een of meer interventies in de voorgaande zes maanden betrokken. OpenAI zegt ook dat het de training voor het leren van versterking van enkele nieuwste implementatiemodellen heeft onderbroken na een recent infrastructuurincident, een aantal werklasten onder strengere beperkingen heeft hersteld en aanvullende beperkingen heeft opgelegd aan experimenten van de Astra-klasse na voorlopig bewijs van kritische cybercapaciteiten. Het meldt dat de GPU-toewijzing van de Astra-klasse de week daarop met 59,2% daalde, terwijl andere modelklassen met 17,2% stegen, wat ongeveer 85% van de daling compenseerde.
Waarom het ertoe doet
Het rapport biedt een ongewoon concreet beeld van de manier waarop een grensverleggend AI-lab AI-systemen integreert in de ontwikkeling van meer capabele AI. Als de trend zich veralgemeent, zouden codeeragenten de tijd van onderzoekers kunnen verschuiven van routinematige implementatie en het oplossen van problemen met de infrastructuur naar taken die moeilijker te automatiseren blijven, waardoor delen van de modelontwikkelingscyclus mogelijk worden verkort. Maar het bewijsmateriaal is door het bedrijf gegenereerd, voorlopig en gericht op geselecteerde operationele maatstaven in plaats van op onafhankelijk geverifieerde winsten in wetenschappelijke kwaliteit of modelcapaciteiten.
Het rapport is van belang omdat de AI-systemen worden gebruikt bij het proces dat toekomstige AI-systemen voortbrengt, en niet alleen maar assisteren bij routinematig kantoorwerk. De cijfers van OpenAI suggereren dat de capaciteit van agenten een betekenisvol onderdeel aan het worden is van interne onderzoeksactiviteiten, waarbij gelijktijdige uitvoering en een hogere taakcomplexiteit de manier veranderen waarop onderzoekers hun tijd verdelen.
De praktische implicaties zijn gemengd. Agents kunnen vertragingen verminderen die worden veroorzaakt door codering, foutopsporing in de infrastructuur en het opzetten van experimenten, waardoor onderzoekers meer tests kunnen uitvoeren. Tegelijkertijd kan een snellere uitvoering evaluatie, monitoring en veiligheidsbeoordeling belangrijker maken, omdat fouten sneller kunnen worden geproduceerd en verspreid. OpenAI zelf zegt dat de vooruitgang op specifieke maatstaven niet noodzakelijkerwijs hetzelfde tempo zal hebben als de algehele onderzoeksvooruitgang.
Het rapport maakt ook menselijke controle tot een centrale voorwaarde. OpenAI zegt dat mensen nog steeds prioriteiten stellen, beoordelen welke ideeën en resultaten ze nastreven en beslissen of ze systemen willen schalen, pauzeren of inzetten. Het erkent dat de vooruitgang op het gebied van de afstemming en de veiligheid mogelijk geen gelijke tred houdt met de vooruitgang op het gebied van de capaciteiten, en dat meer capabele systemen moeilijker te monitoren kunnen worden.
Er wordt geen onafhankelijk onderzoek, openbare of externe audit in de bron geleverd. De gerapporteerde cijfers over uitgaven, looptijd, taaksucces en interventies moeten daarom worden behandeld als de beweringen van OpenAI over de eigen organisatie, en niet als bewezen bewijs dat AI-onderzoek met een specifiek gemeten bedrag is versneld.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Wat je nu moet bekijken
De hamvraag is of een hoger agentgebruik zich vertaalt in duurzame, onafhankelijk meetbare verbeteringen in de onderzoekskwaliteit, veiligheid en snelheid van modelontwikkeling. Let op duidelijkere definities van taaksucces, externe validatie, bewijsmateriaal over fouten en verborgen menselijke arbeid, en of de resterende knelpunten zich verplaatsen in de richting van computergebruik, evaluatie, afstemming of besluitvorming. OpenAI heeft de publieke toegang tot deze interne workflows of de bijbehorende kosten niet gedocumenteerd, en uit het rapport blijkt niet dat er een geautomatiseerde onderzoeker voor algemene doeleinden beschikbaar is.
OpenAI zegt dat de meetmethoden nog steeds in ontwikkeling zijn. Toekomstige onthullingen moeten duidelijk maken hoe taken worden bemonsterd, hoe succes wordt geverifieerd, hoe met onzekere uitkomsten wordt omgegaan en hoe door agenten gegenereerde code of experimenten worden onderscheiden van werk dat anders door mensen zou zijn gedaan.
Het belangrijkste ontbrekende bewijs is of agent-ondersteund werk betere onderzoeksresultaten oplevert, en niet alleen maar meer code, experimenten of tokens. Nuttig vervolgbewijs zou reproduceerbare voorbeelden, foutenpercentages, herwerking, mislukte experimenten, veiligheidsbevindingen en de hoeveelheid menselijke beoordeling die in elke fase nodig is, omvatten.
In het rapport staat niet dat de geautomatiseerde onderzoeksstagiair een publiek toegankelijk product is. Het biedt ook geen consumenten- of bedrijfsprijs, implementatievereisten, geschiktheidscriteria of releasedatum. Toegang en prijzen zijn daarom onbekend.
OpenAI zegt dat het de voortgang in de richting van geautomatiseerd AI-onderzoek zal blijven rapporteren en tegelijkertijd de beveiliging en bedrijfseigen informatie zal beschermen. De toekomstige onthullingen zullen aantonen hoeveel van de gerapporteerde versnelling onafhankelijk kan worden beoordeeld en hoe onderzoeksbeperkingen de distributie van beschikbare rekenkracht beïnvloeden.