Tillbaka till Nyheter
InnovationAI Understanding genomgång

OpenAI säger att kodningsagenter nu överstiger mänsklig forskningsinsats i dess laboratorier

OpenAI rapporterar att dess forskare använde 3,1 agentarbetsdagar för varje mänsklig arbetsdag i mitten av augusti, samtidigt som de varnade för att de interna mätvärdena är preliminära och inte direkt mäter den övergripande forskningsutvecklingen.

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
Primärt källdokumentKälla inspelad
Förläggare
openai.com
Källlänk
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
Källtyp
Primärt dokument – ett officiellt meddelande, papper, arkivering eller förstapartssida som vi läser direkt.
SammanhangFörstå detta på 60 sekunder

Börja här

Nyckeltermer

API (Application Programming Interface)
Ett strukturerat sätt för ett mjukvarusystem att skicka förfrågningar till och ta emot svar från ett annat system.
Referenspunkt
Ett standardiserat test eller datauppsättning som används för att mäta och jämföra modellprestanda.
Slutledning
Körtidsfasen där en tränad modell genererar förutsägelser eller utdata.
Testa dig självAI Agents Quiz

Vad hände

OpenAI publicerade en intern ögonblicksbild av hur kodningsagenter används av dess forskningsorganisation. Företaget säger att det har uppfyllt sitt uttalade mål om en "automatiserad forskarpraktikant": ett system som kan utföra väldefinierade forskningsuppgifter under mänsklig ledning, inklusive uppgifter som kan ta en skicklig forskare flera dagar. OpenAI säger att det är inriktat på en automatiserad AI-forskare i mars 2028. Enligt företagets mätningar ökade agentanvändningen kraftigt under 2026. I mitten av augusti använde medianforskaren kodningsagenter dagligen för mer än 600 USD per dag i slutledning beräknat till API-priser, medan 90:e procent användaren översteg 7,00 USD per dag. I hela forskningsorganisationen säger OpenAI att agentens körtid nådde 3,1 standard åtta timmars agentarbetsdagar för varje mänsklig arbetsdag. OpenAI rapporterar också fler experiment per aktiv experimentator, ökande användning av agenter för uppgifter på högre nivå och längre horisont, och generellt förbättrade framgångsfrekvenser från januari till juli för uppgifter med ett känt resultat. Mer än hälften av de framgångsrika uppgifterna som beräknades kräva fyra till åtta timmars mänskligt arbete involverade dock minst en mänsklig intervention under de föregående sex månaderna. Rapporten beskriver dessa som OpenAI:s egna preliminära mätningar och interna intryck. Det fastställs inte att agenter orsakade alla observerade ökningar av forskningsresultat: företaget säger att tillgänglig beräkning också ökade avsevärt och att flaskhalsar som beräkning, uppgiftsval, utvärdering, säkerhetskontroller och integrering i grundläggande utbildningskörningar kan begränsa övergripande framsteg.

OpenAI säger att dess forskare nu använder kodningsagenter under hela dagen, ofta i samtidiga sessioner, och att användningen växer snabbare än i andra OpenAI-team. Företaget rapporterar att medianforskaren gick från blygsam användning i början av 2026 till daglig användning i mitten av augusti. Det ger interna utgifter uppskattningar på mer än $600 per dag i slutledning till API-priser för medianforskaren och mer än $7 000 per dag för 90:e-percentilanvändaren. Dessa är inte priser som erbjuds allmänheten för en automatiserad forskare.

Företaget mäter den totala agentens körtid mot mänskligt arbete med hjälp av standard åtta timmars arbetsdagar. Den säger att före juni 2026 var den totala agentens körtid under den totala mänskliga arbetskraften, men i mitten av augusti använde forskningsorganisationen 3,1 agentarbetsdagar för varje mänsklig arbetsdag. Mätningen inkluderar agenter som lanserats direkt av forskare och nedströms subagenter.

OpenAI säger att agentaktiviteten utökades över sex stadier av dess AI-forsknings- och utvecklingsklassificering: att bestämma, designa, bygga, driva, analysera och kommunicera. Forsknings- och infrastrukturkod förblev den dominerande kategorin, medan teknisk hjälp och övervakningskörningar ökade markant. Planering på hög nivå förblev en liten del av agentutdatatoken. OpenAI säger att agenter har varit särskilt användbara för att felsöka intern forskningsinfrastruktur, vilket sammanfaller med lägre närvaro vid vissa mänskliga tekniska supportsessioner.

Rapporten säger att framgången för kodningsagentuppdrag i allmänhet ökade från januari till juli över flera beräknade människotid hinkar, men agenter behövde fortfarande betydande styrning eftersom uppgifterna blev mer komplexa. Mer än hälften av framgångsrika fyra till åtta timmar långa uppgifter involverade en eller flera interventioner under de föregående sex månaderna. OpenAI säger också att den pausade förstärkningsinlärningsträning på några senaste implementeringsmodeller efter en nyligen inträffad infrastrukturincident, återställde vissa arbetsbelastningar under starkare restriktioner och införde ytterligare restriktioner för Astra-klassexperiment efter preliminära bevis på kritiska cyberfunktioner. Den rapporterar att Astra-klassens GPU-allokering sjönk med 59,2 % den följande veckan medan andra modellklasser steg 17,2 %, vilket kompenserade för cirka 85 % av nedgången.

Källinformation: openai.com ↗

Varför det spelar roll

Rapporten ger en ovanligt konkret bild av hur ett gränssnitt för AI-labb införlivar AI-system i arbetet med att utveckla mer kapabel AI. Om trenden generaliserar kan kodningsagenter flytta forskarnas tid bort från rutinmässig implementering och felsökning av infrastruktur mot uppgifter som fortfarande är svårare att automatisera, vilket potentiellt förkortar delar av modellutvecklingscykeln. Men bevisen är företagsgenererade, preliminära och fokuserade på utvalda operationella mätvärden snarare än oberoende verifierade vinster i vetenskaplig kvalitet eller modellkapacitet.

Rapporten är viktig eftersom AI-systemen används i processen som producerar framtida AI-system, snarare än att bara hjälpa till med rutinmässigt kontorsarbete. OpenAI:s siffror tyder på att agentkapacitet håller på att bli en meningsfull del av den interna forskningsverksamheten, med samtidig utförande och högre uppgiftskomplexitet som förändrar hur forskare allokerar sin tid.

Den praktiska innebörden är blandad. Agenter kan minska förseningar orsakade av kodning, infrastrukturfelsökning och experimentinställning, vilket gör att forskare kan köra fler försök. Samtidigt kan snabbare utförande göra utvärdering, övervakning och säkerhetsgranskning viktigare eftersom fel kan produceras och spridas snabbare. OpenAI själv säger att framsteg inom specifika mätvärden inte nödvändigtvis kommer att vara lika med samma takt i övergripande forskningsframsteg.

Rapporten gör också mänsklig kontroll till ett centralt villkor. OpenAI säger att människor fortfarande sätter prioriteringar, bedömer vilka idéer och resultat de ska gå efter och beslutar om de ska skala, pausa eller distribuera system. Den erkänner att anpassning och säkerhetsframsteg kanske inte håller jämna steg med förmågans framsteg och att mer kapabla system kan bli svårare att övervaka.

Ingen oberoende studie, offentlig riktmärke eller extern revision tillhandahålls i källan. De rapporterade utgifterna, körtiden, uppgiftens framgång och interventionssiffrorna bör därför behandlas som OpenAIs påståenden om sin egen organisation, inte som etablerade bevis för att AI-forskning har accelererats med en specifik uppmätta mängd.

Interactive Mechanism

Interaktiv mekanism: hur det faktiskt fungerar

Utforska den underliggande tekniken bakom denna utveckling interaktivt.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktiv konceptkontroll+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Vad du ska titta på härnäst

Nyckelfrågan är om högre agentanvändning leder till hållbara, oberoende mätbara förbättringar av forskningskvalitet, säkerhet och modellutvecklingshastighet. Se efter tydligare definitioner av uppgiftens framgång, extern validering, bevis om fel och dolt mänskligt arbete, och om de återstående flaskhalsarna går mot beräkning, utvärdering, anpassning eller beslutsfattande. OpenAI har inte dokumenterat allmänhetens tillgång till dessa interna arbetsflöden eller något associerat pris, och rapporten visar inte att en automatiserad forskare för allmänna ändamål är tillgänglig.

OpenAI säger att dess mätmetoder fortfarande utvecklas. Framtida avslöjanden bör klargöra hur uppgifter samplas, hur framgång verifieras, hur osäkra resultat hanteras och hur agentgenererad kod eller experiment särskiljs från arbete som annars skulle ha utförts av människor.

Det viktigaste saknade beviset är om agentassisterat arbete ger bättre forskningsresultat, inte bara mer kod, experiment eller tokens. Användbara uppföljningsbevis skulle innefatta reproducerbara exempel, felfrekvenser, omarbetning, misslyckade experiment, säkerhetsresultat och mängden mänsklig granskning som krävs i varje steg.

Rapporten anger inte att den automatiserade forskarpraktikanten är en allmänt tillgänglig produkt. Det ger inte heller något konsument- eller företagspris, implementeringskrav, behörighetskriterier eller releasedatum. Tillgång och prissättning är därför okända.

OpenAI säger att de kommer att fortsätta rapportera framsteg mot automatiserad AI-forskning samtidigt som det skyddar säkerhet och proprietär information. Dess framtida avslöjanden kommer att visa hur mycket av den rapporterade accelerationen som kan bedömas oberoende och hur forskningsrestriktioner påverkar fördelningen av tillgänglig beräkning.

Relaterade guider och frågesporter

AI-agenterAI utbildningAI-modeller förklarasAI:s framtidTesta vad du vet – prova ett gratis AI-quizSlå upp en AI-term i vår ordlistaFölj AI-modellens release tracker
Hittade du detta användbart?