Ce sa întâmplat
OpenAI a publicat un instantaneu intern al modului în care agenții de codificare sunt utilizați de organizația sa de cercetare. Compania spune că și-a îndeplinit obiectivul declarat de un „stagiar de cercetare automatizat”: un sistem capabil să efectueze sarcini de cercetare bine definite sub conducerea umană, inclusiv sarcini care ar putea dura câteva zile unui cercetător calificat. OpenAI spune că vizează un cercetător automatizat de inteligență artificială până în martie 2028. Conform măsurătorilor companiei, utilizarea agenților a crescut brusc în 2026. Până la jumătatea lunii august, cercetătorul median folosea agenți de codare zilnic la peste 600 USD pe zi în inferență calculate la prețurile API, în timp ce cei 900000 de dolari la sută pe zi. În cadrul organizației de cercetare, OpenAI spune că timpul de rulare a agentului a atins 3,1 zile-lucrătoare standard de opt ore pentru fiecare zi de lucru umană. OpenAI raportează, de asemenea, mai multe experimente pentru fiecare experimentator activ, utilizarea în creștere a agenților pentru sarcini de nivel superior și cu orizont mai lung și, în general, îmbunătățirea ratelor de succes din ianuarie până în iulie la sarcinile cu un rezultat cunoscut. Cu toate acestea, mai mult de jumătate dintre sarcinile de succes estimate a necesita patru până la opt ore de muncă umană au implicat cel puțin o intervenție umană în ultimele șase luni. Raportul le descrie ca fiind propriile măsurători preliminare și impresii interne ale OpenAI. Nu stabilește că agenții au cauzat toate creșterile observate ale rezultatelor cercetării: compania spune că și calculul disponibil a crescut semnificativ și că blocajele precum calculul, selecția sarcinilor, evaluarea, verificările de siguranță și integrarea în cursurile de formare de bază pot limita progresul general.
OpenAI spune că cercetătorii săi folosesc acum agenți de codare pe tot parcursul zilei, adesea în sesiuni simultane, și că utilizarea crește mai rapid decât în alte echipe OpenAI. Compania raportează că cercetătorul median a trecut de la utilizarea modestă la începutul anului 2026 la utilizarea zilnică până la jumătatea lunii august. Oferă estimări de cheltuieli interne de peste 600 USD pe zi în inferență la prețurile API pentru cercetătorul median și mai mult de 7.000 USD pe zi pentru utilizatorul cu percentila 90. Acestea nu sunt prețuri oferite publicului pentru un cercetător automat.
Compania măsoară durata totală de funcționare a agentului în raport cu munca umană folosind zile de lucru standard de opt ore. Se spune că înainte de iunie 2026, durata totală de funcționare a agentului era sub totalul muncii umane, dar până la jumătatea lunii august, organizația de cercetare a folosit 3,1 zile de lucru-agent pentru fiecare zi de lucru umană. Măsurarea include agenți lansați direct de cercetători și subagenți din aval.
OpenAI spune că activitatea agenților s-a extins în șase etape ale taxonomiei sale de cercetare și dezvoltare AI: decizia, proiectarea, construirea, rularea, analizarea și comunicarea. Codul de cercetare și infrastructură a rămas categoria dominantă, în timp ce asistența tehnică și rulările de monitorizare au crescut considerabil. Planificarea la nivel înalt a rămas o mică parte din jetoanele de ieșire ale agenților. OpenAI spune că agenții au fost deosebit de utili pentru depanarea infrastructurii interne de cercetare, ceea ce coincide cu o prezență mai scăzută la unele sesiuni de asistență tehnică conduse de oameni.
Raportul spune că succesul sarcinilor agentului de codificare a crescut în general din ianuarie până în iulie în mai multe intervale estimate de timp uman, dar agenții aveau încă nevoie de o direcție substanțială pe măsură ce sarcinile au devenit mai complexe. Mai mult de jumătate din sarcinile de succes de patru până la opt ore au implicat una sau mai multe intervenții în ultimele șase luni. OpenAI mai spune că a întrerupt instruirea de consolidare-învățare pe unele modele de implementare cele mai recente după un incident recent de infrastructură, a restabilit unele sarcini de lucru sub restricții mai puternice și a impus restricții suplimentare asupra experimentelor de clasă Astra după dovezi preliminare ale capacităților cibernetice critice. Raportează că alocarea GPU-ului pentru clasa Astra a scăzut cu 59,2% în săptămâna următoare, în timp ce alte clase de modele au crescut cu 17,2%, compensând aproximativ 85% din declin.
De ce contează
Raportul oferă o viziune neobișnuit de concretă asupra modului în care un laborator AI de frontieră încorporează sisteme AI în activitatea de dezvoltare a AI mai capabilă. Dacă tendința se generalizează, agenții de codificare ar putea transfera timpul cercetătorilor de la implementarea de rutină și depanarea infrastructurii către sarcini care rămân mai greu de automatizat, scurtând posibil părți ale ciclului de dezvoltare a modelului. Dar dovezile sunt generate de companie, preliminare și se concentrează pe parametri operaționali selectați, mai degrabă decât pe câștiguri verificate independent în calitatea științifică sau capacitatea modelului.
Raportul contează deoarece sistemele AI sunt utilizate în procesul care produce viitoare sisteme AI, mai degrabă decât să asiste doar la munca de rutină de birou. Cifrele lui OpenAI sugerează că capacitatea agentului devine o parte semnificativă a operațiunilor interne de cercetare, cu execuția concomitentă și o complexitate mai mare a sarcinilor schimbând modul în care cercetătorii își alocă timpul.
Implicația practică este mixtă. Agenții pot reduce întârzierile cauzate de codare, depanarea infrastructurii și configurarea experimentelor, permițând cercetătorilor să execute mai multe teste. În același timp, execuția mai rapidă poate face ca evaluarea, monitorizarea și revizuirea siguranței să fie mai importante, deoarece erorile pot fi produse și propagate mai rapid. OpenAI însuși spune că progresul în anumite metrici nu va fi neapărat egal cu același ritm al progresului general al cercetării.
Raportul face, de asemenea, controlul uman o condiție centrală. OpenAI spune că oamenii încă stabilesc priorități, judecă ideile și rezultatele pe care trebuie să le urmărească și decid dacă scala, întrerupe sau implementează sistemele. Recunoaște că progresul în aliniament și siguranță ar putea să nu țină pasul cu progresul capacității și că sistemele mai capabile pot deveni mai greu de monitorizat.
În sursă nu este furnizat niciun studiu independent, public sau audit extern. Prin urmare, cifrele raportate privind cheltuielile, timpul de execuție, succesul sarcinilor și intervenția ar trebui tratate ca afirmații ale OpenAI despre propria organizație, nu ca o dovadă stabilită că cercetarea AI a fost accelerată cu o anumită sumă măsurată.
Mecanism interactiv: cum funcționează de fapt
Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Ce să urmărești în continuare
Întrebarea cheie este dacă utilizarea mai mare a agenților se traduce în îmbunătățiri durabile și măsurabile în mod independent ale calității cercetării, siguranței și vitezei de dezvoltare a modelului. Urmăriți definiții mai clare ale succesului sarcinii, validarea externă, dovezi despre erori și munca umană ascunsă și dacă blocajele rămase se îndreaptă către calcul, evaluare, aliniere sau luare a deciziilor. OpenAI nu a documentat accesul public la aceste fluxuri de lucru interne sau orice preț asociat, iar raportul nu arată că este disponibil un cercetător automatizat de uz general.
OpenAI spune că metodele sale de măsurare sunt încă în evoluție. Dezvăluirile viitoare ar trebui să clarifice modul în care sarcinile sunt eșantionate, cum este verificat succesul, cum sunt gestionate rezultatele incerte și modul în care codul sau experimentele generate de agenți sunt distinse de munca care altfel ar fi fost făcută de oameni.
Cea mai importantă dovadă care lipsește este dacă munca asistată de agent produce rezultate mai bune ale cercetării, nu doar mai multe coduri, experimente sau jetoane. Dovezi utile de urmărire ar include exemple reproductibile, rate de eroare, reluare, experimente eșuate, constatări de siguranță și cantitatea de revizuire umană necesară în fiecare etapă.
Raportul nu precizează că stagiarul de cercetare automatizată este un produs accesibil publicului. De asemenea, nu oferă un preț pentru consumator sau întreprindere, cerințe de implementare, criterii de eligibilitate sau dată de lansare. Prin urmare, accesul și prețul sunt necunoscute.
OpenAI spune că va continua să raporteze progresul către cercetarea automată a AI, protejând în același timp securitatea și informațiile de proprietate. Dezvăluirile sale viitoare vor arăta cât de mult din accelerația raportată poate fi evaluată în mod independent și modul în care restricțiile de cercetare afectează distribuția calculului disponibil.