Înapoi la Știri
ProdusAI Understanding briefing

36Kr raportează că OpenAI a deschis Harnașul Codex pentru aplicații de agenți

36Kr raportează că OpenAI poziționează Codex Harness ca un timp de rulare deschis pentru dezvoltatori care construiesc aplicații de agenți, extinzând Codex dincolo de propria aplicație, instrument de linie de comandă și integrări IDE. Raportul spune că runtime gestionează sesiuni, context, apeluri de instrumente, sandbox și aprobări umane, dar afirmațiile nu au...

6 min readRead the linked source
Source-provided image accompanying 36Kr reports OpenAI opened Codex Harness for agent applications
Referință la sursăSursa înregistrată
Editor
eu.36kr.com
Link sursă
eu.36kr.comhttps://eu.36kr.com/en/p/3952749463895174
Tip sursă
Sursă conectată — starea sursei primare nu a fost stabilită.
ContextÎnțelege asta în 60 de secunde

Începeți de aici

Termeni cheie

AGI (Inteligenta Generala Artificiala)
Un sistem AI ipotetic care poate îndeplini majoritatea sarcinilor intelectuale la nivel uman în multe domenii.
Încorporarea
O reprezentare vectorială numerică care surprinde semnificația semantică a textului, imaginilor sau a altor date.
Jeton
O bucată de text procesată de modele de limbaj, cum ar fi un cuvânt sau un simbol.
Testează-teTest pentru agenții AI

Ce sa întâmplat

36Kr raportează că OpenAI a lansat o postare pentru dezvoltatori pe 20 august în care o descrie pe Codex ca o platformă construită pe un ham de agent deschis. Potrivit raportului, dezvoltatorii pot folosi codex exec, un SDK sau un server de aplicații pentru a încorpora capabilitățile Codex în consolele întreprinderii, sistemele de servicii pentru clienți, instrumentele de securitate și aplicațiile interne. Raportul prezintă acest lucru ca o trecere de la Codex a fi în primul rând un asistent de programare la a servi ca infrastructură de execuție reutilizabilă.

36Kr raportează că postarea pentru dezvoltatori a lui OpenAI din 20 august a prezentat Codex ca o platformă și a descris un cablaj Codex cu sursă deschisă sub extensiile aplicației, CLI și IDE Codex. Raportul spune că cablajul gestionează starea sesiunii, contextul, apelurile de instrumente, casetele de testare și aprobările umane. De asemenea, mai spune că dezvoltatorii pot conecta acele capabilități la produsele existente prin codex exec, un SDK sau un server de aplicații care acceptă fire, turnuri, fluxuri de evenimente și protocoale de aprobare. Niciun document OpenAI primar nu a fost furnizat împreună cu sursa, așa că aceste detalii sunt atribuite 36Kr și nu sunt confirmate în mod independent aici.

Raportul spune că capabilitățile au fost introduse în etape. Descrie disponibilitatea SDK-ului Codex alături de lansarea generală a Codex în octombrie 2025, utilizarea ulterioară a codex exec pentru scripturi și sarcini de integrare continuă și suportul serverului de aplicații pentru sesiuni de lungă durată. De asemenea, se spune că OpenAI a publicat o explicație a buclei de agenți Codex în ianuarie 2026, care acoperă modul în care modelul primește instrucțiuni, apelează instrumente, citește rezultatele și continuă cu pasul următor. Interpretarea centrală a 36Kr este că OpenAI a grupat acum aceste funcții sub numele Codex Harness și încurajează dezvoltatorii să construiască produse în jurul lor.

Potrivit 36Kr, OpenAI a citat mai multe aplicații în propria sa postare pe blog. Raportul spune că Cisco utilizează SDK-ul Codex în App Builder pentru Cisco Cloud Control, în timp ce GitHub și JetBrains integrează Codex în mediile de dezvoltare existente. De asemenea, se spune că Thrive Holdings și Crete folosesc Codex pentru pregătirea impozitelor și că un pilot a gestionat 7.000 de declarații fiscale, reducând în același timp timpul de pregătire cu aproximativ o treime. Aceste exemple și măsurători sunt prezentate de 36Kr ca revendicări de la OpenAI; sursa nu furnizează teste independente, metodologie sau documentație din partea organizațiilor implicate.

Raportul compară Harness Codex cu Harness DeepSeek, despre care spune că DeepSeek este deschis pe 14 august sub abrevierea DSH. 36Kr spune că DSH tratează modelele, instrumentele, abilitățile, sesiunile, sandbox-urile, stocarea, bucla agentului, programarea și interfața cu utilizatorul ca pluginuri gestionate printr-un sistem numit Cordis. Acesta caracterizează Codex ca un timp de rulare mai integrat ale cărui componente non-core trebuie adaptate motorului său, descriind în același timp DSH ca fiind mai modular. Articolul discută, de asemenea, Kimi Code și ZCode ca sisteme de agenți înrudite, dar structurate diferit, mai degrabă decât să le prezinte ca același produs.

Detalii sursa: eu.36kr.com ↗

De ce contează

Schimbarea raportată ar putea acorda OpenAI un rol mai mare în stratul software care determină modul în care agenții AI folosesc instrumentele, păstrează contextul, solicită aprobarea și completează munca în mai mulți pași. Acest strat poate afecta fiabilitatea, costul, observabilitatea și controlul utilizatorului, independent de modelul de bază. Raportul plasează, de asemenea, mișcarea lui OpenAI în competiție cu mai multe runtime de agenți deschise, inclusiv DeepSeek Harness și alte proiecte open-source.

Mișcarea raportată contează deoarece un agent de rulare controlează pașii operaționali dintre rezultatul unui model și o sarcină finalizată. Conform 36Kr, Codex Harness poate menține contextul, apela instrumente, poate executa lucrări în sandbox și poate direcționa acțiunile prin aprobări umane. Pentru organizațiile care încorporează agenți în software-ul intern, acele funcții pot determina dacă un agent este observabil, întreruptibil și compatibil cu permisiunile existente. Raportul nu stabilește că Harness Codex îndeplinește vreun anumit standard de securitate sau de conformitate.

36Kr raportează că OpenAI a prezentat o comparație ARC-AGI-3 în care GPT-5.6 Sol a obținut 13,3% singur și 38,3% cu raționamentul continuu și capabilitățile de comprimare a contextului Codex Harness. Articolul mai spune că volumul jetonului de ieșire a scăzut la aproximativ o șesime din cantitatea inițială. Aceste cifre, dacă sunt reproduse, ar sugera că orchestrarea și gestionarea contextului pot schimba semnificativ performanța și costul aceluiași model. Cu toate acestea, sursa nu furnizează niciun protocol de testare, detalii de referință, replicare independentă sau informații despre semnificația statistică, astfel încât numerele ar trebui tratate ca rezultate raportate de companie, mai degrabă decât dovezi stabilite.

Articolul susține că companiile de modele au stimulente să dețină sau să distribuie timpul de rulare în jurul modelelor lor. 36Kr spune că un timp de execuție poate expune locurile în care sarcinile eșuează, unde apelurile instrumentelor se blochează, cât de des apar reîncercări și care strategii de context consumă mai puține jetoane. Acest lucru ar putea ajuta un dezvoltator de modele să își îmbunătățească atât modelele, cât și sistemul de execuție. Sursa notează, de asemenea, că orice utilizare a înregistrărilor sarcinilor pentru instruire ar depinde de politicile de confidențialitate aplicabile; nu stabilește ce colectează, rețin sau utilizează Codex sau DeepSeek.

Un timp de execuție mai deschis ar putea schimba, de asemenea, echilibrul dintre furnizorii de modele și dezvoltatorii de aplicații. 36Kr spune că arhitectura bazată pe pluginuri a DSH este concepută pentru a permite dezvoltatorilor să înlocuiască modelele, instrumentele, stocarea, casetele de nisip și componentele buclei fără a menține o durată lungă a întregului proiect. Această flexibilitate poate atrage echipele care doresc să schimbe furnizorii sau strategiile de execuție. În același timp, articolul raportează că DSH este încă o previzualizare timpurie și că feedback-ul comunității a ridicat îngrijorări cu privire la viteză, consumul de , documentare, compatibilitate și calitate neuniformă a pluginului. Aceste observații sunt raportate feedback, nu o evaluare sistematică.

Interactive Mechanism

Mecanism interactiv: cum funcționează de fapt

Explorați tehnologia care stau la baza acestei dezvoltări în mod interactiv.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Verificare interactivă a conceptului+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Ce să urmărești în continuare

Cele mai importante întrebări deschise sunt dacă Harness-ul Codex poate fi cu adevărat utilizabil în afara ecosistemului model al lui OpenAI, ce componente pot înlocui dezvoltatorii, cum sunt gestionate datele din fluxurile de lucru încorporate și dacă câștigurile de performanță raportate se mențin în cadrul testării independente. Raportul furnizat nu stabilește disponibilitatea largă, prețurile, termenii contractuali, practicile de confidențialitate sau fiabilitatea producției.

În primul rând, urmăriți dovezi că Harnessul Codex poate funcționa cu modele și instrumente dincolo de stiva preferată a lui OpenAI. 36Kr descrie Codex ca fiind deschis și încorporabil, dar raportul furnizat nu specifică licența, componentele exacte înlocuibile, adaptoarele de model acceptate, opțiunile de implementare sau dacă părțile critice rămân închise. Aceste detalii vor determina dacă dezvoltatorii primesc un timp de rulare portabil sau o integrare OpenAI strâns cuplată.

În al doilea rând, testele independente ar trebui să examineze îmbunătățirea raportată ARC-AGI-3 și reducerea simbolurilor. Verificarea utilă ar include versiunile exacte ale modelului, solicitările, setările cablajului, limitele contextului, configurația instrumentului, gestionarea defecțiunilor și ipotezele de cost. Fără aceste detalii, comparația nu poate arăta dacă câștigul provine dintr-un design de rulare util în general sau dintr-o anumită configurație proprietară.

În al treilea rând, organizațiile care iau în considerare agenți încorporați vor avea nevoie de informații mai clare despre guvernanța și controlul datelor. Raportul descrie codul întreprinderii, datele clienților, instrumentele interne, aprobările și înregistrările sarcinilor care se deplasează printr-un timp de execuție partajat. Nu spune unde sunt procesate acele înregistrări, cât timp sunt păstrate, dacă administratorii le pot audita sau șterge sau dacă pot fi folosite pentru îmbunătățirea modelului. Aceste necunoscute sunt materiale pentru implementări care implică muncă confidențială sau reglementată.

În cele din urmă, urmăriți dacă colecția în creștere de timpi de execuție a agenților devine o piață de infrastructură durabilă sau rămâne un set de instrumente de dezvoltare specifice modelului. 36Kr raportează că DeepSeek Harness a atras atenția semnificativă a dezvoltatorilor timpurii și că Kimi Code și ZCode oferă deja capabilități de execuție aferente. Adoptarea în producție va depinde de stabilitate, mecanisme de rollback, limitele permisiunilor, documentație, predictibilitatea costurilor și revizuirea independentă a securității. Raportul furnizat stabilește interesul și poziționarea produsului, dar nu adoptarea largă a întreprinderii sau superioritatea de încredere.

Ghiduri și chestionare conexe

Agenți AIModelele AI explicatePrompt EngineeringTestați ceea ce știți — încercați un test AI gratuitCăutați un termen AI în glosarul nostruUrmați instrumentul de urmărire a lansării modelului AI
Ai găsit asta util?