Wat is er gebeurd
36Kr meldt dat OpenAI op 20 augustus een ontwikkelaarspost heeft uitgebracht waarin Codex wordt beschreven als een platform gebouwd op een open agentharnas. Volgens het rapport kunnen ontwikkelaars codex exec, een SDK of een app-server gebruiken om Codex-mogelijkheden in bedrijfsconsoles, klantenservicesystemen, beveiligingstools en interne applicaties in te bedden. Het rapport presenteert dit als een verschuiving van Codex als programmeerassistent naar een herbruikbare uitvoeringsinfrastructuur.
36Kr meldt dat OpenAI in de ontwikkelaarspost van 20 augustus Codex als een platform presenteerde en een open-source Codex-harnas beschreef onder de Codex app-, CLI- en IDE-extensies. Het rapport zegt dat het harnas de sessiestatus, context, tooloproepen, sandboxes en menselijke goedkeuringen beheert. Er staat ook dat ontwikkelaars deze mogelijkheden kunnen verbinden met bestaande producten via codex exec, een SDK of een app-server die threads, bochten, gebeurtenisstromen en goedkeuringsprotocollen ondersteunt. Er is geen primair OpenAI-document bij de bron geleverd, dus deze details worden toegeschreven aan 36Kr en worden hier niet onafhankelijk bevestigd.
Volgens het rapport zijn de mogelijkheden in fasen geïntroduceerd. Het beschrijft de beschikbaarheid van de Codex SDK naast de algemene release van Codex in oktober 2025, het latere gebruik van codex exec voor scripts en continue integratietaken, en de ondersteuning van de app-server voor langer lopende sessies. Er staat ook dat OpenAI in januari 2026 een uitleg van de Codex-agentlus heeft gepubliceerd, waarin wordt beschreven hoe het model instructies ontvangt, tools aanroept, resultaten leest en doorgaat naar de volgende stap. De centrale interpretatie van 36Kr is dat OpenAI deze functies nu heeft gegroepeerd onder de naam Codex Harness en ontwikkelaars aanmoedigt om er producten omheen te bouwen.
Volgens 36Kr citeerde OpenAI verschillende toepassingen in zijn eigen blogpost. Volgens het rapport gebruikt Cisco de Codex SDK in App Builder voor Cisco Cloud Control, terwijl GitHub en JetBrains Codex integreren in bestaande ontwikkelomgevingen. Het zegt ook dat Thrive Holdings en Kreta Codex gebruiken voor belastingvoorbereiding en dat één piloot 7.000 belastingaangiften heeft afgehandeld, terwijl de voorbereidingstijd met ongeveer een derde werd verkort. Deze voorbeelden en metingen worden door 36Kr gepresenteerd als claims van OpenAI; de bron biedt geen onafhankelijke tests, methodologie of documentatie van de betrokken organisaties.
Het rapport vergelijkt het Codex-harnas met het DeepSeek-harnas, waarvan DeepSeek op 14 augustus open-source staat onder de afkorting DSH. 36Kr zegt dat DSH modellen, tools, vaardigheden, sessies, sandboxes, opslag, de agentloop, planning en de gebruikersinterface behandelt als plug-ins die worden beheerd via een systeem genaamd Cordis. Het karakteriseert Codex als een meer geïntegreerde runtime waarvan de niet-kerncomponenten moeten worden aangepast aan de motor, terwijl DSH als meer modulair wordt beschreven. Het artikel bespreekt ook Kimi Code en ZCode als gerelateerde maar verschillend gestructureerde agentsystemen, in plaats van ze als hetzelfde product te presenteren.
Waarom het ertoe doet
De gerapporteerde verandering zou OpenAI een grotere rol kunnen geven in de softwarelaag die bepaalt hoe AI-agenten tools gebruiken, context behouden, goedkeuring vragen en werk in meerdere stappen voltooien. Die laag kan onafhankelijk van het onderliggende model de betrouwbaarheid, kosten, waarneembaarheid en gebruikerscontrole beïnvloeden. Het rapport plaatst de zet van OpenAI ook in concurrentie met meer open agent-runtimes, waaronder DeepSeek Harness en andere open-sourceprojecten.
De gerapporteerde verplaatsing is van belang omdat een agentruntime de operationele stappen regelt tussen de uitvoer van een model en een voltooide taak. Volgens 36Kr kan Codex Harness de context behouden, tools aanroepen, werk in sandboxes uitvoeren en acties via menselijke goedkeuringen routeren. Voor organisaties die agenten in interne software inbedden, kunnen deze functies bepalen of een agent waarneembaar, onderbreekbaar en compatibel is met bestaande machtigingen. Uit het rapport blijkt niet dat het Codex-harnas voldoet aan een bepaalde bedrijfsbeveiligings- of nalevingsnorm.
36Kr meldt dat OpenAI een ARC-AGI-3-vergelijking presenteerde waarin GPT-5.6 Sol alleen al 13,3% scoorde en 38,3% met de continue redeneer- en contextcompressiemogelijkheden van Codex Harness. Het artikel zegt ook dat het uitvoertokenvolume is gedaald tot ongeveer een zesde van het oorspronkelijke bedrag. Als deze cijfers worden gereproduceerd, zouden ze erop wijzen dat orkestratie en contextverwerking de prestaties en kosten van hetzelfde model wezenlijk kunnen veranderen. De bron biedt echter geen testprotocol, basisgegevens, onafhankelijke replicatie of informatie over statistische significantie, dus de cijfers moeten worden behandeld als gerapporteerde bedrijfsresultaten en niet als vaststaand bewijs.
Het artikel stelt dat modelbedrijven prikkels hebben om de looptijd van hun modellen te bezitten of te distribueren. 36Kr zegt dat een runtime kan aantonen waar taken mislukken, waar toolaanroepen vastlopen, hoe vaak nieuwe pogingen plaatsvinden en welke contextstrategieën minder tokens verbruiken. Dit zou een modelontwikkelaar kunnen helpen zowel zijn modellen als zijn uitvoeringssysteem te verbeteren. De bron merkt ook op dat elk gebruik van taakregistraties voor training afhankelijk zou zijn van het toepasselijke privacybeleid; er wordt niet vastgelegd wat Codex of DeepSeek verzamelt, bewaart of gebruikt.
Een meer open runtime zou ook de balans tussen modelleveranciers en applicatieontwikkelaars kunnen veranderen. 36Kr zegt dat de op plug-ins gebaseerde architectuur van DSH is ontworpen om ontwikkelaars modellen, tools, opslag, sandboxen en luscomponenten te laten vervangen zonder een langdurige vork van het hele project te behouden. Die flexibiliteit kan teams aanspreken die van leverancier of uitvoeringsstrategie willen veranderen. Tegelijkertijd meldt het artikel dat DSH nog maar een vroege preview is en dat feedback van de community aanleiding gaf tot bezorgdheid over snelheid, tokenverbruik, documentatie, compatibiliteit en ongelijkmatige plug-inkwaliteit. Deze observaties zijn gerapporteerde feedback, geen systematische evaluatie.
Interactief mechanisme: hoe het eigenlijk werkt
Ontdek interactief de onderliggende technologie achter deze ontwikkeling.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Wat je nu moet bekijken
De belangrijkste open vragen zijn of het Codex-harnas echt bruikbaar is buiten het model-ecosysteem van OpenAI, welke componenten ontwikkelaars kunnen vervangen, hoe gegevens uit ingebedde workflows worden verwerkt en of de gerapporteerde prestatiewinst standhoudt bij onafhankelijke tests. Het geleverde rapport geeft geen informatie over de brede beschikbaarheid, prijzen, contractvoorwaarden, privacypraktijken of productiebetrouwbaarheid.
Kijk eerst naar bewijs dat het Codex-harnas kan werken met modellen en gereedschappen die verder gaan dan de voorkeursstapel van OpenAI. 36Kr beschrijft Codex als open en insluitbaar, maar het meegeleverde rapport specificeert niet de licentie, de exact vervangbare componenten, ondersteunde modeladapters, implementatieopties en of kritische onderdelen gesloten blijven. Deze details zullen bepalen of ontwikkelaars een draagbare runtime of een nauw gekoppelde OpenAI-integratie ontvangen.
Ten tweede moeten onafhankelijke tests de gerapporteerde ARC-AGI-3-verbetering en -reductie onderzoeken. Nuttige verificatie omvat de exacte modelversies, aanwijzingen, harnasinstellingen, contextlimieten, gereedschapsconfiguratie, foutafhandeling en kostenaannames. Zonder deze details kan de vergelijking niet aantonen of de winst afkomstig is van een algemeen bruikbaar runtime-ontwerp of van een bepaalde eigen opstelling.
Ten derde zullen organisaties die embedded agents overwegen, duidelijkere informatie nodig hebben over databeheer en -controle. Het rapport beschrijft bedrijfscode, klantgegevens, interne tools, goedkeuringen en taakrecords die zich door een gedeelde runtime verplaatsen. Er wordt niet vermeld waar deze gegevens worden verwerkt, hoe lang ze worden bewaard, of beheerders ze kunnen controleren of verwijderen, of dat ze kunnen worden gebruikt voor modelverbetering. Deze onbekende factoren zijn van belang voor inzet waarbij sprake is van vertrouwelijk of gereguleerd werk.
Ga ten slotte na of de groeiende verzameling agentruntimes een duurzame infrastructuurmarkt wordt of een reeks modelspecifieke ontwikkelaarstools blijft. 36Kr meldt dat DeepSeek Harness al vroeg aanzienlijke aandacht van ontwikkelaars trok en dat Kimi Code en ZCode al gerelateerde uitvoeringsmogelijkheden bieden. De adoptie in productie zal afhangen van stabiliteit, terugdraaimechanismen, toestemmingsgrenzen, documentatie, voorspelbaarheid van de kosten en onafhankelijke veiligheidsbeoordeling. Het aangeleverde rapport geeft interesse en productpositionering aan, maar geen brede acceptatie door het bedrijfsleven of betrouwbare superioriteit.