Que s'est-il passé
36Kr rapporte que OpenAI a publié un article de développeur le 20 août décrivant Codex comme une plate-forme construite sur un harnais d'agent ouvert. Selon le rapport, les développeurs peuvent utiliser Codex Exec, un SDK ou un serveur d'applications pour intégrer les fonctionnalités Codex dans les consoles d'entreprise, les systèmes de service client, les outils de sécurité et les applications internes. Le rapport présente cela comme un changement de Codex étant principalement un assistant de programmation pour servir d'infrastructure d'exécution réutilisable.
36Kr rapporte que le message du développeur du 20 août de OpenAI présentait Codex comme une plate-forme et décrivait un harnais Codex open source sous l'application Codex, les extensions CLI et IDE. Le rapport indique que le harnais gère l'état de la session, le contexte, les appels d'outils, les bacs à sable et les approbations humaines. Il indique également que les développeurs peuvent connecter ces fonctionnalités aux produits existants via un codex exec, un SDK ou un serveur d'applications prenant en charge les threads, les tours, les flux d'événements et les protocoles d'approbation. Aucun document principal OpenAI n'a été fourni avec la source, ces détails sont donc attribués à 36Kr et ne sont pas confirmés ici de manière indépendante.
Le rapport indique que les capacités ont été introduites par étapes. Il décrit la disponibilité du SDK Codex parallèlement à la sortie générale de Codex en octobre 2025, l'utilisation ultérieure de codex exec pour les scripts et les tâches d'intégration continue, ainsi que la prise en charge du serveur d'applications pour les sessions de longue durée. Il indique également que OpenAI a publié une explication de la boucle d'agent Codex en janvier 2026, expliquant comment le modèle reçoit des instructions, appelle des outils, lit les résultats et passe à l'étape suivante. L'interprétation centrale de 36Kr est que OpenAI a désormais regroupé ces fonctions sous le nom Codex Harness et encourage les développeurs à créer des produits autour d'elles.
Selon 36Kr, OpenAI a cité plusieurs applications dans son propre article de blog. Le rapport indique que Cisco utilise le SDK Codex dans App Builder pour Cisco Cloud Control, tandis que GitHub et JetBrains intègrent Codex dans les environnements de développement existants. Il indique également que Thrive Holdings et Crete utilisent Codex pour la préparation des déclarations de revenus et qu'un projet pilote a traité 7 000 déclarations de revenus tout en réduisant le temps de préparation d'environ un tiers. Ces exemples et mesures sont présentés par 36Kr comme revendications de OpenAI ; la source ne fournit pas de tests, de méthodologies ou de documentation indépendants provenant des organisations impliquées.
Le rapport compare le harnais Codex au harnais DeepSeek, dont il dit que DeepSeek est open source le 14 août sous l'abréviation DSH. 36Kr indique que DSH traite les modèles, les outils, les compétences, les sessions, les bacs à sable, le stockage, la boucle d'agent, la planification et l'interface utilisateur comme des plugins gérés via un système appelé Cordis. Il caractérise Codex comme un runtime plus intégré dont les composants non essentiels doivent être adaptés à son moteur, tout en décrivant DSH comme plus modulaire. L'article traite également du code Kimi et du ZCode en tant que systèmes d'agents liés mais structurés différemment, plutôt que de les présenter comme le même produit.
Détails de la source: eu.36kr.com ↗
Pourquoi c'est important
Le changement signalé pourrait donner à OpenAI un rôle plus important dans la couche logicielle qui détermine la manière dont les agents d'IA utilisent les outils, préservent le contexte, demandent l'approbation et effectuent un travail en plusieurs étapes. Cette couche peut affecter la fiabilité, le coût, l’observabilité et le contrôle des utilisateurs indépendamment du modèle sous-jacent. Le rapport place également la décision de OpenAI en concurrence avec des environnements d'exécution d'agents plus ouverts, notamment DeepSeek Harness et d'autres projets open source.
Le déplacement signalé est important car le runtime d’un agent contrôle les étapes opérationnelles entre la sortie d’un modèle et une tâche terminée. Selon 36Kr, Codex Harness peut maintenir le contexte, appeler des outils, exécuter des travaux dans des bacs à sable et acheminer les actions via des approbations humaines. Pour les organisations intégrant des agents dans des logiciels internes, ces fonctions peuvent déterminer si un agent est observable, disruptible et compatible avec les autorisations existantes. Le rapport n’établit pas que Codex Harness répond à une norme particulière de sécurité ou de conformité d’entreprise.
36Kr rapporte que OpenAI a présenté une comparaison ARC-AGI-3 dans laquelle GPT-5.6 Sol a obtenu un score de 13,3 % seul et de 38,3 % avec les capacités de raisonnement continu et de compression de contexte de Codex Harness. L'article indique également que le volume des jetons de sortie est tombé à environ un sixième du montant initial. Ces chiffres, s'ils étaient reproduits, suggéreraient que l'orchestration et la gestion du contexte peuvent modifier sensiblement les performances et le coût du même modèle. Cependant, la source ne fournit aucun protocole de test, aucun détail de base, aucune réplication indépendante ou information sur la signification statistique, de sorte que les chiffres doivent être traités comme des résultats rapportés par l'entreprise plutôt que comme des preuves établies.
L’article soutient que les entreprises modèles sont incitées à posséder ou à distribuer le temps d’exécution autour de leurs modèles. 36Kr indique qu'un environnement d'exécution peut révéler où les tâches échouent, où les appels d'outils se bloquent, à quelle fréquence les tentatives se produisent et quelles stratégies contextuelles consomment moins de jetons. Cela pourrait aider un développeur de modèles à améliorer à la fois ses modèles et son système d'exécution. La source note également que toute utilisation des enregistrements de tâches à des fins de formation dépendrait des politiques de confidentialité applicables ; il n'établit pas ce que Codex ou DeepSeek collecte, conserve ou utilise.
Un environnement d'exécution plus ouvert pourrait également modifier l'équilibre entre les fournisseurs de modèles et les développeurs d'applications. 36Kr indique que l'architecture basée sur les plugins de DSH est conçue pour permettre aux développeurs de remplacer les modèles, les outils, le stockage, les bacs à sable et les composants de boucle sans maintenir une branche à long terme de l'ensemble du projet. Cette flexibilité peut plaire aux équipes qui souhaitent changer de fournisseur ou de stratégie d'exécution. Dans le même temps, l'article rapporte que DSH est encore un premier aperçu et que les commentaires de la communauté ont soulevé des inquiétudes concernant la vitesse, la consommation de jetons, la documentation, la compatibilité et la qualité inégale des plugins. Ces observations constituent un retour d’information et non une évaluation systématique.
Mécanisme interactif : comment cela fonctionne réellement
Explorez de manière interactive la technologie sous-jacente à ce développement.
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Que regarder ensuite
Les questions ouvertes les plus importantes sont de savoir si Codex Harness est véritablement utilisable en dehors de l'écosystème de modèles de OpenAI, quels composants les développeurs peuvent remplacer, comment les données des flux de travail intégrés sont gérées et si les gains de performances rapportés se maintiennent lors de tests indépendants. Le rapport fourni n'établit pas une large disponibilité, les prix, les conditions contractuelles, les pratiques de confidentialité ou la fiabilité de la production.
Tout d’abord, recherchez la preuve que le harnais Codex peut fonctionner avec des modèles et des outils au-delà de la pile préférée de OpenAI. 36Kr décrit Codex comme ouvert et intégrable, mais le rapport fourni ne précise pas la licence, les composants remplaçables exacts, les adaptateurs de modèle pris en charge, les options de déploiement ou si les pièces critiques restent fermées. Ces détails détermineront si les développeurs recevront un runtime portable ou une intégration OpenAI étroitement couplée.
Deuxièmement, des tests indépendants devraient examiner l’amélioration ARC-AGI-3 et la réduction des jetons signalées. Une vérification utile inclurait les versions exactes du modèle, les invites, les paramètres du harnais, les limites du contexte, la configuration des outils, la gestion des pannes et les hypothèses de coûts. Sans ces détails, la comparaison ne peut pas montrer si le gain provient d'une conception d'exécution généralement utile ou d'une configuration propriétaire particulière.
Troisièmement, les organisations qui envisagent d’intégrer des agents auront besoin d’informations plus claires sur la gouvernance et le contrôle des données. Le rapport décrit le code d'entreprise, les données client, les outils internes, les approbations et les enregistrements de tâches circulant dans un environnement d'exécution partagé. Il ne précise pas où ces enregistrements sont traités, combien de temps ils sont conservés, si les administrateurs peuvent les auditer ou les supprimer, ou s'ils peuvent être utilisés pour améliorer le modèle. Ces inconnues sont importantes pour les déploiements impliquant un travail confidentiel ou réglementé.
Enfin, vérifiez si la collection croissante d’environnements d’exécution d’agents devient un marché d’infrastructure durable ou reste un ensemble d’outils de développement spécifiques à un modèle. 36Kr rapporte que DeepSeek Harness a attiré l'attention des premiers développeurs et que Kimi Code et ZCode fournissent déjà des capacités d'exécution associées. L'adoption en production dépendra de la stabilité, des mécanismes de restauration, des limites d'autorisation, de la documentation, de la prévisibilité des coûts et d'un examen de sécurité indépendant. Le rapport fourni établit l'intérêt et le positionnement du produit, mais pas une large adoption par l'entreprise ou une supériorité fiable.