Quay lại Tin tức
sản phẩmAI Understanding tóm tắt

36Kr báo cáo OpenAI đã mở Khai thác Codex cho các ứng dụng đại lý

36Kr báo cáo rằng OpenAI đang định vị Codex Harness như một thời gian chạy mở dành cho các nhà phát triển xây dựng các ứng dụng tác nhân, mở rộng Codex ra ngoài ứng dụng, công cụ dòng lệnh và tích hợp IDE của chính nó. Báo cáo cho biết thời gian chạy quản lý các phiên, ngữ cảnh, lệnh gọi công cụ, hộp cát và sự phê duyệt của con người, nhưng các tuyên bố không…

6 min readRead the linked source
Source-provided image accompanying 36Kr reports OpenAI opened Codex Harness for agent applications
Nguồn tham khảoNguồn đã ghi
Nhà xuất bản
eu.36kr.com
Liên kết nguồn
eu.36kr.comhttps://eu.36kr.com/en/p/3952749463895174
Loại nguồn
Nguồn được liên kết - trạng thái nguồn chính chưa được thiết lập.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

AGI (Trí tuệ tổng hợp nhân tạo)
Một hệ thống AI giả định có thể thực hiện hầu hết các nhiệm vụ trí tuệ ở cấp độ con người trên nhiều lĩnh vực.
Nhúng
Biểu diễn vectơ số nắm bắt ý nghĩa ngữ nghĩa của văn bản, hình ảnh hoặc dữ liệu khác.
Mã thông báo
Một đoạn văn bản được xử lý bằng mô hình ngôn ngữ, chẳng hạn như một đoạn từ hoặc ký hiệu.
Tự kiểm traCâu đố về đại lý AI

Chuyện gì đã xảy ra

36Kr báo cáo rằng OpenAI đã phát hành một bài đăng dành cho nhà phát triển vào ngày 20 tháng 8 mô tả Codex là một nền tảng được xây dựng trên khai thác tác nhân mở. Theo báo cáo, các nhà phát triển có thể sử dụng codex exec, SDK hoặc máy chủ ứng dụng để nhúng các khả năng của Codex vào bảng điều khiển doanh nghiệp, hệ thống dịch vụ khách hàng, công cụ bảo mật và ứng dụng nội bộ. Báo cáo trình bày đây là sự thay đổi từ Codex chủ yếu là trợ lý lập trình sang đóng vai trò là cơ sở hạ tầng thực thi có thể tái sử dụng.

36Kr báo cáo rằng bài đăng ngày 20 tháng 8 của nhà phát triển OpenAI đã giới thiệu Codex như một nền tảng và mô tả Khai thác Codex mã nguồn mở bên dưới Ứng dụng Codex, các tiện ích mở rộng CLI và IDE. Báo cáo cho biết dây nịt quản lý trạng thái phiên, bối cảnh, lệnh gọi công cụ, hộp cát và sự phê duyệt của con người. Nó cũng cho biết các nhà phát triển có thể kết nối những khả năng đó với các sản phẩm hiện có thông qua codex exec, SDK hoặc máy chủ ứng dụng hỗ trợ các luồng, lượt, luồng sự kiện và giao thức phê duyệt. Không có tài liệu OpenAI chính nào được cung cấp cùng với nguồn, vì vậy những chi tiết này được cho là của 36Kr và không được xác nhận độc lập ở đây.

Báo cáo cho biết các khả năng này đã được giới thiệu theo từng giai đoạn. Nó mô tả tính khả dụng của SDK Codex cùng với bản phát hành chung của Codex vào tháng 10 năm 2025, sau đó sử dụng codex exec cho các tập lệnh và tác vụ tích hợp liên tục cũng như sự hỗ trợ của máy chủ ứng dụng cho các phiên chạy dài hơn. Nó cũng cho biết OpenAI đã xuất bản phần giải thích về vòng lặp tác nhân Codex vào tháng 1 năm 2026, bao gồm cách mô hình nhận hướng dẫn, gọi công cụ, đọc kết quả và tiếp tục sang bước tiếp theo. Giải thích trọng tâm của 36Kr là OpenAI hiện đã nhóm các chức năng này dưới tên Khai thác Codex và đang khuyến khích các nhà phát triển xây dựng các sản phẩm xung quanh chúng.

Theo 36Kr, OpenAI đã trích dẫn một số ứng dụng trong bài đăng trên blog của riêng mình. Báo cáo cho biết Cisco sử dụng SDK Codex trong Trình tạo ứng dụng cho Cisco Cloud Control, trong khi GitHub và JetBrains tích hợp Codex vào các môi trường phát triển hiện có. Nó cũng cho biết Thrive Holdings và Crete sử dụng Codex để khai thuế và một thí điểm đã xử lý 7.000 tờ khai thuế đồng thời giảm khoảng 1/3 thời gian chuẩn bị. Các ví dụ và phép đo này được 36Kr trình bày dưới dạng tuyên bố từ OpenAI; nguồn không cung cấp thử nghiệm, phương pháp hoặc tài liệu độc lập từ các tổ chức liên quan.

Báo cáo so sánh Khai thác Codex với Khai thác DeepSeek, trong đó cho biết DeepSeek có nguồn mở vào ngày 14 tháng 8 dưới tên viết tắt DSH. 36Kr cho biết DSH xử lý các mô hình, công cụ, kỹ năng, phiên, hộp cát, bộ lưu trữ, vòng lặp tác nhân, lập lịch và giao diện người dùng dưới dạng các plugin được quản lý thông qua hệ thống có tên Cordis. Nó mô tả Codex là một thời gian chạy tích hợp hơn trong đó các thành phần không cốt lõi phải được điều chỉnh cho phù hợp với công cụ của nó, đồng thời mô tả DSH mang tính mô-đun hơn. Bài viết cũng thảo luận về Kimi Code và ZCode là các hệ thống tác nhân có liên quan nhưng có cấu trúc khác nhau, thay vì trình bày chúng dưới dạng cùng một sản phẩm.

Chi tiết nguồn: eu.36kr.com ↗

Tại sao nó quan trọng

Thay đổi được báo cáo có thể mang lại cho OpenAI vai trò lớn hơn trong lớp phần mềm xác định cách các tác nhân AI sử dụng công cụ, bảo toàn bối cảnh, yêu cầu phê duyệt và hoàn thành công việc nhiều bước. Lớp đó có thể ảnh hưởng đến độ tin cậy, chi phí, khả năng quan sát và kiểm soát người dùng một cách độc lập với mô hình cơ bản. Báo cáo cũng đặt động thái của OpenAI trong cuộc cạnh tranh với các thời gian chạy tác nhân mở hơn, bao gồm DeepSeek Harness và các dự án nguồn mở khác.

Di chuyển được báo cáo rất quan trọng vì thời gian chạy của tác nhân kiểm soát các bước vận hành giữa đầu ra của mô hình và một nhiệm vụ đã hoàn thành. Theo 36Kr, Codex Harness có thể duy trì ngữ cảnh, gọi công cụ, thực hiện công việc trong hộp cát và định tuyến các hành động thông qua sự phê duyệt của con người. Đối với các tổ chức nhúng tác nhân vào phần mềm nội bộ, các chức năng đó có thể xác định liệu tác nhân có thể quan sát được, có thể bị gián đoạn và tương thích với các quyền hiện có hay không. Báo cáo không chứng minh rằng Codex Harness đáp ứng bất kỳ tiêu chuẩn tuân thủ hoặc bảo mật doanh nghiệp cụ thể nào.

36Kr báo cáo rằng OpenAI đã trình bày một so sánh ARC-AGI-3, trong đó GPT-5.6 Sol đạt 13,3% riêng và 38,3% với khả năng lý luận và nén ngữ cảnh liên tục của Codex Harness. Bài báo cũng cho biết khối lượng đầu ra giảm xuống còn khoảng 1/6 số lượng ban đầu. Những số liệu đó, nếu được sao chép, sẽ gợi ý rằng việc phối hợp và xử lý bối cảnh có thể thay đổi đáng kể hiệu suất và chi phí của cùng một mô hình. Tuy nhiên, nguồn này không cung cấp quy trình thử nghiệm, chi tiết cơ bản, bản sao độc lập hoặc thông tin về ý nghĩa thống kê, vì vậy các con số phải được coi là kết quả được báo cáo của công ty thay vì bằng chứng đã được giải quyết.

Bài báo lập luận rằng các công ty kiểu mẫu có động cơ để sở hữu hoặc phân phối thời gian chạy xung quanh mô hình của họ. 36Kr cho biết thời gian chạy có thể tiết lộ vị trí tác vụ không thành công, vị trí lệnh gọi công cụ bị đình trệ, tần suất thử lại xảy ra và chiến lược ngữ cảnh nào tiêu thụ ít mã thông báo hơn. Điều này có thể giúp nhà phát triển mô hình cải thiện cả mô hình và hệ thống thực thi của nó. Nguồn cũng lưu ý rằng bất kỳ việc sử dụng hồ sơ nhiệm vụ nào cho việc đào tạo sẽ phụ thuộc vào các chính sách bảo mật hiện hành; nó không thiết lập những gì Codex hoặc DeepSeek thu thập, giữ lại hoặc sử dụng.

Thời gian chạy mở hơn cũng có thể thay đổi sự cân bằng giữa nhà cung cấp mô hình và nhà phát triển ứng dụng. 36Kr cho biết kiến ​​trúc dựa trên plugin của DSH được thiết kế để cho phép các nhà phát triển thay thế các mô hình, công cụ, bộ lưu trữ, hộp cát và các thành phần vòng lặp mà không cần duy trì một nhánh phân nhánh tồn tại lâu dài của toàn bộ dự án. Tính linh hoạt đó có thể thu hút các nhóm muốn thay đổi nhà cung cấp hoặc chiến lược thực hiện. Đồng thời, bài báo báo cáo rằng DSH vẫn là bản xem trước sớm và phản hồi của cộng đồng đã làm dấy lên mối lo ngại về tốc độ, mức tiêu thụ mã thông báo, tài liệu, khả năng tương thích và chất lượng plugin không đồng đều. Những quan sát đó là phản hồi được báo cáo chứ không phải là đánh giá có hệ thống.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Xem gì tiếp theo

Các câu hỏi mở quan trọng nhất là liệu Khai thác Codex có thực sự có thể sử dụng được bên ngoài hệ sinh thái mô hình của OpenAI hay không, nhà phát triển có thể thay thế những thành phần nào, cách xử lý dữ liệu từ quy trình công việc nhúng và liệu hiệu suất được báo cáo có đạt được khi thử nghiệm độc lập hay không. Báo cáo được cung cấp không xác định tính khả dụng rộng rãi, giá cả, điều khoản hợp đồng, thực tiễn bảo mật hoặc độ tin cậy sản xuất.

Trước tiên, hãy theo dõi bằng chứng cho thấy Codex Harness có thể hoạt động với các mô hình và công cụ ngoài ngăn xếp ưu tiên của OpenAI. 36Kr mô tả Codex là mở và có thể nhúng, nhưng báo cáo được cung cấp không nêu rõ giấy phép, các thành phần có thể thay thế chính xác, bộ điều hợp mô hình được hỗ trợ, các tùy chọn triển khai hoặc liệu các bộ phận quan trọng có còn đóng hay không. Những chi tiết đó sẽ xác định xem các nhà phát triển có nhận được thời gian chạy di động hay tích hợp OpenAI được liên kết chặt chẽ hay không.

Thứ hai, các thử nghiệm độc lập sẽ kiểm tra mức độ cải thiện và giảm mã thông báo ARC-AGI-3 được báo cáo. Việc xác minh hữu ích sẽ bao gồm các phiên bản mô hình chính xác, lời nhắc, cài đặt khai thác, giới hạn ngữ cảnh, cấu hình công cụ, xử lý lỗi và giả định chi phí. Nếu không có những chi tiết đó, sự so sánh không thể cho thấy liệu lợi ích đạt được đến từ thiết kế thời gian chạy hữu ích nói chung hay từ một thiết lập độc quyền cụ thể.

Thứ ba, các tổ chức xem xét các tác nhân nhúng sẽ cần thông tin rõ ràng hơn về quản trị và kiểm soát dữ liệu. Báo cáo mô tả mã doanh nghiệp, dữ liệu khách hàng, công cụ nội bộ, phê duyệt và bản ghi nhiệm vụ di chuyển trong thời gian chạy chung. Nó không cho biết những hồ sơ đó được xử lý ở đâu, chúng được lưu giữ trong bao lâu, liệu quản trị viên có thể kiểm tra hoặc xóa chúng hay không hoặc liệu chúng có thể được sử dụng để cải tiến mô hình hay không. Những điều chưa biết đó là tài liệu cho việc triển khai liên quan đến công việc bí mật hoặc được quản lý.

Cuối cùng, theo dõi xem tập hợp thời gian chạy tác nhân ngày càng tăng có trở thành thị trường cơ sở hạ tầng bền vững hay vẫn là một tập hợp các công cụ dành cho nhà phát triển theo mô hình cụ thể. 36Kr báo cáo rằng Khai thác DeepSeek đã thu hút sự chú ý đáng kể của các nhà phát triển ban đầu và Mã Kimi và ZCode đã cung cấp các khả năng thực thi liên quan. Việc áp dụng trong sản xuất sẽ phụ thuộc vào tính ổn định, cơ chế khôi phục, ranh giới cấp phép, tài liệu, khả năng dự đoán chi phí và đánh giá bảo mật độc lập. Báo cáo được cung cấp thể hiện sự quan tâm và định vị sản phẩm, nhưng không thể hiện sự áp dụng rộng rãi của doanh nghiệp hoặc tính ưu việt đáng tin cậy.

Hướng dẫn và câu hỏi liên quan

Đại lý AIGiải thích về mô hình AIPrompt EngineeringKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?