Chuyện gì đã xảy ra
Forbes báo cáo rằng các hệ thống AI tự động đang được sử dụng để theo đuổi các nhiệm vụ mở rộng của doanh nghiệp với sự can thiệp hạn chế hoặc không có sự can thiệp của con người. Bài viết nhấn mạnh Blitzy để hiện đại hóa mã kế thừa, XBOW để thử nghiệm thâm nhập liên tục và các hệ thống liên quan từ Google và OpenAI.
Forbes báo cáo rằng AI tự động đang được định vị là một bước tiến vượt xa các phi công phụ và các đặc vụ có thời gian tồn tại ngắn hạn. Trong khung của bài viết, các phi công phụ hỗ trợ trong khi một người làm việc, các tác nhân thông thường xử lý một nhiệm vụ trong vài phút và trả về kết quả để xem xét, trong khi nhiều hệ thống tự trị hơn nhận được mục tiêu và làm việc trong nhiều ngày hoặc nhiều tuần trước khi trả lại công việc đã hoàn thành. Forbes cho rằng sự khác biệt này một phần là nhờ Sanjot Malhi, người lãnh đạo quỹ tăng trưởng toàn cầu của Northzone và cho biết ông đã dành gần hai năm để phát triển luận điểm đầu tư về công nghệ. Báo cáo cho biết Northzone đã ủng hộ Blitzy và XBOW kể từ tháng 1, trong đó Blitzy đã huy động được 200 triệu USD với mức định giá được báo cáo là 1,4 tỷ USD và XBOW đã huy động được 120 triệu USD. Những số liệu tài chính này và đặc điểm của hệ thống đã được Forbes báo cáo và không được xác nhận độc lập ở đây.
Forbes báo cáo rằng Blitzy áp dụng phương pháp này để hiện đại hóa phần mềm doanh nghiệp. Công ty được mô tả là đang sử dụng hàng trăm triệu dòng mã kế thừa và các chính sách tuân thủ của khách hàng, sau đó sử dụng mục tiêu đã nêu để xây dựng các hệ thống mới. Forbes trích dẫn Charles River Development, một công ty State Street, là khách hàng sử dụng nền tảng này để hiện đại hóa mã cũ hơn và cho biết Builders FirstSource đã tăng gấp ba tốc độ phát triển phần mềm của mình trong ba tháng đầu tiên sử dụng nền tảng này. Bài báo cũng cho biết OpenAI đã trích dẫn Blitzy trong các tài liệu về khả năng mã hóa của GPT-5.6. Forbes trình bày những kết quả này của khách hàng như bằng chứng về việc sử dụng thực tế, nhưng báo cáo được cung cấp không cung cấp kiểm toán độc lập, đường cơ sở chi tiết, cỡ mẫu, tỷ lệ lỗi hoặc giải thích về mức độ đánh giá của con người trong các dự án đó.
Forbes báo cáo rằng XBOW áp dụng AI tự trị để tấn công an ninh mạng. Nền tảng của nó được mô tả là liên tục tiến hành các thử nghiệm thâm nhập vào hệ thống của công ty thay vì chỉ dựa vào các đánh giá định kỳ của các chuyên gia con người khan hiếm. Bài báo cho biết XBOW đã đứng đầu bảng xếp hạng HackerOne tại Hoa Kỳ vào mùa hè năm 2025, điều mà Forbes mô tả là lần đầu tiên hacker hàng đầu không phải là con người. Forbes cũng trích dẫn Phó giám đốc an ninh thông tin của Moderna, Farzan Karimi, người cho biết XBOW đã tìm thấy một đường vượt tường lửa mà ông đã bỏ lỡ. Báo cáo còn cho biết XBOW đã nhận được quyền truy cập sớm vào mô hình Mythos của Anthropic trong Dự án Glasswing và Anthropic đã trích dẫn thử nghiệm của công ty. Những tuyên bố này được quy cho Forbes và các tổ chức hoặc giám đốc điều hành được nêu tên thông qua Forbes; không có dữ liệu thử nghiệm độc lập được cung cấp.
Forbes xếp các công ty này vào một nhóm rộng hơn gồm các hệ thống mã hóa và bảo mật tự trị. Bài báo báo cáo rằng Horizon3 đã huy động được 250 triệu đô la trong Series E với mức định giá trên 2 tỷ đô la và Big Sleep của Google, do DeepMind và Project Zero phát triển, đã tự động tìm thấy 20 lỗ hổng trong phần mềm nguồn mở được sử dụng rộng rãi. Nó cũng cho biết OpenAI đã kết hợp Aardvark, một hệ thống nghiên cứu bảo mật, vào Codex sau khi kiểm tra điểm chuẩn, trong đó nó phát hiện được 92% các lỗ hổng đã biết. Báo cáo mô tả những phát triển này là dấu hiệu cho thấy các hệ thống AI đang hướng tới hoạt động bền vững cho các mục tiêu của doanh nghiệp. Tuy nhiên, Forbes không cung cấp các giao thức chuẩn cơ bản, tiết lộ lỗ hổng, tỷ lệ dương tính giả, kết quả khắc phục hoặc bằng chứng cho thấy hệ thống vận hành mà không có sự can thiệp có ý nghĩa của con người trong mọi trường hợp.
Tại sao nó quan trọng
Nếu được xác nhận độc lập, các hệ thống này có thể thay đổi cách các công ty xử lý việc phát triển phần mềm và an ninh mạng bằng cách chuyển AI từ các nhiệm vụ ngắn, được giám sát sang công việc dài hạn hơn. Báo cáo cũng nhấn mạnh những câu hỏi chưa được giải quyết về giám sát, khả năng kiểm toán, tính chính xác, chi phí và trách nhiệm giải trình.
Tuyên bố trọng tâm của Forbes rất quan trọng vì phát triển phần mềm và an ninh mạng đều là những lĩnh vực mà công việc chưa hoàn thành có thể gây ra hậu quả trực tiếp trong hoạt động. Một hệ thống có thể xử lý cơ sở mã kế thừa lớn, giải thích các ràng buộc tuân thủ và tạo ra một dự án hiện đại hóa hữu dụng có thể giảm thời gian cần thiết cho công việc vốn phụ thuộc vào các nhà tích hợp hệ thống và các hợp đồng dài hạn. Kết quả Builders FirstSource được báo cáo, nếu được xác minh độc lập, sẽ cho thấy sự thay đổi đáng kể về thông lượng phát triển. Câu hỏi thực tế không phải là liệu AI có thể tạo mã hay không mà là liệu nó có thể cung cấp một cách nhất quán các hệ thống an toàn, có thể bảo trì và tuân thủ trong các nhiệm vụ dài hay không.
Các ví dụ về bảo mật chỉ ra một sự thay đổi mang tính hệ quả tương tự. Kiểm tra tự động liên tục có thể mở rộng số lượng phần mềm được kiểm tra và giảm sự phụ thuộc vào các đánh giá định kỳ. Việc tìm ra lỗ hổng mà người đánh giá bỏ sót có thể có giá trị, đặc biệt nếu phát hiện đó có thể lặp lại và dẫn đến cách khắc phục hiệu quả. Đồng thời, thử nghiệm thâm nhập tự động có thể tạo ra rủi ro nếu quyền, mục tiêu hoặc hành động của nó được kiểm soát kém. Tài khoản của Forbes không xác định cách tách biệt các hệ thống này, cách khách hàng phê duyệt ranh giới thử nghiệm, cách xác thực các phát hiện hoặc cách các tổ chức ngăn chặn các công cụ tự động làm gián đoạn hệ thống sản xuất.
Báo cáo cũng minh họa sự khác biệt giữa sự nhiệt tình đầu tư và hiệu quả hoạt động công cộng được chứng minh. Forbes mô tả Malhi của Northzone coi Blitzy và XBOW là những phiên bản đầu tiên của “bộ não doanh nghiệp” giúp duy trì bối cảnh của tổ chức trong khi các mô hình cung cấp khả năng. Đó là một luận điểm đầu tư, không phải là một hạng mục kỹ thuật được thiết lập độc lập. Bài báo đề cập đến kỳ vọng của KPMG và Gartner về việc các công ty giảm bớt hoặc ngừng hoạt động một số hoạt động triển khai tác nhân AI, nhưng đó chỉ là những dự báo chứ không phải bằng chứng về kết quả hiện tại. Tác động công cộng có ý nghĩa nhất sẽ phụ thuộc vào việc liệu các hệ thống tự trị có thể hiển thị kết quả đáng tin cậy hay không, hồ sơ minh bạch và trách nhiệm giải trình rõ ràng đối với nhiều khách hàng khác nhau thay vì những câu chuyện thành công được chọn lọc.
Cơ chế tương tác: Nó thực sự hoạt động như thế nào
Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Xem gì tiếp theo
Các thử nghiệm chính là đánh giá độc lập về công việc đã hoàn thành, phát hiện bảo mật, tỷ lệ lỗi, chi phí và sự giám sát của con người. Xem liệu các công ty có thể ghi lại hành động của hệ thống và phân công trách nhiệm một cách đáng tin cậy khi các công cụ tự động mắc lỗi hay không.
Đầu tiên, hãy theo dõi bằng chứng độc lập đằng sau những tuyên bố về hiệu suất. Đối với Blitzy, điều đó sẽ bao gồm thông tin chi tiết về các dự án được đánh giá, định nghĩa về tốc độ phát triển “gấp ba”, tỷ lệ lỗi và bảo mật, số lượng đánh giá của con người và liệu hệ thống kết quả có còn được bảo trì sau khi triển khai hay không. Lời khai của khách hàng có thể chứng minh rằng một hệ thống đã được sử dụng, nhưng bản thân nó không xác lập được độ tin cậy chung. Forbes báo cáo các khiếu nại của khách hàng, trong khi tài liệu được cung cấp không xác minh chúng một cách độc lập.
Đối với XBOW và các hệ thống bảo mật liên quan, việc theo dõi hữu ích sẽ bao gồm các lỗ hổng được tiết lộ, khả năng tái tạo, tỷ lệ dương tính giả và âm tính giả, phạm vi thử nghiệm được ủy quyền và thời gian từ khi phát hiện đến khi khắc phục. Kết quả điểm chuẩn 92% được báo cáo cho Aardvark của OpenAI cũng cần bối cảnh về thiết kế của điểm chuẩn, ý nghĩa của “các sai sót đã biết” và cách hệ thống so sánh với đường cơ sở của con người hoặc tự động. Nếu không có những chi tiết đó, vị trí trên bảng xếp hạng và tỷ lệ phần trăm điểm chuẩn sẽ không được coi là thước đo chung về hiệu suất bảo mật trong thế giới thực.
Cuối cùng, các tổ chức áp dụng những công cụ này sẽ cần quản trị phù hợp với quyền tự chủ của họ. Bản thân Forbes cũng báo cáo những lo ngại về lỗ hổng quản trị và đề xuất các quy trình kiểm toán cũng như trách nhiệm giải trình rõ ràng trước khi các công ty giao phó mục tiêu cho các hệ thống tự trị. Xem liệu việc triển khai có đảm bảo sự phê duyệt của con người đối với các hành động có tác động cao hay không, ghi lại hoạt động của mô hình và công cụ, hạn chế quyền truy cập vào các hệ thống nhạy cảm và cung cấp người vận hành có trách nhiệm khi công việc không thành công. Những dự đoán dài hạn hơn của bài viết về AI tự động và trí tuệ nhân tạo nói chung vẫn chưa chắc chắn; bằng chứng ngắn hạn phải đến từ việc triển khai được ghi lại, đánh giá lặp lại và kết quả có thể giải thích công khai.