뉴스로 돌아가기
기업AI Understanding 브리핑

Forbes는 자율 AI 시스템이 엔터프라이즈 코딩 및 보안으로 전환되고 있다고 보고합니다.

Forbes는 Blitzy와 XBOW가 점점 더 자율적인 AI를 소프트웨어 현대화 및 침투 테스트에 적용하고 있으며 Google와 OpenAI는 관련 보안 시스템을 개발하고 있다고 보고했습니다. 회사의 성과 및 배포 주장은 독립적으로 확인되지 않았습니다.

6 min readRead the original reporting
Source-provided image accompanying Forbes reports autonomous AI systems moving into enterprise coding and security
기여 보고녹음된 소스
출판사
forbes.com
소스 링크
forbes.comhttps://www.forbes.com/sites/sandycarter/2026/08/24/autonomous-ai-outgrows-agents-as-blitzy-xbow-and-google-deliver/
소스 유형
자사 문서가 아닌 뉴스 매체를 통한 보도입니다.

자체적으로는 확인할 수 없었던 내용: 이 소유권 주장은 해당 매장에 귀속됩니다. 당사는 자사 문서와 비교하여 이를 확인하지 않았습니다. (forbes.com)

맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

AGI(인공일반지능)
다양한 영역에 걸쳐 인간 수준에서 대부분의 지적 작업을 수행할 수 있는 가상의 AI 시스템입니다.
벤치마크
모델 성능을 측정하고 비교하는 데 사용되는 표준화된 테스트 또는 데이터 세트입니다.
자신을 테스트해 보세요AI 에이전트 퀴즈

무슨 일이 일어났나요?

Forbes는 자율 AI 시스템이 인간의 개입이 제한되거나 전혀 없이 확장된 기업 작업을 추구하는 데 사용되고 있다고 보고합니다. 이 기사에서는 레거시 코드 현대화를 위한 Blitzy, 지속적인 침투 테스트를 위한 XBOW, Google 및 OpenAI의 관련 시스템을 강조합니다.

Forbes는 자율 AI가 부조종사 및 단명 에이전트를 넘어선 단계로 자리매김하고 있다고 보고합니다. 기사의 구성에서 부조종사는 사람이 작업하는 동안 보조하고, 기존 에이전트는 몇 분 동안 작업을 처리하고 검토를 위해 결과를 반환하는 반면, 보다 자율적인 시스템은 목표를 받고 완료된 작업을 반환하기 전에 며칠 또는 몇 주 동안 작업합니다. Forbes는 이러한 구별이 부분적으로 Northzone의 글로벌 성장 펀드를 이끌고 기술에 대한 투자 논문을 개발하는 데 거의 2년을 보냈다고 말한 Sanjot Malhi 덕분이라고 생각합니다. 보고서에 따르면 Northzone은 1월부터 Blitzy와 XBOW를 지원했으며 Blitzy는 보고된 가치 평가에서 14억 달러로 2억 달러를 모금했고 XBOW는 1억 2천만 달러를 모금했습니다. 이러한 재무 수치와 시스템 특성은 Forbes에서 보고한 것이며 여기에서 독립적으로 확인된 것은 아닙니다.

Forbes는 Blitzy가 이러한 접근 방식을 엔터프라이즈 소프트웨어 현대화에 적용한다고 보고합니다. 이 회사는 수억 줄의 레거시 코드와 고객의 규정 준수 정책을 수집한 다음 명시된 목표를 사용하여 새로운 시스템을 구축하는 것으로 설명됩니다. Forbes는 이전 코드를 현대화하기 위해 플랫폼을 사용하는 고객으로 State Street 회사인 Charles River Development를 인용했으며 Builders FirstSource는 플랫폼에서 처음 3개월 동안 소프트웨어 개발 속도를 3배로 늘렸다고 밝혔습니다. 기사에는 또한 OpenAI가 GPT-5.6의 코딩 기능에 관한 자료에서 Blitzy를 인용했다고 나와 있습니다. Forbes는 이러한 고객 결과를 실제 사용의 증거로 제시하지만 제공된 보고서는 독립적인 감사, 세부 기준, 표본 크기, 오류율 또는 해당 프로젝트에 얼마나 많은 인적 검토가 남아 있는지에 대한 설명을 제공하지 않습니다.

Forbes는 XBOW가 자율 AI를 공격적인 사이버 보안에 적용한다고 보고했습니다. 이 플랫폼은 소수의 전문가에 의한 주기적인 검토에만 의존하는 것이 아니라 회사 시스템에 대해 지속적으로 침투 테스트를 수행하는 것으로 설명됩니다. 기사에 따르면 XBOW는 2025년 여름 HackerOne의 미국 순위표 1위에 올랐으며, 포브스는 이를 선도적인 해커가 인간이 아닌 최초의 사례라고 설명합니다. Forbes는 또한 XBOW가 자신이 놓친 방화벽 우회를 발견했다고 말한 Moderna의 최고 정보 보안 책임자인 Farzan Karimi의 말을 인용했습니다. 보고서는 또한 XBOW가 Project Glasswing 동안 Anthropic의 Mythos 모델에 대한 조기 액세스를 얻었으며 Anthropic가 회사의 테스트를 인용했다고 밝혔습니다. 이러한 주장은 Forbes 및 Forbes를 통해 명명된 조직 또는 경영진에 귀속됩니다. 독립적인 테스트 데이터는 제공되지 않습니다.

Forbes는 이러한 회사를 보다 광범위한 자율 보안 및 코딩 시스템 그룹에 포함시킵니다. 이 기사에서는 Horizon3가 20억 달러 이상의 가치로 2억 5천만 달러의 Series E를 모금했으며, DeepMind와 Project Zero가 개발한 Google의 Big Sleep이 널리 사용되는 오픈 소스 소프트웨어에서 20개의 취약점을 자동으로 발견했다고 보고했습니다. 또한 OpenAI는 벤치마크 테스트를 거쳐 알려진 결함의 92%를 발견한 후 보안 연구 시스템인 Aardvark를 Codex에 통합했다고 밝혔습니다. 보고서는 이러한 발전을 AI 시스템이 기업 목표에 대한 지속적인 작업을 향해 나아가고 있다는 신호로 설명합니다. 그러나 Forbes는 모든 경우에 시스템이 의미 있는 인간 개입 없이 작동했다는 기본 벤치마크 프로토콜, 취약성 공개, 오탐률, 교정 결과 또는 증거를 제공하지 않습니다.

소스 세부정보: forbes.com ↗

왜 중요한가요?

독립적으로 검증되면 이러한 시스템은 AI를 단기 감독 작업에서 장기 실행 작업으로 전환하여 기업이 소프트웨어 개발 및 사이버 보안을 처리하는 방식을 바꿀 수 있습니다. 이 보고서는 또한 감독, 감사 가능성, 정확성, 비용 및 책임에 대한 해결되지 않은 질문을 강조합니다.

소프트웨어 개발과 사이버 보안은 둘 다 미완성 작업이 직접적인 운영 결과를 초래할 수 있는 영역이기 때문에 Forbes의 핵심 주장이 중요합니다. 대규모 레거시 코드베이스를 처리하고 규정 준수 제약 조건을 해석하며 사용 가능한 현대화 프로젝트를 생성할 수 있는 시스템은 전통적으로 시스템 통합업체 및 장기 계약에 의존했던 작업에 필요한 시간을 줄일 수 있습니다. 보고된 Builders FirstSource 결과는 독립적으로 검증된 경우 개발 처리량에 상당한 변화가 있음을 나타냅니다. 실질적인 질문은 AI가 코드를 생성할 수 있는지 여부가 아니라 장기간 작업에 걸쳐 안전하고 유지 관리가 가능하며 규정을 준수하는 시스템을 일관되게 제공할 수 있는지 여부입니다.

보안 사례에서도 마찬가지로 결과적으로 변화가 발생하고 있음을 지적합니다. 지속적으로 자동화된 테스트를 통해 검사되는 소프트웨어의 양을 늘리고 주기적인 평가에 대한 의존도를 줄일 수 있습니다. 인간 검토자가 놓친 취약점을 찾는 것은 특히 그 결과가 재현 가능하고 효과적인 해결로 이어지는 경우 가치가 있을 수 있습니다. 동시에 자율 침투 테스트는 권한, 대상 또는 작업이 제대로 제어되지 않으면 위험을 초래할 수 있습니다. Forbes의 설명은 이러한 시스템을 격리하는 방법, 고객이 테스트 경계를 승인하는 방법, 결과를 검증하는 방법 또는 조직이 자동화 도구가 생산 시스템을 방해하는 것을 방지하는 방법을 설정하지 않습니다.

이 보고서는 또한 투자 열정과 입증된 공공 성과의 차이를 보여줍니다. Forbes는 Northzone의 Malhi가 Blitzy와 XBOW를 모델이 기능을 제공하는 동안 조직의 맥락을 유지하는 "기업 두뇌"의 초기 버전으로 보고 있다고 설명합니다. 그것은 독립적으로 확립된 기술 범주가 아닌 투자 논제입니다. 기사에는 기업이 일부 AI 에이전트 배포를 줄이거나 폐기하는 것에 대한 KPMG와 Gartner의 기대가 언급되어 있지만 이는 현재 결과에 대한 증거라기보다는 예측일 뿐입니다. 가장 의미 있는 대중적 영향은 자율 시스템이 선택된 성공 사례보다는 다양한 고객에 대해 신뢰할 수 있는 결과, 투명한 기록 및 명확한 책임을 보여줄 수 있는지 여부에 달려 있습니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

다음에 무엇을 볼 것인가

주요 테스트는 완료된 작업, 보안 결과, 오류율, 비용 및 사람의 감독에 대한 독립적인 평가입니다. 기업이 시스템 작업을 문서화하고 자율 도구에서 실수가 발생할 경우 책임을 안정적으로 할당할 수 있는지 확인하세요.

첫째, 성능 주장 뒤에 숨은 독립적인 증거를 살펴보십시오. Blitzy의 경우 여기에는 평가된 프로젝트에 대한 세부 정보, "3배" 개발 속도의 정의, 결함 및 보안 비율, 인적 검토의 양, 결과 시스템이 배포 후에도 유지 관리 가능한 상태로 유지되는지 여부가 포함됩니다. 고객 증언을 통해 시스템이 사용되었다는 사실을 확인할 수 있지만 그 자체로 일반적인 신뢰성을 확립할 수는 없습니다. Forbes는 고객의 주장을 보고하지만 제공된 자료는 이를 독립적으로 확인하지 않습니다.

XBOW 및 관련 보안 시스템의 경우 유용한 후속 조치에는 공개된 취약성, 재현성, 위양성 및 위음성 비율, 승인된 테스트 범위, 발견과 교정 사이의 시간이 포함됩니다. OpenAI의 Aardvark에 대해 보고된 92% 벤치마크 결과에는 벤치마크 설계, "알려진 결함"의 의미, 시스템이 인간 또는 자동화된 기준과 비교되는 방식에 대한 컨텍스트도 필요합니다. 이러한 세부 정보가 없으면 리더보드 배치 및 벤치마크 비율을 실제 보안 성능에 대한 일반적인 척도로 간주해서는 안 됩니다.

마지막으로, 이러한 도구를 채택하는 조직에는 자율성과 일치하는 거버넌스가 필요합니다. Forbes 자체는 거버넌스 격차에 대한 우려를 보고하고 기업이 자율 시스템에 목표를 위임하기 전에 감사 추적 및 명확한 책임을 권장합니다. 배포 시 영향이 큰 작업에 대한 사람의 승인을 유지하고, 모델 및 도구 활동을 기록하고, 민감한 시스템에 대한 액세스를 제한하고, 작업 실패 시 책임 있는 운영자를 제공하는지 살펴보세요. 자율 AI와 인공 일반 지능에 대한 기사의 장기적인 예측은 여전히 ​​불확실합니다. 단기적인 증거는 문서화된 배포, 반복 가능한 평가 및 공개적으로 설명 가능한 결과에서 나와야 합니다.

관련 가이드 및 퀴즈

AI 에이전트AI 모델 설명AI 윤리AI 트레이닝알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 자금 추적기를 팔로우하세요
이것이 유용하다고 생각하시나요?