무슨 일이 일어났나요?
OpenAI는 연구 조직에서 코딩 에이전트가 어떻게 사용되는지에 대한 내부 스냅샷을 게시했습니다. 회사는 "자동화된 연구 인턴"이라는 명시된 목표를 달성했다고 밝혔습니다. 숙련된 연구원이 며칠이 걸릴 수 있는 작업을 포함하여 인간의 지시에 따라 잘 정의된 연구 작업을 수행할 수 있는 시스템입니다. OpenAI는 2028년 3월까지 자동화된 AI 연구원을 목표로 삼고 있다고 밝혔습니다. 회사의 측정에 따르면 에이전트 사용은 2026년에 급격히 증가했습니다. 8월 중순까지 중앙 연구원은 API 가격으로 계산된 추론에서 하루 $600 이상의 코딩 에이전트를 사용했으며 90번째 백분위수 사용자는 하루 $7,000를 초과했습니다. OpenAI는 연구 조직 전체에서 에이전트 런타임이 모든 인간 근무일에 대해 표준 8시간 에이전트 근무일 3.1에 도달했다고 말합니다. OpenAI는 또한 활성 실험자당 더 많은 실험을 보고하고, 더 높은 수준 및 더 긴 범위의 작업에 대한 에이전트 사용이 증가하고, 알려진 결과가 있는 작업에 대해 1월부터 7월까지 일반적으로 성공률이 향상된다고 보고합니다. 그러나 4~8시간의 인간 작업이 필요한 것으로 추정되는 성공적인 작업의 절반 이상이 지난 6개월 동안 최소한 한 번의 인간 개입이 필요했습니다. 보고서는 이를 OpenAI 자체의 예비 측정 및 내부 인상으로 설명합니다. 연구 결과에서 관찰된 모든 증가를 에이전트가 유발했다는 사실은 입증되지 않았습니다. 회사에서는 사용 가능한 컴퓨팅도 크게 증가했으며 컴퓨팅, 작업 선택, 평가, 안전 확인 및 핵심 교육 실행과의 통합과 같은 병목 현상이 전반적인 진행을 제한할 수 있다고 밝혔습니다.
OpenAI는 현재 연구원들이 하루 종일 코딩 에이전트를 동시 세션으로 사용하고 있으며 사용량이 다른 OpenAI 팀보다 빠르게 증가하고 있다고 말합니다. 회사는 중앙값 연구원이 2026년 초 적당한 사용에서 8월 중순까지 매일 사용으로 전환했다고 보고했습니다. 중간 연구원의 경우 API 가격 추론을 통해 하루 600달러 이상, 90번째 백분위수 사용자의 경우 하루 7,000달러 이상의 내부 지출 추정치를 제공합니다. 이는 자동화된 연구자에게 대중에게 제공되는 가격이 아닙니다.
회사는 표준 8시간 근무일을 사용하여 인간 노동에 대한 총 상담사 실행 시간을 측정합니다. 2026년 6월 이전에는 총 에이전트 실행 시간이 총 인간 노동력보다 낮았지만 8월 중순까지 연구 조직은 인간 작업일당 3.1 에이전트 작업일을 사용했습니다. 측정에는 연구원과 다운스트림 하위 에이전트가 직접 시작한 에이전트가 포함됩니다.
OpenAI는 에이전트 활동이 AI 연구 및 개발 분류의 6단계(결정, 설계, 구축, 실행, 분석 및 통신)에 걸쳐 확장되었다고 말합니다. 연구 및 인프라 코드는 여전히 지배적인 범주로 남아 있는 반면, 기술 지원 및 모니터링 실행은 눈에 띄게 증가했습니다. 높은 수준의 계획은 에이전트 출력 토큰의 작은 부분으로 남아 있습니다. OpenAI는 상담원이 내부 연구 인프라 문제를 해결하는 데 특히 유용했으며 일부 인력이 운영하는 기술 지원 세션의 출석률이 낮았다고 말합니다.
보고서에 따르면 코딩 에이전트 작업 성공률은 일반적으로 여러 추정 인간 시간 버킷에서 1월부터 7월까지 증가했지만 작업이 더욱 복잡해짐에 따라 에이전트는 여전히 상당한 조정이 필요했습니다. 성공적인 4~8시간 작업의 절반 이상이 지난 6개월 동안 하나 이상의 개입과 관련되었습니다. OpenAI는 또한 최근 인프라 사고 이후 일부 최신 배포 모델에 대한 강화 학습 훈련을 일시 중지하고, 더 강력한 제한에 따라 일부 작업 부하를 복원했으며, 중요한 사이버 능력에 대한 예비 증거가 나온 후 Astra급 실험에 추가 제한을 가했다고 밝혔습니다. Astra 클래스 GPU 할당은 다음 주에 59.2% 감소한 반면 다른 모델 클래스는 17.2% 증가하여 감소의 약 85%를 상쇄했다고 보고합니다.
왜 중요한가요?
이 보고서는 첨단 AI 연구소가 AI 시스템을 보다 유능한 AI 개발 작업에 어떻게 통합하고 있는지에 대한 매우 구체적인 관점을 제공합니다. 추세가 일반화되면 코딩 에이전트는 연구원의 시간을 일상적인 구현 및 인프라 문제 해결에서 자동화하기 어려운 작업으로 전환하여 잠재적으로 모델 개발 주기의 일부를 단축할 수 있습니다. 그러나 증거는 과학적 품질이나 모델 역량에서 독립적으로 검증된 이득보다는 회사에서 생성된 예비적이며 선택된 운영 지표에 초점을 맞춘 것입니다.
이 보고서가 중요한 이유는 AI 시스템이 단순히 일상적인 사무를 지원하는 것이 아니라 미래 AI 시스템을 생산하는 프로세스에 사용되고 있기 때문입니다. OpenAI의 수치는 동시 실행 및 높은 작업 복잡성으로 인해 연구자가 시간을 할당하는 방식을 변화시키면서 에이전트 용량이 내부 연구 운영에서 의미 있는 부분이 되고 있음을 시사합니다.
실제적인 의미는 혼합되어 있습니다. 에이전트는 코딩, 인프라 디버깅 및 실험 설정으로 인한 지연을 줄여 연구자가 더 많은 시험을 실행할 수 있도록 할 수 있습니다. 동시에 실행 속도가 빨라지면 오류가 더 빠르게 생성되고 전파될 수 있으므로 평가, 모니터링 및 안전 검토가 더욱 중요해질 수 있습니다. OpenAI 자체는 특정 지표의 진전이 반드시 전체 연구 진행의 동일한 속도와 같지는 않다고 말합니다.
보고서는 또한 인간의 통제를 핵심 조건으로 삼고 있습니다. OpenAI는 사람들이 여전히 우선순위를 설정하고, 어떤 아이디어와 결과를 추구할지 판단하고, 시스템 확장, 일시 중지 또는 배포 여부를 결정한다고 말합니다. 이는 정렬 및 안전 진행이 기능 진행과 보조를 맞추지 못할 수 있으며 더 많은 기능을 갖춘 시스템을 모니터링하기가 더 어려워질 수 있다는 점을 인정합니다.
독립적인 연구, 공개 벤치마크 또는 외부 감사는 소스에서 제공되지 않습니다. 따라서 보고된 지출, 런타임, 작업 성공 및 개입 수치는 AI 연구가 특정 측정 금액만큼 가속화되었다는 확립된 증거가 아니라 자체 조직에 대한 OpenAI의 주장으로 처리되어야 합니다.
대화형 메커니즘: 실제로 작동하는 방식
이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
다음에 무엇을 볼 것인가
핵심 질문은 더 높은 에이전트 사용량이 연구 품질, 안전성 및 모델 개발 속도에서 지속적이고 독립적으로 측정 가능한 개선으로 이어지는지 여부입니다. 작업 성공, 외부 검증, 오류 및 숨겨진 인간 노동에 대한 증거, 그리고 나머지 병목 현상이 컴퓨팅, 평가, 정렬 또는 의사 결정으로 이동하는지 여부에 대한 보다 명확한 정의를 살펴보세요. OpenAI는 이러한 내부 워크플로 또는 관련 가격에 대한 공개 액세스를 문서화하지 않았으며 보고서에는 범용 자동화 연구원을 사용할 수 있음이 표시되지 않습니다.
OpenAI는 측정 방법이 계속 발전하고 있다고 말합니다. 향후 공개에서는 작업을 샘플링하는 방법, 성공을 확인하는 방법, 불확실한 결과를 처리하는 방법, 에이전트 생성 코드 또는 실험을 인간이 수행했을 작업과 구별하는 방법을 명확히 해야 합니다.
누락된 가장 중요한 증거는 에이전트 지원 작업이 단순히 더 많은 코드, 실험 또는 토큰을 생성하는 것이 아니라 더 나은 연구 결과를 생성하는지 여부입니다. 유용한 후속 증거에는 재현 가능한 사례, 오류율, 재작업, 실패한 실험, 안전성 발견 및 각 단계에서 필요한 인적 검토의 양이 포함됩니다.
보고서에는 자동화된 연구 인턴이 공개적으로 접근 가능한 제품이라고 명시되어 있지 않습니다. 또한 소비자 또는 기업 가격, 배포 요구 사항, 자격 기준 또는 출시 날짜도 제공하지 않습니다. 따라서 액세스 및 가격은 알 수 없습니다.
OpenAI는 보안 및 독점 정보를 보호하면서 자동화된 AI 연구에 대한 진행 상황을 계속 보고할 것이라고 밝혔습니다. 향후 공개에서는 보고된 가속화 중 어느 정도를 독립적으로 평가할 수 있는지, 연구 제한이 사용 가능한 컴퓨팅 배포에 어떤 영향을 미치는지 보여줄 것입니다.