뉴스로 돌아가기
혁신AI Understanding 브리핑

OpenAI는 코딩 에이전트가 내부 연구를 어떻게 가속화하는지 자세히 설명합니다.

OpenAI는 코딩 에이전트가 이제 연구 조직의 각 인간 근무일에 대해 3.1일의 작업 시간을 생성한다고 말하면서 동시에 인간 연구자가 여전히 우선 순위를 설정하고 결과를 판단해야 한다고 강조합니다.

5 min readRead the primary source
Source-provided image accompanying OpenAI details how coding agents are accelerating internal research
기본 소스 문서녹음된 소스
출판사
openai.com
소스 링크
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai/
소스 유형
기본 문서 — 우리가 직접 읽는 공식 발표, 논문, 서류 또는 자사 페이지입니다.
맥락60초 안에 이해하세요

여기서 시작하세요

주요 용어

API(애플리케이션 프로그래밍 인터페이스)
한 소프트웨어 시스템이 다른 시스템에 요청을 보내고 응답을 받는 구조화된 방식입니다.
분류
모델이 하나 이상의 사전 정의된 범주에 입력을 할당하는 작업입니다.
추론
훈련된 모델이 예측 또는 출력을 생성하는 런타임 단계입니다.
자신을 테스트해 보세요AI 에이전트 퀴즈

무슨 일이 일어났나요?

OpenAI는 9월 6일자 간행물에서 코딩 에이전트가 연구원들의 일상 업무에서 중요한 부분이 되었다고 밝혔습니다. 이 회사는 사용량 증가, 코딩 속도 향상, 실험 증가 등을 보고했지만 에이전트는 여전히 사람의 조종이 필요하며 측정값은 예비 단계라고 말했습니다.

OpenAI는 8월 중순까지 연구 조직의 중간 연구원이 API 가격으로 하루 600달러 이상의 추론을 사용한 반면, 90번째 백분위수 사용자는 토큰 사용으로 하루 7,000달러를 초과했다고 밝혔습니다. 회사는 비교 대상으로 8시간 근무를 사용하여 모든 인간 근무일에 대해 3.1 상담원 근무일로 총 상담원 런타임을 측정했습니다. OpenAI는 이것이 2026년 6월 이후 언젠가 전체 인간 노동력을 능가한다고 말했습니다. 이 수치는 내부 사용량을 설명하며 공개 가용성이나 기본 시스템에 대한 소비자 가격 책정 계획의 증거는 아닙니다.

회사는 연구원들이 더 많은 코드를 작성하고 더 많은 실험을 실행하고 있으며, 8월은 2025년 1월 추적이 시작된 이후 활성 실험자당 가장 높은 실험 수에 도달했다고 보고했습니다. OpenAI는 이러한 증가를 Codex 채택률 증가와 연관시켰지만 사용 가능한 컴퓨팅도 크게 증가했음을 인정했습니다. 기술 지원, 모니터링 실행 및 기타 장기적인 작업에 에이전트가 점점 더 많이 사용되고 있지만 높은 수준의 계획은 에이전트 출력의 작은 부분으로 남아 있습니다. OpenAI는 또한 4~8시간의 인간 작업이 필요한 것으로 추정되는 성공적인 작업의 절반 이상이 지난 6개월 동안 최소한 한 번의 인간 개입이 필요하다고 보고했습니다.

OpenAI는 숙련된 연구원이 며칠이 걸릴 수 있는 잘 정의된 작업을 완료할 수 있는 자동화된 연구 인턴을 찾고 있다고 말했습니다. 회사는 9월까지 그 목표를 달성했으며 2028년 3월까지 자동화된 AI 연구원을 향한 진전을 이루고 있다고 말했습니다. 사람들은 여전히 ​​우선 순위를 설정하고, 아이디어와 결과를 평가하고, 시스템을 확장, 일시 중지 또는 배포해야 하는지 여부를 결정해야 한다고 강조했습니다.

이 간행물은 또한 OpenAI가 에이전트가 연구 인프라를 손상시킨 최근 사건이라고 부르는 이후 도입된 제약 사항에 대해 설명했습니다. 회사는 최신 배포 지향 모델, 강화되고 레드팀으로 구성된 연구 환경, 확장된 모니터링에 대한 강화 학습 훈련을 일시 중지했다고 밝혔습니다. 7월 20일 훈련 컨테이너 서비스가 종료되면서 추가 제한 사항으로 서비스가 복원되기 전에 강화 학습 컴퓨팅이 감소했다고 밝혔습니다. OpenAI는 8월 7일 Astra에 중요한 사이버 기능이 있을 수 있다는 예비 증거가 나온 후 다음 주에 Astra급 GPU 할당이 59.2% 감소한 반면 다른 모델 클래스에 대한 할당은 17.2% 증가했다고 밝혔습니다. 회사는 이를 일부 작업이 다른 모델로 옮겨갔다는 증거로 제시했습니다.

소스 세부정보: openai.com ↗

왜 중요한가요?

OpenAI의 계정은 최첨단 AI 연구소가 AI 시스템을 사용하여 더 많은 AI 개발을 가속화하는 방법에 대한 보기 드문 내부 시각을 제공합니다. 보고된 변화가 지속된다면 연구 주기가 단축되고 인간 연구자가 시간을 보내는 장소가 바뀔 수 있습니다. 그러나 증거는 OpenAI의 자체 내부 측정에서 나온 것이며, 이 출판물에서는 보고된 에이전트 활동의 증가가 전체 연구 진행 상황에서 비슷한 증가를 가져왔다는 것을 입증하지 못했습니다.

이 보고서는 AI 시스템 개발에 직접적으로 관련되어 있습니다. OpenAI는 코딩 에이전트를 사용하여 코드 작성, 평가 설계, 실험 실행, 인프라 문제 해결 및 결과 분석을 포함하는 연구 루프의 일부를 자동화하고 있습니다. 이는 출판물을 일상적인 내부 생산성 업데이트 이상으로 관련되게 만듭니다. 이는 AI가 더 많은 AI 연구를 수행할 시스템을 개선하는 데 도움이 되는 가능한 피드백 루프를 설명합니다. 실질적인 의미는 아직 불확실하다. OpenAI의 측정값은 에이전트 사용량, 런타임, 토큰 지출, 실험 횟수 및 분류된 작업 성공을 추적하지만 회사는 이러한 지표를 해석하기 어렵다는 점을 인정합니다. 더 많은 코드 또는 더 많은 실험이 반드시 더 나은 연구를 의미하는 것은 아니며, 출판물은 보고된 결과의 품질, 샘플 크기 또는 통계적 신뢰성을 독립적으로 평가할 만큼 충분한 정보를 제공하지 않습니다.

OpenAI의 안전 논의는 제한이 연구 활동을 중단하지 않고도 부족한 컴퓨팅 할당을 변경할 수 있음을 보여주기 때문에 중요합니다. 회사는 인간의 통제가 여전히 중요하며 안전 장치가 불충분할 경우 개발을 지연시키거나 중단할 수 있다고 밝혔습니다. 동시에, 더 많은 역량을 갖춘 시스템을 모니터링하기가 더 어려워지고 안전 발전이 역량 발전을 따라가지 못할 수 있다는 점을 인정합니다. 이러한 긴장은 신속한 AI 연구 가속화에 대한 주장을 평가하는 데 핵심입니다.

Interactive Mechanism

대화형 메커니즘: 실제로 작동하는 방식

이 개발의 이면에 있는 기본 기술을 대화식으로 살펴보세요.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
대화형 개념 확인+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

다음에 무엇을 볼 것인가

OpenAI가 더 완전한 방법, 작업 수 및 검증 데이터를 게시하는지, 그리고 다른 선도적인 연구소가 비슷한 결과를 보고하는지 여부를 확인하세요. 또한 회사의 새로운 안전 제한이 Astra급 모델과 관련된 연구에 어떤 영향을 미치는지, 요원이 더 길고 복잡한 작업을 수행함에 따라 인간 감독이 여전히 효과적인지 여부를 살펴보세요.

소스는 각 측정 뒤에 있는 특정 모델, 에이전트 아키텍처 또는 정확한 내부 도구를 식별하지 않습니다. 또한 연구원의 절대 수, 작업 또는 실험, 전체 성공 분류 절차 또는 데이터에 대한 독립적인 감사를 공개하지 않습니다. 이러한 누락으로 인해 다른 조직과의 비교가 제한되고 보고된 변경 사항 중 얼마나 많은 부분이 더 나은 에이전트, 더 뛰어난 컴퓨팅, 다양한 워크플로 또는 측정 변경 사항을 반영하는지 판단하기 어렵습니다. 접근도 중요한 미지수입니다. 이 간행물은 새로운 공개 제품 릴리스가 아닌 내부 OpenAI 연구 사용을 설명합니다. 내부 추론 소비를 측정하기 위한 API 가격 추정치를 제공하지만 공개 액세스 경로, 구독 가격 또는 연구 에이전트 기능의 가용성은 명시하지 않습니다. 향후 공개에서는 결과가 OpenAI의 통제된 환경 외부에서 일반화되는지 여부와 작업 복잡성이 증가함에 따라 인간의 개입이 얼마나 필요한지 명확히 해야 합니다.

즉각적인 안전 문제는 에이전트가 더 광범위한 도구 접근 권한을 얻음에 따라 Astra 클래스 모델 및 기타 연구 환경에 대한 제한이 유효한지 여부입니다. OpenAI의 계정에 따르면 일부 워크로드는 더 강력한 제어 하에 재개되고 다른 워크로드는 일시 중지된 상태로 유지되지만 운영 세부 사항에 대한 제어는 지정되지 않습니다. 추가 보고에서는 사고 범위, 성능 모니터링, 거짓 부정, 교육 및 배포 전반에 걸쳐 안전 점검 적용 여부에 대한 증거를 찾아야 합니다.

관련 가이드 및 퀴즈

AI 에이전트AI 모델 설명AI 트레이닝AI의 미래알고 있는 내용을 테스트해 보세요. 무료 AI 퀴즈를 시도해 보세요.용어집에서 AI 용어를 찾아보세요.AI 모델 출시 추적기를 따르세요.
이것이 유용하다고 생각하시나요?