Вернуться к новостям
ИнновацииAI Understanding брифинг

OpenAI заявляет, что агенты кодирования теперь превосходят человеческий исследовательский труд в ее лабораториях

OpenAI сообщает, что к середине августа ее исследователи использовали 3,1 рабочего дня агента на каждый рабочий день человека, предупреждая при этом, что внутренние показатели являются предварительными и не позволяют напрямую измерять общий прогресс исследований.

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
ПервоисточникИсточник записан
Издатель
openai.com
Ссылка на источник
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Вывод
Фаза выполнения, на которой обученная модель генерирует прогнозы или выходные данные.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

OpenAI опубликовала внутреннюю информацию о том, как ее исследовательская организация использует агенты кодирования. Компания заявляет, что достигла своей заявленной цели — создать «автоматизированного исследовательского стажера»: систему, способную выполнять четко определенные исследовательские задачи под руководством человека, включая задачи, которые у опытного исследователя могут занять несколько дней. OpenAI заявляет, что планирует создать автоматизированного исследователя искусственного интеллекта к марту 2028 года. Согласно измерениям компании, использование агентов резко возросло в течение 2026 года. К середине августа медианный исследователь использовал агенты кодирования ежедневно по цене более 600 долларов США в день, рассчитанной по ценам API, в то время как пользователь 90-го процентиля превысил 7000 долларов США в день. По данным OpenAI, в исследовательской организации время работы агентов достигло 3,1 стандартных восьмичасовых рабочих дней агента на каждый рабочий день человека. OpenAI также сообщает о большем количестве экспериментов на одного активного экспериментатора, растущем использовании агентов для задач более высокого уровня и более долгосрочных задач и общем повышении показателей успеха с января по июль для задач с известным результатом. Однако более половины успешных задач, которые, по оценкам, требуют четырех-восьми часов человеческой работы, включали как минимум одно вмешательство человека в течение предыдущих шести месяцев. В отчете они описаны как собственные предварительные измерения и внутренние впечатления OpenAI. В нем не установлено, что агенты вызвали все наблюдаемые увеличения результатов исследований: компания утверждает, что доступные вычислительные ресурсы также значительно выросли, и что такие узкие места, как вычисления, выбор задач, оценка, проверки безопасности и интеграция в основные учебные программы, могут ограничить общий прогресс.

OpenAI сообщает, что ее исследователи теперь используют агенты кодирования в течение дня, часто в одновременных сеансах, и это использование растет быстрее, чем в других командах OpenAI. Компания сообщает, что средний исследователь перешел от умеренного использования в начале 2026 года к ежедневному использованию к середине августа. Он дает оценку внутренних расходов в размере более 600 долларов США в день по ценам API для медианного исследователя и более 7000 долларов США в день для пользователя 90-го процентиля. Это не цены, предлагаемые публике за автоматизированного исследователя.

Компания измеряет общее время работы агентов по сравнению с человеческим трудом, используя стандартные восьмичасовые рабочие дни. В нем говорится, что до июня 2026 года общее время работы агентов было ниже общего человеческого труда, но к середине августа исследовательская организация использовала 3,1 рабочего дня агента на каждый рабочий день человека. Измерение включает в себя агентов, запущенных непосредственно исследователями, и нижестоящих субагентов.

OpenAI сообщает, что деятельность агента расширилась на шесть этапов его таксономии исследований и разработок в области ИИ: принятие решений, проектирование, создание, запуск, анализ и общение. Исследовательский и инфраструктурный код оставался доминирующей категорией, в то время как количество технической помощи и мониторинга заметно возросло. Планирование высокого уровня оставалось лишь небольшой частью жетонов результатов деятельности агентов. OpenAI говорит, что агенты были особенно полезны для устранения неполадок внутренней исследовательской инфраструктуры, что совпало с меньшей посещаемостью некоторых сеансов технической поддержки, проводимых людьми.

В отчете говорится, что успешность задач агентов-кодировщиков обычно увеличивалась с января по июль в течение нескольких предполагаемых периодов человеческого времени, но агентам по-прежнему требовалось существенное управление, поскольку задачи становились более сложными. Более половины успешных задач продолжительностью от четырех до восьми часов включали одно или несколько вмешательств в предыдущие шесть месяцев. OpenAI также сообщает, что приостановила обучение с подкреплением для некоторых последних моделей развертывания после недавнего инцидента в инфраструктуре, восстановила некоторые рабочие нагрузки с более строгими ограничениями и наложила дополнительные ограничения на эксперименты класса Astra после предварительных доказательств критических кибервозможностей. В отчете сообщается, что на следующей неделе распределение графических процессоров класса Astra упало на 59,2%, в то время как другие классы моделей выросли на 17,2%, что компенсировало примерно 85% снижения.

Подробности об источнике: openai.com ↗

Почему это важно

В докладе представлен необычайно конкретный взгляд на то, как передовая лаборатория ИИ включает системы ИИ в работу по разработке более мощного ИИ. Если эта тенденция распространится, агенты кодирования могут отвлечь время исследователей от рутинной реализации и устранения неполадок инфраструктуры в сторону задач, которые по-прежнему сложнее автоматизировать, что потенциально сократит части цикла разработки модели. Но доказательства генерируются компаниями, являются предварительными и сосредоточены на отдельных операционных показателях, а не на независимо проверенных достижениях в научном качестве или возможностях модели.

Отчет важен, поскольку системы ИИ используются в процессе создания будущих систем ИИ, а не просто помогают в рутинной офисной работе. Цифры OpenAI показывают, что возможности агентов становятся значимой частью внутренних исследовательских операций, при этом одновременное выполнение и более высокая сложность задач меняют то, как исследователи распределяют свое время.

Практическое значение неоднозначно. Агенты могут сократить задержки, вызванные кодированием, отладкой инфраструктуры и постановкой экспериментов, что позволит исследователям проводить больше испытаний. В то же время более быстрое выполнение может сделать оценку, мониторинг и анализ безопасности более важными, поскольку ошибки могут возникать и распространяться быстрее. Сам OpenAI утверждает, что прогресс по конкретным показателям не обязательно будет соответствовать тем же темпам общего прогресса исследований.

В докладе также говорится, что человеческий контроль является центральным условием. OpenAI говорит, что люди по-прежнему расставляют приоритеты, решают, какие идеи и результаты следует преследовать, и решают, следует ли масштабировать, приостанавливать или развертывать системы. Он признает, что прогресс в согласовании и безопасности может не идти в ногу с развитием возможностей и что более функциональные системы может стать труднее контролировать.

В источнике не содержится никаких независимых исследований, публичных эталонов или внешнего аудита. Таким образом, сообщаемые данные о расходах, времени выполнения, успешности выполнения задач и вмешательствах следует рассматривать как заявления OpenAI о своей собственной организации, а не как установленное свидетельство того, что исследования ИИ были ускорены на определенную измеренную величину.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Ключевой вопрос заключается в том, приводит ли более широкое использование агентов к долгосрочным, независимо измеримым улучшениям качества исследований, безопасности и скорости разработки моделей. Следите за более четкими определениями успеха задачи, внешней проверкой, свидетельствами об ошибках и скрытом человеческом труде, а также за тем, перемещаются ли оставшиеся узкие места в сторону вычислений, оценки, согласования или принятия решений. OpenAI не задокументировал публичный доступ к этим внутренним рабочим процессам или какой-либо связанной с ними цене, и в отчете не указано, что доступен автоматизированный исследователь общего назначения.

OpenAI утверждает, что его методы измерения все еще развиваются. Будущие раскрытия должны прояснить, как отбираются задачи, как проверяется успех, как обрабатываются неопределенные результаты и как код или эксперименты, сгенерированные агентом, отличаются от работы, которая в противном случае была бы выполнена людьми.

Самым важным недостающим доказательством является то, дает ли работа с помощью агентов лучшие результаты исследований, а не просто больше кода, экспериментов или токенов. Полезные данные последующего наблюдения будут включать воспроизводимые примеры, частоту ошибок, переработку, неудачные эксперименты, выводы о безопасности и объем человеческого анализа, необходимый на каждом этапе.

В отчете не говорится, что автоматизированный исследовательский стажер является общедоступным продуктом. В нем также не указаны цены для потребителей или предприятий, требования к развертыванию, критерии приемлемости или дата выпуска. Поэтому доступ и цены неизвестны.

OpenAI заявляет, что продолжит сообщать о прогрессе в области автоматизированных исследований в области искусственного интеллекта, одновременно защищая безопасность и конфиденциальную информацию. Будущие раскрытия информации покажут, какую часть заявленного ускорения можно оценить независимо и как ограничения на исследования влияют на распределение доступных вычислительных ресурсов.

Сопутствующие руководства и викторины

ИИ-агентыОбучение искусственному интеллектуОбъяснение моделей искусственного интеллектаБудущее ИИПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?