Що сталося
OpenAI опублікував внутрішній знімок того, як дослідницька організація використовує агенти кодування. Компанія заявляє, що досягла своєї заявленої мети «автоматизованого дослідника-стажера»: система, здатна виконувати чітко визначені дослідницькі завдання під керівництвом людини, включно з завданнями, які можуть зайняти у досвідченого дослідника кілька днів. OpenAI каже, що націлена на автоматизованого дослідника штучного інтелекту до березня 2028 року. Згідно з вимірюваннями компанії, використання агентів різко зросло протягом 2026 року. До середини серпня середній дослідник щодня використовував агенти кодування на суму понад 600 доларів США на день у висновках, розрахованих за цінами API, тоді як 90-процентильний користувач перевищував 7000 доларів США на день. У дослідницькій організації OpenAI каже, що час роботи агента досяг 3,1 стандартних восьмигодинних робочих днів агента на кожен робочий день людини. OpenAI також повідомляє про збільшення кількості експериментів на одного активного експериментатора, зростання використання агентів для завдань вищого рівня та довгострокових завдань і загальне покращення показників успішності завдань із відомим результатом із січня по липень. Однак більше половини успішних завдань, які, за оцінками, вимагали від чотирьох до восьми годин людської роботи, передбачали принаймні одне втручання людини протягом попередніх шести місяців. У звіті це описується як власні попередні вимірювання та внутрішні враження OpenAI. Це не встановлює, що агенти спричинили всі спостережувані збільшення результатів досліджень: компанія каже, що доступні обчислення також значно зросли, і що вузькі місця, такі як обчислення, вибір завдань, оцінка, перевірки безпеки та інтеграція в основні тренування, можуть обмежити загальний прогрес.
OpenAI каже, що його дослідники тепер використовують агенти кодування протягом дня, часто під час одночасних сеансів, і це використання зростає швидше, ніж в інших командах OpenAI. Компанія повідомляє, що середній дослідник перейшов від скромного використання на початку 2026 року до щоденного використання до середини серпня. Він дає оцінку внутрішніх витрат понад 600 доларів США на день у висновку за цінами API для медіанного дослідника та понад 7000 доларів США на день для 90-процентильного користувача. Це не ціни, які пропонуються громадськості для автоматизованого дослідника.
Компанія вимірює загальний час роботи агента порівняно з людською працею, використовуючи стандартний восьмигодинний робочий день. У ньому йдеться, що до червня 2026 року загальний час роботи агента був нижчим за загальну людську працю, але до середини серпня дослідницька організація використовувала 3,1 робочих дня агента на кожен робочий день людини. Вимірювання включає агентів, запущених безпосередньо дослідниками, і наступних субагентів.
OpenAI каже, що діяльність агента поширюється на шість етапів його таксономії досліджень і розробок ШІ: прийняття рішень, проектування, створення, запуск, аналіз і спілкування. Код дослідження та інфраструктури залишався домінуючою категорією, тоді як кількість технічної допомоги та моніторингу помітно зросла. Планування високого рівня залишалося невеликою частиною вихідних токенів агента. OpenAI каже, що агенти були особливо корисні для усунення несправностей внутрішньої дослідницької інфраструктури, що збіглося з меншою відвідуваністю деяких сеансів технічної підтримки, керованих людьми.
У звіті говориться, що успішність виконання завдань агента кодування загалом зросла з січня по липень за кілька передбачуваних періодів людського часу, але агенти все ще потребували значного керування, оскільки завдання ставали складнішими. Більше половини успішних чотирьох-восьмигодинних завдань передбачали одне або більше втручань протягом попередніх шести місяців. OpenAI також повідомляє, що після нещодавнього інциденту з інфраструктурою призупинив тренінги з посилення навчання на деяких найновіших моделях розгортання, відновив деякі робочі навантаження під сильнішими обмеженнями та наклав додаткові обмеження на експерименти класу Astra після попередніх доказів критичних кіберможливостей. У ньому повідомляється, що наступного тижня розподіл GPU для класу Astra впав на 59,2%, тоді як інші класи моделей зросли на 17,2%, компенсувавши приблизно 85% падіння.
Чому це важливо
Звіт пропонує надзвичайно конкретний погляд на те, як передова лабораторія штучного інтелекту використовує системи штучного інтелекту в роботі з розробки більш ефективного штучного інтелекту. Якщо тенденція узагальниться, кодуючі агенти можуть перемістити час дослідників від рутинного впровадження та усунення несправностей інфраструктури до завдань, які все ще важче автоматизувати, потенційно скорочуючи частини циклу розробки моделі. Але докази створюються компанією, є попередніми та зосереджені на вибраних операційних показниках, а не на незалежно перевірених досягненнях наукової якості чи можливості моделі.
Звіт має значення, оскільки системи штучного інтелекту використовуються в процесі створення майбутніх систем штучного інтелекту, а не просто допомагають у рутинній офісній роботі. Цифри OpenAI свідчать про те, що потенціал агента стає важливою частиною внутрішніх дослідницьких операцій, а паралельне виконання та вища складність завдань змінюють спосіб розподілу часу дослідниками.
Практичні наслідки неоднозначні. Агенти можуть зменшити затримки, спричинені кодуванням, налагодженням інфраструктури та налаштуванням експерименту, дозволяючи дослідникам проводити більше випробувань. У той же час швидше виконання може зробити оцінку, моніторинг і перевірку безпеки більш важливими, оскільки помилки можуть виникати та поширюватися швидше. Сам OpenAI каже, що прогрес у конкретних показниках не обов’язково буде таким же темпом, як і загальний прогрес дослідження.
У звіті головною умовою є контроль людини. OpenAI каже, що люди все ще встановлюють пріоритети, оцінюють, які ідеї та результати слід реалізувати, і вирішують, чи масштабувати, призупиняти чи розгортати системи. Він визнає, що прогрес у вирівнюванні та безпеці може не встигати за прогресом у можливостях і що більш потужні системи може стати важче контролювати.
Джерело не містить жодних незалежних досліджень, публічних порівняльних показників чи зовнішнього аудиту. Таким чином, звітні дані про витрати, час виконання, успішність завдань і втручання слід розглядати як заяви OpenAI про його власну організацію, а не як встановлені докази того, що дослідження штучного інтелекту було прискорено на певну виміряну величину.
Інтерактивний механізм: як він насправді працює
Дослідіть технологію, що лежить в основі цієї розробки, в інтерактивному режимі.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Що дивитися далі
Ключове питання полягає в тому, чи більше використання агентів перетворюється на стійке, незалежно виміряне покращення якості дослідження, безпеки та швидкості розробки моделі. Слідкуйте за більш чіткими визначеннями успіху завдання, зовнішнім підтвердженням, доказами помилок і прихованої людської праці, а також за тим, чи переміщаються вузькі місця, що залишилися, до обчислень, оцінки, узгодження чи прийняття рішень. OpenAI не задокументував публічний доступ до цих внутрішніх робочих процесів або будь-якої пов’язаної ціни, і звіт не показує, що доступний автоматизований дослідник загального призначення.
OpenAI каже, що його методи вимірювання все ще розвиваються. Майбутнє розкриття інформації має прояснити, як відбираються завдання, як перевіряється успіх, як обробляються невизначені результати та як код або експерименти, створені агентами, відрізняються від роботи, яку в іншому випадку виконували б люди.
Найважливіший відсутній доказ полягає в тому, чи дає робота за допомогою агентів кращі результати досліджень, а не просто більше коду, експериментів чи токенів. Корисні подальші докази включатимуть відтворювані приклади, частоту помилок, переробку, невдалі експерименти, висновки щодо безпеки та кількість людських перевірок, необхідних на кожному етапі.
У звіті не зазначено, що автоматизований стажер-дослідник є загальнодоступним продуктом. Він також не містить споживчу або корпоративну ціну, вимоги до розгортання, критерії прийнятності або дату випуску. Тому доступ і ціна невідомі.
OpenAI каже, що продовжуватиме звітувати про прогрес у автоматизованому дослідженні штучного інтелекту, одночасно захищаючи безпеку та конфіденційну інформацію. Його майбутні розкриття покажуть, яку частину повідомленого прискорення можна оцінити незалежно та як обмеження дослідження впливають на розподіл доступних обчислень.