Kembali ke Berita
InovasiAI Understanding taklimat

OpenAI berkata ejen pengekodan kini melebihi buruh penyelidikan manusia di makmalnya

OpenAI melaporkan bahawa penyelidiknya menggunakan 3.1 hari kerja ejen untuk setiap hari kerja manusia menjelang pertengahan bulan Ogos, sambil memberi amaran bahawa metrik dalaman adalah awal dan tidak mengukur secara langsung kemajuan penyelidikan keseluruhan.

5 min readRead the primary source
Source-provided image accompanying OpenAI says coding agents now exceed human research labor in its labs
Dokumen sumber utamaSumber direkodkan
Penerbit
openai.com
Pautan sumber
openai.comhttps://openai.com/index/research-acceleration-view-inside-openai
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
Inferens
Fasa masa jalan di mana model terlatih menjana ramalan atau output.
Uji diri andaKuiz Agen AI

Apa yang berlaku

OpenAI menerbitkan gambaran dalaman tentang cara ejen pengekodan digunakan oleh organisasi penyelidikannya. Syarikat itu berkata ia telah mencapai matlamat yang dinyatakan sebagai "pelatih penyelidikan automatik": sistem yang mampu melaksanakan tugas penyelidikan yang jelas di bawah arahan manusia, termasuk tugas yang boleh mengambil masa beberapa hari penyelidik mahir. OpenAI berkata ia menyasarkan penyelidik AI automatik menjelang Mac 2028. Menurut ukuran syarikat, penggunaan ejen meningkat dengan mendadak pada 2026. Menjelang pertengahan Ogos, penyelidik median menggunakan ejen pengekodan setiap hari pada harga lebih daripada $600 sehari dalam inferens yang dikira pada harga API, manakala pengguna ke-90 peratus, sehari melebihi $70. Di seluruh organisasi penyelidikan, OpenAI berkata masa jalan ejen mencapai 3.1 standard lapan jam hari kerja ejen untuk setiap hari kerja manusia. OpenAI juga melaporkan lebih banyak percubaan bagi setiap penguji aktif, peningkatan penggunaan ejen untuk tugasan peringkat lebih tinggi dan lebih panjang, dan secara amnya meningkatkan kadar kejayaan dari Januari hingga Julai bagi tugasan dengan hasil yang diketahui. Walau bagaimanapun, lebih separuh daripada tugas yang berjaya dianggarkan memerlukan empat hingga lapan jam kerja manusia melibatkan sekurang-kurangnya satu campur tangan manusia dalam tempoh enam bulan sebelumnya. Laporan itu menerangkan ini sebagai ukuran awal dan tera dalaman OpenAI sendiri. Ia tidak menetapkan bahawa ejen menyebabkan semua peningkatan yang diperhatikan dalam output penyelidikan: syarikat mengatakan pengiraan yang tersedia juga meningkat dengan ketara, dan kesesakan seperti pengiraan, pemilihan tugas, penilaian, pemeriksaan keselamatan dan penyepaduan ke dalam larian latihan teras boleh mengehadkan kemajuan keseluruhan.

OpenAI berkata penyelidiknya kini menggunakan ejen pengekodan sepanjang hari, selalunya dalam sesi serentak, dan penggunaan itu berkembang lebih pantas berbanding pasukan OpenAI yang lain. Syarikat itu melaporkan bahawa penyelidik median beralih daripada penggunaan sederhana pada awal 2026 kepada penggunaan harian menjelang pertengahan Ogos. Ia memberikan anggaran perbelanjaan dalaman lebih daripada $600 sehari dalam inferens pada harga API untuk penyelidik median dan lebih daripada $7,000 sehari untuk pengguna ke-90 peratus. Ini bukan harga yang ditawarkan kepada orang ramai untuk penyelidik automatik.

Syarikat mengukur jumlah masa jalan ejen terhadap buruh manusia menggunakan hari kerja lapan jam standard. Ia mengatakan bahawa sebelum Jun 2026, jumlah masa jalan ejen adalah di bawah jumlah buruh manusia, tetapi menjelang pertengahan Ogos, organisasi penyelidikan menggunakan 3.1 hari kerja ejen untuk setiap hari kerja manusia. Pengukuran termasuk agen yang dilancarkan secara langsung oleh penyelidik dan subagen hiliran.

OpenAI berkata aktiviti ejen berkembang merentasi enam peringkat taksonomi penyelidikan dan pembangunan AInya: membuat keputusan, mereka bentuk, membina, menjalankan, menganalisis dan berkomunikasi. Kod penyelidikan dan infrastruktur kekal sebagai kategori dominan, manakala bantuan teknikal dan pemantauan berjalan dengan ketara. Perancangan peringkat tinggi kekal sebagai sebahagian kecil daripada token keluaran ejen. OpenAI berkata ejen sangat berguna untuk menyelesaikan masalah infrastruktur penyelidikan dalaman, bertepatan dengan kehadiran yang lebih rendah pada beberapa sesi sokongan teknikal yang dikendalikan manusia.

Laporan itu mengatakan kejayaan tugas ejen pengekodan biasanya meningkat dari Januari hingga Julai merentasi beberapa baldi masa manusia yang dianggarkan, tetapi ejen masih memerlukan pemanduan yang besar apabila tugas menjadi lebih kompleks. Lebih separuh daripada tugasan empat hingga lapan jam yang berjaya melibatkan satu atau lebih campur tangan dalam enam bulan sebelumnya. OpenAI juga mengatakan bahawa ia menjeda latihan pembelajaran pengukuhan pada beberapa model penggunaan terbaharu selepas insiden infrastruktur baru-baru ini, memulihkan beberapa beban kerja di bawah sekatan yang lebih kuat dan mengenakan sekatan tambahan pada eksperimen kelas Astra selepas bukti awal keupayaan siber kritikal. Ia melaporkan bahawa peruntukan GPU kelas Astra jatuh 59.2% pada minggu berikutnya manakala kelas model lain meningkat 17.2%, mengimbangi kira-kira 85% daripada penurunan itu.

Butiran sumber: openai.com ↗

Mengapa ia penting

Laporan itu menawarkan pandangan yang luar biasa konkrit tentang cara makmal AI sempadan menggabungkan sistem AI ke dalam kerja membangunkan AI yang lebih berkebolehan. Jika trend menjadi umum, ejen pengekodan boleh mengalihkan masa penyelidik daripada pelaksanaan rutin dan penyelesaian masalah infrastruktur ke arah tugas yang kekal sukar untuk diautomasikan, yang berpotensi memendekkan bahagian kitaran pembangunan model. Tetapi bukti adalah dijana syarikat, awal dan tertumpu pada metrik operasi terpilih dan bukannya keuntungan yang disahkan secara bebas dalam kualiti saintifik atau keupayaan model.

Laporan itu penting kerana sistem AI digunakan pada proses yang menghasilkan sistem AI masa hadapan, dan bukannya sekadar membantu kerja pejabat rutin. Angka OpenAI menunjukkan bahawa kapasiti ejen menjadi bahagian yang bermakna dalam operasi penyelidikan dalaman, dengan pelaksanaan serentak dan kerumitan tugas yang lebih tinggi mengubah cara penyelidik memperuntukkan masa mereka.

Implikasi praktikal bercampur-campur. Ejen boleh mengurangkan kelewatan yang disebabkan oleh pengekodan, penyahpepijatan infrastruktur dan persediaan percubaan, membolehkan penyelidik menjalankan lebih banyak percubaan. Pada masa yang sama, pelaksanaan yang lebih pantas boleh menjadikan penilaian, pemantauan dan semakan keselamatan lebih penting kerana ralat mungkin dihasilkan dan disebarkan dengan lebih cepat. OpenAI sendiri mengatakan kemajuan dalam metrik tertentu tidak semestinya menyamai kadar kemajuan penyelidikan keseluruhan yang sama.

Laporan itu juga menjadikan kawalan manusia sebagai keadaan utama. OpenAI berkata orang ramai masih menetapkan keutamaan, menilai idea dan hasil yang hendak diteruskan, dan memutuskan sama ada untuk menskalakan, menjeda atau menggunakan sistem. Ia mengakui bahawa penjajaran dan kemajuan keselamatan mungkin tidak seiring dengan kemajuan keupayaan dan sistem yang lebih berkebolehan mungkin menjadi lebih sukar untuk dipantau.

Tiada kajian bebas, penanda aras awam atau audit luar dibekalkan dalam sumber. Oleh itu, angka perbelanjaan, masa jalan, kejayaan tugasan dan intervensi yang dilaporkan harus dianggap sebagai dakwaan OpenAI tentang organisasinya sendiri, bukan sebagai bukti kukuh bahawa penyelidikan AI telah dipercepatkan dengan jumlah terukur tertentu.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Persoalan utama ialah sama ada penggunaan ejen yang lebih tinggi diterjemahkan kepada penambahbaikan yang tahan lama, boleh diukur secara bebas dalam kualiti penyelidikan, keselamatan dan kelajuan pembangunan model. Perhatikan takrifan yang lebih jelas tentang kejayaan tugasan, pengesahan luaran, bukti tentang kesilapan dan kerja manusia yang tersembunyi, dan sama ada kesesakan yang selebihnya bergerak ke arah pengiraan, penilaian, penjajaran atau membuat keputusan. OpenAI belum mendokumenkan akses awam kepada aliran kerja dalaman ini atau sebarang harga yang berkaitan dan laporan itu tidak menunjukkan bahawa penyelidik automatik tujuan umum tersedia.

OpenAI mengatakan kaedah pengukurannya masih berkembang. Pendedahan masa hadapan harus menjelaskan cara tugasan diambil sampel, cara kejayaan disahkan, cara hasil yang tidak pasti dikendalikan dan cara kod atau eksperimen yang dijana ejen dibezakan daripada kerja yang sepatutnya dilakukan oleh manusia.

Bukti hilang paling penting ialah sama ada kerja dibantu ejen menghasilkan hasil penyelidikan yang lebih baik, bukan hanya lebih banyak kod, eksperimen atau token. Bukti susulan yang berguna akan termasuk contoh yang boleh dibuat semula, kadar ralat, kerja semula, percubaan yang gagal, penemuan keselamatan dan jumlah semakan manusia yang diperlukan pada setiap peringkat.

Laporan itu tidak menyatakan bahawa pelatih penyelidikan automatik ialah produk yang boleh diakses secara umum. Ia juga tidak memberikan harga pengguna atau perusahaan, keperluan penggunaan, kriteria kelayakan atau tarikh keluaran. Oleh itu akses dan harga tidak diketahui.

OpenAI berkata ia akan terus melaporkan kemajuan ke arah penyelidikan AI automatik sambil melindungi keselamatan dan maklumat proprietari. Pendedahan masa depannya akan menunjukkan berapa banyak pecutan yang dilaporkan boleh dinilai secara bebas dan cara sekatan penyelidikan mempengaruhi pengedaran pengiraan yang tersedia.

Panduan & kuiz berkaitan

Ejen AILatihan AIModel AI DiterangkanMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?