Kembali ke Berita
InovasiAI Understanding taklimat

Penanda aras mendapati ejen pengekodan bergelut untuk membina ejen perkhidmatan dunia sebenar

Penanda aras baharu menilai sama ada ejen pengekodan boleh membina ejen perkhidmatan pelanggan yang lengkap di bawah kekangan perniagaan yang realistik. Makalah itu melaporkan bahawa konfigurasi yang diuji paling kuat melepasi 23.9% simulasi, berbanding 82.2% untuk rujukan yang dikarang pakar.

4 min readRead the primary source
Source-provided image accompanying Benchmark finds coding agents struggle to build real-world service agents
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2609.04611
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penanda aras
Ujian piawai atau set data yang digunakan untuk mengukur dan membandingkan prestasi model.
API (Antara Muka Pengaturcaraan Aplikasi)
Cara berstruktur untuk satu sistem perisian menghantar permintaan dan menerima respons daripada sistem lain.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Penyelidik memperkenalkan τ^τ-Bench, penanda aras yang menjadikan pembinaan ejen hujung ke hujung sebagai tugas untuk sistem pengekodan AI. Penanda aras memberikan rekod perniagaan ejen pembangun, keperluan pelanggan, API pengeluaran, pangkalan kod sedia ada dan had pada model dan kos penyajian, kemudian menilai ejen perkhidmatan pelanggan yang terhasil terhadap pengguna simulasi.

Sumber arXiv, yang diserahkan pada 4 September 2026, menerangkan τ^τ-Bench sebagai persekitaran untuk menilai sistem AI yang membina ejen dan bukannya hanya menjawab gesaan penanda aras. Ejen pembangun menerima rekod yang sebenarnya disimpan oleh perniagaan, keperluan daripada pelanggan, API pengeluaran yang melaluinya operasi mesti dijalankan, pangkalan kod yang diwarisi dan kekangan pada kos penyajian dan pilihan model. Ia mesti menggunakan bahan tersebut untuk menyampaikan ejen perkhidmatan pelanggan yang lengkap.

Ejen yang dihasilkan dinilai dengan menggunakan ia terhadap pengguna simulasi yang ditahan. Merentasi 53 tugasan dalam empat domain, kertas itu melaporkan bahawa konfigurasi terkuatnya—Claude Opus 5 yang digunakan melalui Claude Code—melepasi 23.9% simulasi penilaian. Siling rujukan yang dikarang pakar mendapat markah 82.2%. Ini adalah keputusan yang dilaporkan oleh kertas; sumber tidak memberikan pengesahan bebas pada halaman pendaratan arXiv.

Pengarang mengenal pasti corak kegagalan yang mereka katakan menyerupai masalah yang dihadapi oleh pembangun ejen manusia: pertanyaan cetek dan bukannya pemahaman mendalam tentang rekod perniagaan, komunikasi yang sedikit dengan pelanggan dan percubaan yang tidak mencukupi dengan seni bina ejen atau perbelanjaan perkhidmatan. Mereka mencirikan penanda aras sebagai percubaan untuk menjadikan pembinaan ejen koperasi sebagai sasaran yang boleh diukur untuk ejen pengekodan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Penanda aras menyasarkan jurang dalam penilaian semasa: sama ada sistem AI boleh menyampaikan ejen yang boleh digunakan dalam kekangan yang tidak kemas dalam penglibatan pelanggan sebenar. Jurang prestasi yang dilaporkan antara konfigurasi yang paling kuat diuji dan rujukan pakar menunjukkan bahawa keupayaan pengekodan sahaja tidak mewujudkan kecekapan dalam memahami data perniagaan, berkomunikasi dengan pelanggan, membuat pilihan seni bina atau mengurus kos operasi.

Banyak penilaian mengasingkan keupayaan model untuk menjana kod atau menyelesaikan tugas yang ditentukan secara sempit. τ^τ-Bench sebaliknya menguji rangkaian keputusan yang menentukan sama ada ejen boleh berfungsi dalam tetapan operasi: mentafsir data organisasi yang tidak sempurna, menterjemah keperluan pelanggan kepada tingkah laku, menyepadukan dengan sistem sedia ada, memilih model dan mengimbangi kualiti dengan kos. Ini menjadikan jurang yang dilaporkan berpotensi berguna kepada pasukan yang menentukan jumlah kejuruteraan manusia dan aliran kerja pembinaan ejen yang masih diperlukan.

Hasilnya juga menyediakan cara yang lebih konkrit untuk memeriksa dakwaan bahawa ejen pengekodan boleh menggantikan atau mengautomasikan kerja pembangunan perisian dengan ketara di sekitar sistem AI. Menurut sumber itu, sistem yang diuji sering menghasilkan sesuatu yang berjalan tetapi gagal memenuhi keperluan yang lebih mendalam dalam pertunangan. Oleh itu, penanda aras mengalihkan perhatian daripada penjanaan kod sahaja kepada kualiti sistem yang digunakan dan interaksinya dengan pengguna.

Hasilnya tetap terhad. Halaman pendaratan tidak memberikan butiran tentang pembinaan tugas penanda aras, reka bentuk simulator, prosedur pemarkahan, pemilihan garis dasar atau ketidakpastian statistik. Ia juga tidak menunjukkan bahawa skor 23.9% meramalkan hasil pengeluaran. Kertas itu adalah pracetak arXiv, jadi tuntutannya harus dianggap sebagai penemuan penyelidikan sementara menunggu penelitian dan replikasi selanjutnya.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Makalah itu tidak menetapkan cara τ^τ-Bench dibandingkan dengan penanda aras lain, sama ada pengguna simulasinya meramalkan prestasi dengan pelanggan sebenar, atau sama ada keputusan umum melebihi 53 tugasan yang dilaporkan dan empat domain. Sumber itu juga tidak mendokumenkan akses penanda aras awam, keperluan pelaksanaan, harga atau replikasi bebas.

Sama ada pengarang mengeluarkan penanda aras, spesifikasi tugas, abah-abah penilaian dan pelaksanaan rujukan adalah penting untuk kebolehulangan. Halaman sumber mengesahkan kertas dan pautan ke versi PDF dan HTML, tetapi ia tidak menyatakan bahawa penanda aras itu sendiri boleh diakses secara umum atau mengenal pasti sebarang syarat atau harga capaian.

Penilaian masa depan harus menguji lebih banyak model, sistem ejen pengekodan, domain dan jenis tugas, sambil menjelaskan cara pengguna simulasi mewakili tingkah laku pelanggan sebenar. Perbandingan dengan ejen sedia ada, pengekodan dan penanda aras kejuruteraan perisian akan membantu menentukan keupayaan tambahan τ^τ-langkah-langkah.

Pengehadan yang dilaporkan menunjukkan keperluan semakan praktikal: memeriksa cara ejen menanyakan rekod organisasi, memerlukan komunikasi pelanggan yang jelas, menilai seni bina alternatif dan memantau kos penyajian sebelum penggunaan. Sumber itu tidak melaporkan penggunaan dunia sebenar, hasil pelanggan atau insiden keselamatan, jadi akibat tersebut kekal tidak diketahui.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?