Apa yang berlaku
Penyelidik memperkenalkan τ^τ-Bench, penanda aras yang menjadikan pembinaan ejen hujung ke hujung sebagai tugas untuk sistem pengekodan AI. Penanda aras memberikan rekod perniagaan ejen pembangun, keperluan pelanggan, API pengeluaran, pangkalan kod sedia ada dan had pada model dan kos penyajian, kemudian menilai ejen perkhidmatan pelanggan yang terhasil terhadap pengguna simulasi.
Sumber arXiv, yang diserahkan pada 4 September 2026, menerangkan τ^τ-Bench sebagai persekitaran untuk menilai sistem AI yang membina ejen dan bukannya hanya menjawab gesaan penanda aras. Ejen pembangun menerima rekod yang sebenarnya disimpan oleh perniagaan, keperluan daripada pelanggan, API pengeluaran yang melaluinya operasi mesti dijalankan, pangkalan kod yang diwarisi dan kekangan pada kos penyajian dan pilihan model. Ia mesti menggunakan bahan tersebut untuk menyampaikan ejen perkhidmatan pelanggan yang lengkap.
Ejen yang dihasilkan dinilai dengan menggunakan ia terhadap pengguna simulasi yang ditahan. Merentasi 53 tugasan dalam empat domain, kertas itu melaporkan bahawa konfigurasi terkuatnya—Claude Opus 5 yang digunakan melalui Claude Code—melepasi 23.9% simulasi penilaian. Siling rujukan yang dikarang pakar mendapat markah 82.2%. Ini adalah keputusan yang dilaporkan oleh kertas; sumber tidak memberikan pengesahan bebas pada halaman pendaratan arXiv.
Pengarang mengenal pasti corak kegagalan yang mereka katakan menyerupai masalah yang dihadapi oleh pembangun ejen manusia: pertanyaan cetek dan bukannya pemahaman mendalam tentang rekod perniagaan, komunikasi yang sedikit dengan pelanggan dan percubaan yang tidak mencukupi dengan seni bina ejen atau perbelanjaan perkhidmatan. Mereka mencirikan penanda aras sebagai percubaan untuk menjadikan pembinaan ejen koperasi sebagai sasaran yang boleh diukur untuk ejen pengekodan.
Mengapa ia penting
Penanda aras menyasarkan jurang dalam penilaian semasa: sama ada sistem AI boleh menyampaikan ejen yang boleh digunakan dalam kekangan yang tidak kemas dalam penglibatan pelanggan sebenar. Jurang prestasi yang dilaporkan antara konfigurasi yang paling kuat diuji dan rujukan pakar menunjukkan bahawa keupayaan pengekodan sahaja tidak mewujudkan kecekapan dalam memahami data perniagaan, berkomunikasi dengan pelanggan, membuat pilihan seni bina atau mengurus kos operasi.
Banyak penilaian mengasingkan keupayaan model untuk menjana kod atau menyelesaikan tugas yang ditentukan secara sempit. τ^τ-Bench sebaliknya menguji rangkaian keputusan yang menentukan sama ada ejen boleh berfungsi dalam tetapan operasi: mentafsir data organisasi yang tidak sempurna, menterjemah keperluan pelanggan kepada tingkah laku, menyepadukan dengan sistem sedia ada, memilih model dan mengimbangi kualiti dengan kos. Ini menjadikan jurang yang dilaporkan berpotensi berguna kepada pasukan yang menentukan jumlah kejuruteraan manusia dan aliran kerja pembinaan ejen yang masih diperlukan.
Hasilnya juga menyediakan cara yang lebih konkrit untuk memeriksa dakwaan bahawa ejen pengekodan boleh menggantikan atau mengautomasikan kerja pembangunan perisian dengan ketara di sekitar sistem AI. Menurut sumber itu, sistem yang diuji sering menghasilkan sesuatu yang berjalan tetapi gagal memenuhi keperluan yang lebih mendalam dalam pertunangan. Oleh itu, penanda aras mengalihkan perhatian daripada penjanaan kod sahaja kepada kualiti sistem yang digunakan dan interaksinya dengan pengguna.
Hasilnya tetap terhad. Halaman pendaratan tidak memberikan butiran tentang pembinaan tugas penanda aras, reka bentuk simulator, prosedur pemarkahan, pemilihan garis dasar atau ketidakpastian statistik. Ia juga tidak menunjukkan bahawa skor 23.9% meramalkan hasil pengeluaran. Kertas itu adalah pracetak arXiv, jadi tuntutannya harus dianggap sebagai penemuan penyelidikan sementara menunggu penelitian dan replikasi selanjutnya.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Makalah itu tidak menetapkan cara τ^τ-Bench dibandingkan dengan penanda aras lain, sama ada pengguna simulasinya meramalkan prestasi dengan pelanggan sebenar, atau sama ada keputusan umum melebihi 53 tugasan yang dilaporkan dan empat domain. Sumber itu juga tidak mendokumenkan akses penanda aras awam, keperluan pelaksanaan, harga atau replikasi bebas.
Sama ada pengarang mengeluarkan penanda aras, spesifikasi tugas, abah-abah penilaian dan pelaksanaan rujukan adalah penting untuk kebolehulangan. Halaman sumber mengesahkan kertas dan pautan ke versi PDF dan HTML, tetapi ia tidak menyatakan bahawa penanda aras itu sendiri boleh diakses secara umum atau mengenal pasti sebarang syarat atau harga capaian.
Penilaian masa depan harus menguji lebih banyak model, sistem ejen pengekodan, domain dan jenis tugas, sambil menjelaskan cara pengguna simulasi mewakili tingkah laku pelanggan sebenar. Perbandingan dengan ejen sedia ada, pengekodan dan penanda aras kejuruteraan perisian akan membantu menentukan keupayaan tambahan τ^τ-langkah-langkah.
Pengehadan yang dilaporkan menunjukkan keperluan semakan praktikal: memeriksa cara ejen menanyakan rekod organisasi, memerlukan komunikasi pelanggan yang jelas, menilai seni bina alternatif dan memantau kos penyajian sebelum penggunaan. Sumber itu tidak melaporkan penggunaan dunia sebenar, hasil pelanggan atau insiden keselamatan, jadi akibat tersebut kekal tidak diketahui.