Apa yang berlaku
Pracetak pengarang tunggal yang disiarkan ke arXiv pada 12 Ogos 2026 memperkenalkan Penanda Aras SemPlan, set ujian sintetik deterministik bagi 1,800 kes bahasa Inggeris dan Portugis Brazil, dan membandingkan empat seni bina untuk menukar permintaan bahasa semula jadi kepada pertanyaan pangkalan data yang dikawal. Ketepatan jawapan adalah antara 22.25% hingga 25.67%, dengan seni bina yang berbeza menjurus kepada keselamatan, kos dan tingkah laku penolakan.
Pracetak yang disiarkan ke arXiv pada 12 Ogos 2026 di bawah pengecam 2608.13612, yang dikarang oleh Bruno Santos Teixeira, menerangkan penanda aras yang dipanggil SemPlan yang bertujuan untuk masalah yang sempit tetapi biasa dari segi komersial: bagaimana sistem harus menukar permintaan bahasa semula jadi yang kurang ditentukan kepada data, yang menyebabkan capaian yang melanggar dasar perusahaan, yang tidak melanggar dasar. kos, atau mengembalikan jawapan yang berbeza setiap kali ia ditanya. Abstrak membingkai kerja sebagai penilaian ruang reka bentuk seni bina dan bukannya model tertentu.
Penanda aras diterangkan sebagai deterministik, sintetik dan dwibahasa, mengandungi 1,800 kes dalam bahasa Inggeris dan Portugis Brazil, yang mana 1,200 daripadanya membentuk apa yang penulis panggil subset penilaian saintifik beku. Empat seni bina dibandingkan di bawah apa yang digambarkan oleh abstrak sebagai konfigurasi model yang sama: penjanaan SQL langsung (berlabel A1); garis dasar ejen alat bersempadan (A2); penjanaan permintaan semantik berstruktur diikuti dengan perancangan dan pelaksanaan deterministik (A3); dan varian pelan semantik stateful yang berorientasikan penjelasan (A4).
Dalam apa yang abstrak memanggil 4,800 rekod utama, ketepatan jawapan adalah rendah dari segi mutlak untuk setiap reka bentuk: 22.25% untuk A1, 22.58% untuk A2, 25.67% untuk A3 dan 24.25% untuk A4. Kiraan rekod adalah konsisten dengan menjalankan subset beku 1,200 kes melalui keempat-empat seni bina, walaupun abstrak tidak menyatakan pemetaan itu secara eksplisit. A3 mempunyai ketepatan yang diperhatikan tertinggi dan, mengikut abstrak, dengan ketara melebihi A1, A2 dan A4 dalam analisis ketepatan berpasangan yang telah ditentukan sebelumnya β pilihan reka bentuk yang bermaksud perbandingan telah dirancang sebelum keputusan dilihat dan bukannya dipilih selepas itu.
Metrik lain yang dilaporkan tidak berada di belakang pemenang yang sama. A1, pendekatan paling mudah untuk menjana SQL secara langsung, mengekalkan kadar pembetulan dasar tertinggi dan kadar tidak selamat atau tidak sah yang paling rendah. A4, varian penjelasan dan penjejakan keadaan, mempunyai purata kos API terendah dan kadar penolakan palsu terendah β iaitu, ia paling tidak kerap menolak permintaan yang sepatutnya dijawab. Pada subset kestabilan 150 kes yang diprapilih, kebolehulangan betul jawapan berjulat dari 92.00% hingga 98.67%, menunjukkan bahawa tiada satu pun seni bina menghasilkan jawapan yang pasti sepenuhnya walaupun kes yang sama diulang.
Beberapa perkara yang abstrak tidak ditubuhkan patut dinyatakan dengan jelas. Ia tidak menamakan model bahasa yang digunakan, menerangkan skema pangkalan data atau peraturan dasar yang dikuatkuasakan, mentakrifkan cara dasar-betul, tidak selamat-atau-tidak sah dan penolakan palsu dijaringkan, memberikan angka kos sebenar di sebalik perbandingan kos, atau memecahkan ketepatan mengikut bahasa walaupun reka bentuk dwibahasa. Halaman penyenaraian tidak menunjukkan bahawa kod atau data telah dikeluarkan. Kertas itu adalah pracetak 11 muka surat dengan tiga angka dan sembilan jadual daripada seorang pengarang; abstrak mengatakan ia telah diserahkan kepada Transaksi pada Penyelidikan Pembelajaran Mesin, yang bermaksud ia belum menyelesaikan semakan rakan sebaya.
Mengapa ia penting
Antara muka bahasa semula jadi kepada data syarikat ialah salah satu ciri AI perusahaan yang paling banyak dijual, dan dakwaan utama kertas itu ialah penambahan struktur dan lapisan perancangan mengubah kegagalan yang berlaku dan bukannya menghapuskannya. Skor mutlak datang daripada penanda aras sintetik pembinaan pengarang sendiri, jadi ia bukan ukuran ketepatan pengeluaran.
Akses gaya sembang ke pangkalan data dalaman adalah antara keupayaan AI perusahaan yang paling banyak dipasarkan, dan vendor biasanya membezakan pada seni bina: sama ada model menulis SQL secara langsung, memanggil set alat yang terhad, mengeluarkan perwakilan perantaraan berstruktur yang dilaksanakan oleh perancang deterministik, atau bertanya soalan yang menjelaskan pengguna. Kertas ini mengambil perbezaan pemasaran itu dan mengujinya dalam keadaan tetap. Penemuan tajuknya ialah pilihan seni bina membentuk semula profil kegagalan tanpa membetulkan ketepatan dengan pasti.
Nombor ketepatan mutlak patut dijaga. Ia datang daripada penanda aras sintetik yang kesukarannya ditetapkan oleh pengarangnya sendiri, jadi skor dalam usia dua puluhan yang rendah adalah sifat set ujian ini, bukan anggaran kekerapan sistem yang digunakan menjawab soalan perniagaan sebenar dengan betul. Apa yang reka bentuk menyokong lebih kuat ialah perbandingan relatif: kerana keempat-empat seni bina dijalankan di bawah konfigurasi model yang sama pada kes beku yang sama, pesanan antara mereka adalah lebih bermaklumat daripada peratusan mentah.
Corak pertukaran adalah bahagian yang boleh dikatakan berguna untuk sesiapa sahaja yang menilai sistem ini. Reka bentuk yang menjawab kebanyakan soalan dengan betul bukanlah dasar yang paling dihormati, dan yang paling murah dan paling tidak berkemungkinan menolak kerja yang sah bukanlah yang paling betul mahupun paling selamat. Pembeli yang memilih pada satu angka ketepatan, atas bukti ini, akan memilih tanpa melihat tadbir urus dan akibat kos. Pembingkaian kertas itu β tafsiran tukar ganti dan bukannya penarafan universal β adalah berhati-hati terhadap dakwaan bahawa mana-mana seni bina menyelesaikan masalah.
Hasil kebolehulangan merujuk kepada kebimbangan operasi yang berasingan. Kebolehulangan betul jawapan antara 92.00% dan 98.67% pada subset 150 huruf bermakna mengulang soalan yang sama kadangkala mengubah sama ada jawapan itu betul. Untuk aliran kerja pelaporan, pengauditan atau pematuhan, di mana pertanyaan yang sama dijangka menghasilkan angka yang sama, kebolehubahan itu adalah risiko yang berbeza daripada ketepatan purata dan jarang dilaporkan dalam bahan vendor.
Pembinaan dwibahasa, meliputi bahasa Inggeris dan Portugis Brazil, menangani jurang dalam tanda aras yang menguji bahasa Inggeris sahaja. Sama ada kedua-dua bahasa yang dilakukan secara perbandingan tidak dinyatakan dalam abstrak, jadi nilai reka bentuk di sini pada masa ini berpotensi dan bukannya ditunjukkan. Secara lebih luas, berat kajian dihadkan dengan menjadi pracetak pengarang tunggal pada data sintetik dengan satu konfigurasi model yang tidak didedahkan; ia adalah hipotesis berstruktur tentang pertukaran seni bina, bukan hasil yang diselesaikan.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').What is the most accurate way to describe what AI Agents can do today?
Apa yang perlu ditonton seterusnya
Sama ada kertas penuh menamakan model yang digunakan, memecahkan keputusan mengikut bahasa dan mentakrifkan metrik keselamatannya; sama ada kod dan data penanda aras dikeluarkan supaya kumpulan lain boleh menjalankannya semula pada model yang berbeza; dan sama ada kertas itu membersihkan ulasan rakan sebaya di TMLR, di mana abstrak menyatakan ia telah diserahkan.
Soalan paling segera ialah kandungan kertas penuh. Model manakah yang digunakan, cara metrik dasar dan keselamatan ditakrifkan dan diberi markah, angka kos sebenarnya dan sama ada keputusan yang berbeza antara bahasa Inggeris dan Portugis Brazil semuanya tidak dapat diselesaikan daripada abstrak sahaja. Sembilan jadual yang dilaporkan kertas mungkin menjawab beberapa daripada ini; abstrak tidak mencukupi untuk menilai sama ada tuntutan keselamatan dan penolakan diukur secara konsisten merentas seni bina.
Sama ada penanda aras itu sendiri dikeluarkan lebih penting daripada peratusan tertentu. Subset 1,200 kes beku direka untuk digunakan semula dan nilainya bergantung pada kumpulan lain yang dapat menjalankannya terhadap model yang tidak diuji oleh pengarang. Jika kod dan data diterbitkan dan corak tukar ganti merentas beberapa model sempadan, penemuan itu menjadi lebih sukar untuk ditolak. Jika ia tidak menghasilkan semula, atau jika keputusan ternyata bergantung pada tingkah laku satu model, tuntutan seni bina mengecil dengan ketara.
Semakan rakan sebaya ialah pusat pemeriksaan jangka pendek yang konkrit. Abstrak menyatakan bahawa kertas itu telah diserahkan kepada Transaksi pada Penyelidikan Pembelajaran Mesin; penerimaan, penolakan atau versi yang disemak semuanya akan bermaklumat, terutamanya sama ada analisis berpasangan yang telah ditetapkan bertahan di bawah penelitian pengulas memandangkan betapa hampirnya angka ketepatan antara satu sama lain.
Jangka panjang, pembangunan yang berguna akan menjadi penanda aras bentuk ini yang dibina pada skema perusahaan sebenar dan dasar kawalan akses sebenar dan bukannya sintetik, dan vendor melaporkan ketepatan dasar, kadar penolakan palsu dan kebolehulangan bersama dengan ketepatan. Sehingga itu berlaku, pembeli yang menilai antara muka data bahasa semula jadi mempunyai bukti awam yang terhad untuk membandingkan produk, dan kertas kerja ini sebaiknya dibaca sebagai templat untuk perkara yang perlu ditanyakan kepada vendor dan bukannya sebagai keputusan ke atas mana-mana produk di pasaran.