Apa yang berlaku
MarkTechPost melaporkan bahawa penyelidik dari Meta FAIR, University of Oxford dan University College London memperkenalkan Model Keutamaan Penyelidikan AI, atau RPM, untuk memilih eksperimen yang perlu dijalankan oleh ejen penyelidikan AI. Pada penilaian AIRS-Bench yang dilaporkan, RPM meningkatkan purata skor ternormal dan mencapai garis dasar pemilihan rawak dalam kira-kira 15 jam dan bukannya 24.
MarkTechPost melaporkan bahawa RPM menilai percubaan calon yang tidak dilaksanakan dan bukannya meramalkan markah mutlaknya. Sistem yang dilaporkan menggunakan perancah pencarian pokok evolusioner yang dipanggil AIRA-dojo. Seorang ejen menjana 15 anak calon secara selari, membandingkan mereka secara berpasangan dalam kejohanan kalah mati, dan hanya melaksanakan pemenang. Perbandingan menggunakan nod konteks yang diterokai sebelum ini dan skor pengesahannya.
Artikel itu menerangkan dua varian. RPM inferens sahaja menilai rancangan calon, kod dan sejarah carian dengan model bahasa pralatihan beku. RPM agen juga menjalankan percubaan perintis kecil dalam persekitaran klon yang mengandungi satu GPU H200, menggunakan Python, bash dan alat penyerahan. MarkTechPost melaporkan bahawa pemilih agen hanya digunakan untuk langkah Draf dan Penambahbaikan, manakala pilihan Nyahpepijat berbalik kepada rawak kerana juruterbang menggunakan belanjawan masa ejen.
Pada AIRS-Bench, yang diterangkan oleh MarkTechPost sebagai mengandungi 20 teks awam dan tugas jadual, purata skor ternormal yang dilaporkan ialah 0.684 untuk pemilihan rawak, 0.711 untuk RPM inferens sahaja dan 0.729 untuk RPM agen. Persediaan dilaporkan menggunakan Qwen3.6-27B untuk kedua-dua pengendali eksperimen dan RPM, dengan 10 biji dan 24 jam pada satu H200 setiap tugas.
MarkTechPost melaporkan bahawa kedua-dua varian RPM mencapai garis dasar pemilihan rawak dalam kira-kira 15 jam: 14.88 jam untuk inferens sahaja dan 15.50 jam untuk pemilihan agen. Artikel itu juga melaporkan hasil sebanyak 94.1% pada WinoGrande dan 95.7% pada SVAMP, menyifatkan keputusan tersebut sebagai hasil terkini yang terkini. Angka dan perbandingan ini adalah tuntutan dalam laporan yang dibekalkan, bukan keputusan yang disahkan secara bebas.
Artikel itu mengatakan perancah AIRA-dojo dan AIRS-Bench adalah sumber terbuka dan Qwen3.6-27B tersedia sebagai pemberat terbuka. Ia tidak menyediakan pautan akses langsung, syarat pelesenan, perkhidmatan yang dihoskan, butiran sokongan komersial atau harga. Bahan yang dibekalkan juga tidak menetapkan bahawa sistem sedia untuk kegunaan pengeluaran umum.
Butiran sumber: marktechpost.com ↗
Mengapa ia penting
Jika keputusan yang dilaporkan berlaku, memilih percubaan sebelum pelaksanaan boleh menjadikan penyelidikan berbantukan AI lebih cekap pengiraan. Pendekatan ini menangani kesesakan praktikal: ejen penyelidikan boleh menjana banyak percubaan calon, tetapi menguji setiap satu adalah mahal. Bukti kekal terhad kepada penanda aras yang dilaporkan dan belum disahkan secara bebas dalam bahan yang dibekalkan.
Kerja yang dilaporkan menyasarkan masalah peruntukan sumber dalam penyelidikan AI dan bukannya sekadar meningkatkan skor penanda aras model. Ejen yang boleh menjana lebih banyak idea daripada kemampuan pasukan untuk menguji memerlukan cara yang boleh dipercayai untuk memutuskan eksperimen yang patut dikira. Oleh itu, lapisan pemilihan boleh menjejaskan hasil penyelidikan, terutamanya apabila latihan atau penilaian berjalan mengambil masa berjam-jam atau hari.
Perbandingan yang dilaporkan menunjukkan bahawa beberapa manfaat diperoleh daripada memilih antara calon, kerana tulang belakang Qwen3.6-27B yang sama digunakan untuk pengendali eksperimen dan RPM. MarkTechPost melaporkan peningkatan relatif 6.0% daripada 0.684 kepada 0.711 untuk pemilihan inferens sahaja dan peningkatan 6.6% kepada 0.729 untuk pemilihan agen, tetapi artikel yang dibekalkan tidak memberikan perincian metodologi yang mencukupi untuk menilai keteguhan statistik melebihi selang keyakinan yang dinyatakan.
Terdapat had yang bermakna. AIRS-Bench merangkumi 20 teks awam dan tugas jadual, dan eksperimen menggunakan satu persediaan H200, jadi penemuan mungkin tidak dipindahkan ke program penyelidikan yang lebih besar, perkakasan lain atau domain saintifik. Laporan itu tidak memberikan replikasi bebas, kajian kes penggunaan atau bukti bahawa pendekatan itu meningkatkan penemuan dunia sebenar dan bukannya hasil penanda aras.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
Apa yang perlu ditonton seterusnya
Perhatikan kertas asas, kod dan artifak penanda aras; replikasi pada tugas tambahan; dan bukti tentang sama ada keuntungan berterusan dengan model, operator, perkakasan dan domain penyelidikan yang berbeza. Akses kepada komponen sumber terbuka yang dilaporkan diterangkan, tetapi harga, ketersediaan dihoskan dan sokongan pengeluaran tidak didokumenkan.
Semakan seterusnya yang paling berguna ialah sama ada penyelidik menerbitkan kertas asas, log pelaksanaan dan penilaian, dan sama ada pasukan luar mengeluarkan semula markah yang dilaporkan dan penjimatan masa. Laporan yang dibekalkan menunjuk kepada komponen sumber terbuka tetapi tidak mengesahkan ketersediaan atau kebolehgunaannya secara bebas.
Penilaian masa depan harus menguji model tulang belakang yang berbeza, kaedah penjanaan calon, keluarga tugas dan belanjawan pengiraan. Reka bentuk agen yang dilaporkan juga menggunakan percubaan perintis pendek dan baki belanjawan yang sengaja dilebih-lebihkan, pilihan yang mungkin mempengaruhi keputusan dan patut diuji di bawah perakaunan sumber biasa.
Pengguna berpotensi harus menganggap alat yang dilaporkan sebagai komponen penyelidikan, bukan sebagai produk komersial yang didokumenkan. Sumber tidak memberikan harga, syarat peringkat perkhidmatan, keperluan pemasangan atau pernyataan ketersediaan umum. Ia juga tidak menunjukkan sama ada RPM boleh mengendalikan percubaan dengan selamat yang kegagalannya mahal atau metrik pengesahannya tidak boleh dipercayai.
Keputusan WinoGrande dan SVAMP yang dilaporkan menjamin pengesahan terhadap garis dasar sebelumnya yang disebut. Artikel itu tidak menyediakan ujian bebas, pecahan statistik terperinci atau maklumat yang mencukupi untuk menentukan sejauh mana keuntungan tersebut digeneralisasikan.