Kembali ke Berita
InovasiAI Understanding taklimat

Kertas MARS melaporkan kadar pas pengaturcaraan kompetitif yang lebih tinggi dengan mengalihkan tugas di kalangan LLM pakar

Pracetak baharu menerangkan MARS, sistem segera sahaja yang memberikan masalah pengaturcaraan kepada model bahasa pakar topik dan melaporkan keuntungan 14.4 mata peratusan berbanding gesaan langsung pada CodeContests.

6 min readRead the primary source
Primary-source image accompanying MARS paper reports higher competitive-programming pass rates by routing tasks among specialist LLMs
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.23918
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

RAG (Retrieval-Augmented Generation)
Kaedah yang mendapatkan semula pengetahuan luaran dan menyalurkannya kepada generasi pada masa inferens.
Generalisasi
Seberapa baik prestasi model pada data baharu yang tidak kelihatan di luar set latihan.
Algoritma
Satu set peraturan atau langkah yang ditetapkan yang dipatuhi oleh komputer untuk menyelesaikan masalah atau menyelesaikan tugas.
Uji diri andaKuiz Agen AI

Apa yang berlaku

Kertas kerja yang diserahkan kepada arXiv pada 24 Ogos membentangkan MARS, atau Multi-Agent Relay of Specialized LLMs, sebuah sistem untuk menyelesaikan masalah pengaturcaraan kompetitif dengan pelbagai ejen model bahasa pakar topik. Ia melaporkan bahawa MARS mencapai kadar lulus 0.624 ± 0.006 pada pemisahan ujian CodeContests dengan Gemma 4, berbanding dengan dorongan langsung, sambil menggunakan 2.3 peringkat saluran paip yang direkodkan bagi setiap tugas. Penulis mengatakan kod sumber tersedia pada GitHub, walaupun teks sumber yang dibekalkan tidak termasuk pautan yang boleh digunakan.

Kertas MARS mengenal pasti kelemahan khusus dalam saluran paip pengekodan berbilang ejen biasa: peranan perancang generik, pengekod dan penyahpepijat menyerahkan pilihan teknik algoritma kepada model bahasa utama. Alternatif yang dicadangkan ialah penyampaian segera sahaja di mana ejen pakar dalam bidang seperti pengaturcaraan dinamik, graf, rentetan dan geometri. Penjanaan dipertingkatkan semula melalui korpus teori algoritma digunakan untuk memilih pasukan kecil pakar yang berkaitan untuk setiap masalah. Sumber menerangkan ini sebagai rangka kerja di sekitar model bahasa dan bukannya model yang baru dilatih.

Aliran kerja bermula dengan ejen pemula yang menghasilkan penyelesaian C++17. Calon kemudiannya ditandingi terhadap contoh awam dalam kotak pasir. Pada setiap giliran berikutnya, pakar aktif boleh menyimpan draf, membaikinya atau menyerahkannya kepada pakar lain, sambil memajukan paket berstruktur kepada ejen seterusnya. Pas pembetul infrastruktur akhir menormalkan plat dandang. Butiran ini penting kerana sistem menggabungkan pemilihan pakar, ujian berulang dan penyerahan terkawal; kertas itu tidak mengaitkan keuntungan yang dilaporkan kepada satu komponen dalam abstrak yang dibekalkan.

Pada pemisahan ujian CodeContests, penulis melaporkan kadar lulus 0.624 ± 0.006 dengan Gemma 4 dan 2.3 mencatatkan peringkat saluran paip setiap tugas. Mereka menggambarkan ini sebagai peningkatan 14.4 mata peratusan berbanding dorongan langsung. Makalah itu juga melaporkan bahawa MARS menutup sebahagian besar jurang kepada CodeSIM, yang disenaraikan pada 0.731, sambil menggunakan kos jam dinding 3.3 kali lebih rendah dan menunjukkan varians yang jauh lebih kecil dalam perbelanjaan token setiap tugas.

Ini dilaporkan hasil percubaan daripada kertas, bukan penemuan yang disahkan secara bebas. Sumber mengenal pasti kerja itu sebagai kertas 13 halaman yang diserahkan kepada arXiv dan dikaitkan dengan EMNLP 2026. Ia mengatakan kod itu tersedia pada GitHub, tetapi teks halaman arXiv yang dibekalkan menjadikan pautan sebagai pemegang tempat generik dan bukannya alamat repositori yang boleh digunakan. Sumber tidak memberikan butiran di sini tentang saiz kumpulan pakar, korpus pengambilan semula, bilangan masalah ujian, konfigurasi dorongan langsung atau prosedur statistik di sebalik anggaran ketidakpastian.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Hasilnya menunjukkan bahawa memberikan model bahasa peranan algoritma yang ditakrifkan secara sempit boleh meningkatkan prestasi pengekodan tanpa memerlukan model asas yang lebih besar. Keuntungan yang dilaporkan adalah berkaitan dengan pembangun yang membina sistem pengaturcaraan automatik, tetapi ia kekal sebagai tuntutan daripada pracetak 13 halaman dan satu tetapan penanda aras dan bukannya bukti kebolehpercayaan pengeluaran yang ditubuhkan secara bebas.

MARS menangani masalah praktikal dalam pengaturcaraan berbantukan AI: model bahasa mungkin menghasilkan kod yang munasabah secara sintaksis semasa memilih strategi algoritma yang tidak sesuai. Reka bentuk kertas memberikan pilihan algoritma kepada pakar yang gesaan dan bahan yang diperolehi difokuskan pada kawasan tertentu. Jika keputusan yang dilaporkan berlaku di bawah ujian yang lebih luas, ini boleh menawarkan cara untuk meningkatkan prestasi tugasan melalui orkestrasi dan penghalaan daripada hanya meningkatkan saiz model atau meminta satu model tujuan umum untuk membuat alasan lebih lama.

Perbandingan kos yang dilaporkan juga berpotensi berguna. Penulis mengatakan MARS menutup sebahagian besar jurang kepada CodeSIM pada kos jam dinding 3.3 kali lebih rendah, sambil menggunakan 2.3 peringkat saluran paip yang direkodkan setiap tugas. Gabungan itu mungkin penting untuk alat pengekodan yang perlu mengimbangi kualiti, kependaman dan mengira perbelanjaan. Sumber tidak menentukan cara kos jam dinding dikira, sama ada perkakasan dan konkurensi dipadankan, atau sama ada perbandingan itu termasuk semua perolehan semula, kotak pasir dan overhed penyerahan, jadi kepentingan operasi kekal tidak pasti.

Pendekatan ini juga boleh membuat kegagalan lebih mudah untuk diperiksa. Paket berstruktur dan keputusan penyimpanan, pembaikan atau penyerahan eksplisit mewujudkan titik yang boleh dikenal pasti di mana pengendali boleh menyemak sebab draf berubah. Menjalankan penyelesaian terhadap contoh awam membekalkan isyarat maklum balas yang konkrit dan bukannya bergantung semata-mata pada kritikan model lain. Walau bagaimanapun, lulus contoh awam tidak dengan sendirinya menunjukkan ketepatan pada ujian tersembunyi, dan sumber tidak memberikan bukti bahawa MARS memberikan jaminan rasmi, penjelasan yang boleh dipercayai atau perlindungan terhadap konsensus pakar yang salah.

Hasilnya adalah berkaitan dengan penyelidikan AI kerana ia menganggap prestasi berbilang ejen sebagai soalan reka bentuk sistem: model yang manakah harus bertindak, bilakah ia harus bertindak, dan apakah maklumat yang harus bergerak antara ejen? Pada masa yang sama, bukti adalah sempit. Ia datang daripada pracetak, satu pemisahan ujian dinamakan dan percubaan dengan Gemma 4. Sumber itu tidak melaporkan penggunaan, hasil pengguna, replikasi bebas atau prestasi pada repositori perisian biasa. Oleh itu, ia menyokong minat dalam kaedah, bukan kesimpulan yang luas bahawa geganti pakar biasanya menyelesaikan kebolehpercayaan pengekodan.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Semakan Konsep Interaktif+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Apa yang perlu ditonton seterusnya

Soalan utama ialah sama ada MARS membuat generalisasi di luar pengaturcaraan kompetitif dan Gemma 4, bahagian geganti mana yang menghasilkan peningkatan, dan bagaimana kos dan kebolehpercayaannya dibandingkan dengan sistem pengekodan lain di bawah ujian yang konsisten. Pengeluaran semula bebas, penanda aras yang lebih luas dan ablasi terperinci akan membantu menentukan sama ada penghalaan pakar ialah teknik kejuruteraan yang tahan lama atau kelebihan khusus penanda aras.

Pertama, penyelidik bebas harus menghasilkan semula perbandingan CodeContests menggunakan konfigurasi yang dinyatakan dan memeriksa kod dan saluran paip penilaian. Ketidakpastian yang dilaporkan, kadar lulus, kiraan peringkat, kelebihan kos dan varians perbelanjaan token semuanya perlu disemak berdasarkan tugasan dan garis dasar yang sama. Sumber yang dibekalkan tidak menyatakan sama ada repositori GitHub termasuk gesaan lengkap, data perolehan semula, kod orkestrasi dan skrip penilaian, jadi kebolehulangan belum boleh dinilai daripada sumber sahaja.

Kedua, keputusan ablasi akan menunjukkan dari mana penambahbaikan itu datang. Perbandingan yang berguna secara berasingan akan mengalih keluar penghalaan pakar, penjanaan tambahan perolehan, pelaksanaan contoh awam, paket berstruktur dan pas pembetul infrastruktur. Tanpa ujian tersebut, tidak jelas sama ada keuntungan disebabkan terutamanya oleh pengkhususan topik, maklum balas pelaksanaan berulang, percubaan tambahan atau dasar geganti tertentu. Abstrak kertas itu menerangkan komponen tetapi tidak mengukur sumbangan individu mereka.

Ketiga, penilaian harus melangkaui pengaturcaraan kompetitif. Ujian masa depan boleh memeriksa masalah pertandingan yang tidak kelihatan, bahasa pengaturcaraan yang berbeza, perubahan peringkat repositori, tugas penyahpepijatan dan kes di mana contoh awam lemah atau mengelirukan. Sumber itu tidak mendakwa bahawa MARS telah diuji dalam tetapan tersebut. Ia juga tidak menetapkan cara sistem mengendalikan keperluan samar-samar, kebergantungan, fail panjang, kod sensitif keselamatan atau ujian yang tidak boleh dilaksanakan dengan selamat.

Akhir sekali, perbandingan dengan model lain dan kaedah orkestrasi akan menentukan sama ada penemuan itu tahan lama. Arkib ini termasuk liputan berasingan penanda aras penarafan 18 model pengekodan AI, tetapi itu adalah sudut fakta yang berbeza dan tidak menentukan prestasi MARS terhadap sistem tersebut. Perhatikan bukti tentang generalisasi merentas keluarga model, kependaman di bawah beban kerja sebenar, jumlah kos inferens, pemulihan kegagalan dan sama ada berbilang pakar menguatkan kesilapan bersama. Sehingga soalan tersebut dijawab, MARS paling difahami sebagai hasil penanda aras yang menjanjikan daripada pracetak baharu dan bukannya produk pengekodan yang disahkan.

Panduan & kuiz berkaitan

Ejen AIModel AI DiterangkanPrompt EngineeringLatihan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?