Kembali ke Berita
InovasiAI Understanding taklimat

Kertas LURE mencadangkan permainan kendiri pengelakan mengejar untuk melatih penaakulan LLM tanpa data tugas

Kertas arXiv baharu mempersembahkan LURE, kaedah main kendiri data sifar di mana satu model bahasa menetapkan kesukaran tugasan manakala satu lagi menyelesaikan cabaran penaakulan yang boleh disahkan. Penulis melaporkan ketepatan sifar pukulan luar pengedaran yang lebih kukuh daripada garis dasar terlatih merentas sembilan penanda aras yang ditahan, tetapi abstrak tidak…

5 min readRead the primary source
Primary-source image accompanying LURE paper proposes pursuit-evasion self-play to train LLM reasoning without task data
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.21871
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Model Bahasa Besar (LLM)
Model bahasa yang dilatih mengenai korpora teks besar-besaran untuk menjana dan menganalisis teks.
Main Sendiri
Persediaan latihan di mana model bertambah baik dengan menjana data melalui interaksi atau pertandingan dengan salinan dirinya sendiri.
Pembelajaran Pengukuhan
Latihan melalui isyarat ganjaran di mana ejen mempelajari tindakan yang memaksimumkan pulangan jangka panjang.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Kertas kerja arXiv memperkenalkan LURE, pendekatan pembelajaran pengukuhan yang bertujuan untuk meningkatkan penaakulan model bahasa yang besar tanpa bergantung pada koleksi tugasan yang disusun oleh manusia yang besar. Ia merangka latihan sebagai permainan pengelakan mengejar: pengelak meletakkan tugas mengikut skala kesukaran, manakala pengejar pelaksana perancang cuba menyelesaikannya melalui interaksi yang boleh disahkan.

Kertas kerja yang diserahkan kepada arXiv pada 22 Ogos 2026, menerangkan LURE sebagai kaedah untuk main kendiri sifar data dalam penaakulan model bahasa besar. Penulis mengatakan pembelajaran pengukuhan konvensional dengan ganjaran yang boleh disahkan secara amnya menganggap akses kepada koleksi besar tugasan yang dipilih oleh manusia. Objektif mereka yang dinyatakan adalah untuk menghapuskan pergantungan itu dengan meminta model menjana atau meletakkan tugas semasa latihan dan bukannya bergantung sepenuhnya pada kumpulan tugas yang disediakan. Sumber menetapkan ini sebagai masalah penyelidikan dan cadangan kertas itu; ia tidak menetapkan bahawa LURE ialah sistem yang digunakan atau kaedah latihan sedia pengeluaran.

LURE membahagikan proses latihan kepada dua peranan. Pengelak LLM meletakkan tugas di sepanjang paksi kesukaran persekitaran, manakala pengejar pelaksana perancang cuba menyelesaikan tugas tersebut melalui interaksi yang hasilnya boleh disahkan. Akhbar itu mengatakan pengelakan menerima ganjaran sempadan tangkapan yang paling tinggi apabila penyelesai menangkapnya tepat pada separuh daripada pelancarannya. Dalam pembingkaian pengarang, ganjaran itu menukar penempatan tugas yang "hampir tidak dapat ditangkap" menjadi sesuatu yang dipelajari dan bukannya dikuatkuasakan oleh ambang penolakan yang dipilih secara manual. Abstrak tidak menerangkan persekitaran yang tepat, format tugasan atau pelaksanaan pengesah.

Kaedah ini juga mengubah cara model penyelesaian menerima kredit latihan. Daripada hanya bergantung pada ganjaran terminal yang jarang, LURE menggunakan apa yang disebut oleh kertas sebagai kredit proses padat berlabuh penangkapan. Abstrak mengatakan kemajuan pengesah monoton dinormalisasikan kumpulan bersama-sama dengan penangkapan terminal, di bawah kekangan KL berlabuh bulat yang bertujuan untuk menstabilkan evolusi bersama antara peranan penetapan tugas dan penyelesaian tugas. Pengarang melaporkan ujian merentas tiga persekitaran penaakulan yang boleh disahkan dan tiga keluarga tulang belakang, membandingkan tetapan bersatu dan pakar. Sumber tidak mengenal pasti nama tulang belakang, belanjawan latihan, ablasi atau konfigurasi garis dasar yang tepat.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Jika keputusan yang dilaporkan bertahan, LURE boleh menawarkan penyelidik cara untuk menjana dan memilih cabaran penaakulan yang berguna tanpa memasang set data berlabel yang luas. Pendekatannya juga menyasarkan dua masalah latihan berterusan sekaligus: memilih tugas yang sukar tetapi boleh dipelajari, dan memberikan kredit kepada langkah perantaraan dan bukannya hanya kepada jawapan akhir.

Kepentingan praktikal cadangan itu adalah percubaan untuk mengurangkan pergantungan pada latihan penaakulan yang dijana oleh manusia. Mewujudkan koleksi tugasan yang besar dan berkualiti tinggi adalah mahal, dan koleksi tetap boleh menyukarkan untuk mengekalkan cabaran latihan pada tahap yang sesuai. Persediaan evader-pursuer LURE direka untuk melaraskan kesukaran semasa penyelesai bertambah baik. Jika mekanisme itu berfungsi dengan pasti, ia boleh menjadikan latihan bermain sendiri lebih adaptif dan berpotensi mengurangkan jumlah penyusunan tugas manual yang diperlukan untuk beberapa domain penaakulan yang boleh disahkan. Itu adalah kemungkinan implikasi reka bentuk, bukan hasil yang ditubuhkan secara bebas.

Kertas kerja itu juga membincangkan penugasan kredit, isu utama dalam latihan penaakulan pelbagai langkah. Penyelesai mungkin mencapai hasil akhir yang betul selepas urutan yang mengandungi keputusan yang berguna dan tidak membantu, manakala ganjaran terminal sahaja memberikan sedikit maklumat tentang langkah mana yang penting. Dengan mengikat kemajuan pengesah perantaraan kepada acara tangkapan akhir, LURE menyasarkan untuk memberikan isyarat pembelajaran yang lebih padat tanpa mengabaikan kepentingan hasil yang disahkan. Abstrak melaporkan bahawa gabungan ini mengatasi garis dasar lanjutan dalam eksperimen pengarang, tetapi ia tidak menunjukkan sama ada peningkatan itu datang terutamanya daripada pemilihan tugas penyesuaian, kredit yang lebih padat, istilah penstabilan KL atau interaksi mereka.

Keputusan paling kukuh yang dilaporkan ialah model bersatu mencapai ketepatan pukulan sifar keluar agregat yang lebih tinggi daripada semua garis dasar terlatih merentas sembilan penanda aras yang ditahan merangkumi tiga keluarga tugas. Dakwaan itu, jika boleh diterbitkan semula, mencadangkan kaedah itu boleh meningkatkan pemindahan dan bukannya mengoptimumkan persekitaran yang digunakan semasa latihan sahaja. Namun, "agregat yang lebih kukuh" tidak mencukupi untuk menentukan kepentingan praktikal: abstrak tidak memberikan markah, selang keyakinan, hasil setiap penanda aras, perbandingan dengan sistem yang lebih besar atau lebih intensif pengiraan, atau maklumat tentang cara tugasan yang ditahan dipilih. Oleh itu, kerja itu paling baik difahami sebagai hasil penyelidikan yang memerlukan pemeriksaan lanjut, bukan sebagai bukti bahawa permainan kendiri sifar data telah menyelesaikan latihan penaakulan tujuan umum.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Kertas itu ialah pracetak arXiv sembilan muka surat, dan sumbernya hanya menyediakan abstrak. Soalan penting kekal mengenai saiz berangka keuntungan yang dilaporkan, kos pengiraan, pembinaan tugasan, saiz model, komposisi penanda aras, kebolehulangan dan sama ada kaedah pemindahan melangkaui tiga persekitaran dan tiga keluarga tugasan yang diuji.

Langkah pengesahan pertama ialah kertas penuh dan jadual percubaannya. Pembaca harus mencari identiti dan saiz tiga keluarga tulang belakang, definisi tepat bagi tiga persekitaran, bilangan dan jenis tugas latihan, kaedah garis dasar dan pengiraan yang digunakan. Butiran tersebut akan menentukan sama ada keuntungan LURE mencerminkan resipi latihan yang berguna secara meluas atau hasil yang terikat rapat dengan reka bentuk penanda aras tertentu. Petikan sumber mengesahkan bahawa kertas itu mengandungi lima jadual dan lima rajah, tetapi ia tidak memberikan kandungannya.

Kebolehulangan adalah satu lagi isu terbuka. Sumber yang dibekalkan tidak menyatakan sama ada kod, penjana tugas, pelaksanaan pengesah, pusat pemeriksaan atau data latihan tersedia. Oleh kerana kaedah ini bergantung pada pengelak dan pengejar yang berkembang bersama, pilihan kecil dalam penskalaan ganjaran, persampelan pelancaran, penormalan atau penstabilan mungkin menjejaskan hasil. Replikasi bebas merentas keluarga model yang berbeza dan persekitaran yang boleh disahkan akan membantu menentukan sama ada tingkah laku yang dilaporkan adalah teguh atau bergantung pada pelaksanaan pengarang.

Akhir sekali, skop kaedah memerlukan ujian melebihi sembilan penanda aras yang dipegang oleh kertas dan tiga keluarga tugasan. Persekitaran yang boleh disahkan berguna kerana ia memberikan maklum balas objektif, tetapi banyak tugas penaakulan dunia sebenar tidak mempunyai pengesah automatik atau mempunyai kriteria kejayaan yang samar-samar. Masih tidak diketahui sama ada LURE boleh mencipta kurikulum kesukaran yang berguna dalam tetapan tersebut, berapa banyak pengawasan manusia yang masih diperlukan, dan sama ada pengelakan boleh belajar untuk mengeksploitasi kelemahan dalam pengesah daripada menghasilkan cabaran yang benar-benar berharga. Abstrak juga tidak diketahui kos latihan kaedah, kependaman, mod kegagalan dan prestasi pada tugas yang lebih panjang atau kurang berstruktur.

Panduan & kuiz berkaitan

Model AI DiterangkanLatihan AITransformerEjen AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?