Kembali ke Berita
InovasiAI Understanding taklimat

Kertas mencadangkan padanan halaju untuk menyesuaikan skala ganjaran untuk model resapan

Penyelidik mencadangkan padanan halaju berasaskan ganjaran, kaedah bebas trajektori yang mengemas kini secara langsung medan halaju model resapan dan, mereka melaporkan, mencapai hasil yang setanding atau lebih baik daripada kaedah berasaskan kemungkinan pada kos latihan yang lebih rendah.

5 min readRead the primary source
Primary-source image accompanying Paper proposes velocity matching to scale reward fine-tuning for diffusion models
Dokumen sumber utamaSumber direkodkan
Penerbit
arxiv.org
Pautan sumber
arxiv.orghttps://arxiv.org/abs/2608.23664
Jenis sumber
Dokumen utama — pengumuman rasmi, kertas, pemfailan atau halaman pihak pertama yang kami baca secara langsung.
KonteksFahami perkara ini dalam masa 60 saat

Mulakan di sini

Istilah utama

Penalaan Halus
Meneruskan latihan tentang data khusus domain untuk menyesuaikan model pra-latihan kepada tugas tertentu.
Pembelajaran Pengukuhan
Latihan melalui isyarat ganjaran di mana ejen mempelajari tindakan yang memaksimumkan pulangan jangka panjang.
Model Penyebaran
Seni bina generatif yang belajar membalikkan hingar untuk mensintesis imej, audio atau kandungan lain.
Uji diri andaKuiz Penjelasan Model AI

Apa yang berlaku

Satu pasukan tujuh penyelidik menyerahkan kertas arXiv yang mencadangkan padanan halaju berasaskan ganjaran (RVM), kaedah untuk memperhalusi model resapan ke arah keutamaan manusia atau matlamat khusus tugas. RVM mengemas kini medan halaju model secara langsung dan bukannya membina semula kemungkinan daripada mengecilkan trajektori atau menganggarkan kemungkinan titik akhir.

Sumbernya ialah penyerahan arXiv bertarikh 24 Ogos 2026, bertajuk "Pembelajaran Pengukuhan Penskalaan untuk Model Resapan melalui Padanan Halaju." Penulis mempersembahkan penalaan halus ganjaran sebagai cara untuk menyesuaikan model penyebaran kepada keutamaan manusia dan objektif khusus tugas. Tuntutan utama mereka ialah pendekatan sedia ada meminjam jentera kecerunan dasar yang direka untuk model autoregresif, mewujudkan kerumitan tambahan kerana model resapan tidak memberikan kemungkinan yang boleh diurus untuk sampel yang dijana.

Kaedah yang dicadangkan, padanan halaju berasaskan ganjaran, digambarkan sebagai bebas trajektori. Daripada membina kebarangkalian daripada peralihan denoising stokastik atau menganggarkan kebarangkalian titik akhir dengan bukti sempadan yang lebih rendah, RVM bertindak secara langsung pada medan halaju. Menurut abstrak kertas itu, kemas kini mengukuhkan arah yang berkaitan dengan generasi ganjaran tinggi dan menyekat arah yang dikaitkan dengan generasi ganjaran rendah.

RVM termasuk istilah sauh pilihan yang bertujuan untuk mengawal hanyutan daripada halaju rujukan. Penulis juga mengatakan rangka kerja itu boleh memulihkan kaedah penalaan halus baru-baru ini, termasuk RAM dan DiffusionNFT, sebagai kes khas. Itu menjadikan cadangan itu sebagai rumusan penyatuan serta peraturan kemas kini baharu, walaupun sumber yang dibekalkan tidak menerangkan terbitan yang tepat atau syarat di mana kesetaraan tersebut dipegang.

Para penyelidik melaporkan ujian merentas pelbagai tugasan ganjaran model penyebaran berskala besar. Mereka mengatakan RVM berdaya saing dengan atau mengatasi kaedah kecerunan dasar berasaskan trajektori sambil memerlukan kos latihan yang jauh lebih sedikit. Untuk penjanaan video, mereka melaporkan bahawa ganjaran keutamaan standard boleh menghasilkan output yang bersih secara visual tetapi hampir statik; mereka memperkenalkan ganjaran penjejakan dinamik dan mengatakan ia meningkatkan pergerakan sambil juga meningkatkan prestasi VBench keseluruhan. Tiada markah berangka, nama model, belanjawan latihan atau jadual perbandingan disertakan dalam sumber yang dibekalkan.

Butiran sumber: arxiv.org ↗

Mengapa ia penting

Makalah itu berpendapat bahawa kemas kini halaju langsung boleh memudahkan dan mengurangkan kos penalaan halus ganjaran untuk sistem penyebaran imej dan video berskala besar. Percubaan videonya juga mengenal pasti pertukaran dalam ganjaran keutamaan standard: mereka mungkin memilih output bersih secara visual dengan sedikit gerakan.

Jika dakwaan kertas itu digeneralisasikan, mengoptimumkan secara langsung perwakilan halaju asli model penyebaran boleh menjadikan penalaan halus ganjaran lebih mudah untuk skala. Kepentingan praktikal bukan sekadar fungsi kerugian baharu: kaedah ini menyasarkan overhed pengiraan dan algoritma yang dikaitkan dengan pengoptimuman dasar berasaskan kemungkinan. Kos latihan yang lebih rendah boleh menjadikan pilihan atau penyesuaian khusus tugas lebih mudah diakses oleh pasukan yang bekerja dengan penjana imej dan video yang besar.

Kertas itu juga menumpukan perhatian pada reka bentuk ganjaran itu sendiri. Dalam eksperimen video pengarang, ganjaran yang menekankan kebersihan visual dilaporkan mengutamakan output dengan sedikit pergerakan. Ganjaran penjejakan dinamik mereka dipersembahkan sebagai cara untuk mengukur gerakan dengan lebih berkesan, sambil masih meningkatkan hasil keseluruhan VBench kertas itu. Ini menggambarkan bahawa penambahbaikan sistem generatif bergantung bukan sahaja pada peraturan kemas kini tetapi juga pada perkara yang diminta untuk menilai proses pengoptimuman.

Istilah utama pilihan penting kerana pengoptimuman ganjaran boleh mengalihkan model daripada tingkah laku rujukan. Sumber itu berkata kawalan sauh hanyut daripada halaju rujukan, tetapi ia tidak menyatakan bagaimana kawalan itu mempengaruhi kualiti, kepelbagaian, kestabilan atau risiko terlampau padat kepada ganjaran. Butiran tersebut akan menentukan sama ada RVM berguna untuk penyesuaian terkawal dan bukannya untuk pengoptimuman penanda aras sahaja.

Hasilnya kekal sebagai tuntutan penyelidikan daripada satu kertas arXiv, bukan bukti bahawa latihan model resapan telah berubah secara meluas. Abstrak yang dibekalkan tidak mengenal pasti model yang diuji, set data, magnitud ganjaran, penjimatan pengiraan, variasi statistik atau kes kegagalan. Ia juga tidak menentukan sama ada kaedah itu berfungsi sama baiknya untuk imej, video dan aplikasi penyebaran lain, atau sama ada kelebihannya bergantung pada reka bentuk ganjaran tertentu.

Interactive Mechanism

Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya

Terokai teknologi asas di sebalik pembangunan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Semakan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang perlu ditonton seterusnya

Soalan utama ialah sama ada kelebihan kos dan kualiti yang dilaporkan RVM berlaku merentas eksperimen yang diterbitkan semula secara bebas, fungsi ganjaran, saiz model dan tugas penjanaan, dan sama ada kaedah itu boleh mengelakkan pengoptimuman untuk ganjaran yang sempit atau mengelirukan. Sumber yang dibekalkan tidak memberikan hasil berangka, butiran pelaksanaan, mengira belanjawan atau bukti pengesahan luaran.

Pengeluaran semula harus memberi tumpuan terlebih dahulu pada perbandingan kertas dengan kaedah kecerunan dasar berasaskan trajektori. Semakan berguna akan merangkumi model dan tugas yang sama di bawah belanjawan pengiraan yang dipadankan, kerana "kos latihan yang dikurangkan dengan ketara" bermakna hanya apabila perakaunan merangkumi semua kerja latihan dan penilaian yang berkaitan. Sumber yang dibekalkan tidak memberikan nisbah kos berangka, jadi saiz kelebihan yang dituntut tidak diketahui.

Reka bentuk ganjaran layak mendapat penilaian berasingan daripada kemas kini halaju. Penulis mengatakan bahawa, setelah kemas kini halaju dipermudahkan, varian kerugian tertentu kurang penting daripada reka bentuk ganjaran dan sauh. Dakwaan itu menunjukkan bahawa penambahbaikan boleh sangat bergantung pada cara generasi ganjaran tinggi dan rendah dilabelkan atau diberi markah. Oleh itu, ujian bebas harus mengubah fungsi ganjaran dan mengukur sama ada keuntungan berterusan di luar objektif kertas yang dipilih.

Untuk penjanaan video, pemerhati harus menyemak sama ada ganjaran penjejakan dinamik meningkatkan gerakan bermakna atau hanya meningkatkan perubahan yang boleh dilihat. Sumber melaporkan gerakan yang lebih baik dan hasil keseluruhan VBench yang lebih baik, tetapi ia tidak memberikan metrik asas atau menerangkan mod kegagalan. Penilaian hendaklah mengkaji kualiti visual, ketekalan temporal dan kepelbagaian bersama-sama, termasuk kes di mana gerakan tidak diingini atau bercanggah dengan kandungan yang dimaksudkan.

Kepentingan kertas kerja yang lebih luas akan bergantung pada pelaksanaan dan butiran pengesahan yang tidak terdapat dalam sumber yang dibekalkan. Perkara yang tidak diketahui penting termasuk parameterisasi halaju yang tepat, tetapan utama, model dan liputan set data, tempoh latihan, kebolehulangan perbandingan yang dilaporkan dan sama ada RVM kekal stabil apabila objektif ganjaran berubah. Kertas susulan, kod yang dikeluarkan dan replikasi bebas akan membantu menentukan sama ada cadangan itu adalah kaedah penskalaan umum atau hasil yang terikat dengan eksperimen tertentu.

Panduan & kuiz berkaitan

Model AI DiterangkanLatihan AITransformerMasa Depan AIUji apa yang anda tahu — cuba kuiz AI percumaCari istilah AI dalam glosari kamiIkuti penjejak keluaran model AI
Adakah ini berguna?