Kembali ke Berita
InovasiAI Understanding pengarahan

Makalah NC-GRPO melaporkan penalaran bahasa visi yang lebih kuat dari keragaman peluncuran ruang laten

Pracetak arXiv memperkenalkan NC-GRPO, metode pembelajaran penguatan yang mengganggu representasi tersembunyi model bahasa visi daripada gambar masukannya. Para penulis melaporkan peningkatan penalaran matematis di luar domain dan ketahanan halusinasi pada Qwen2.5-VL-7B, sambil mencatat trade-off antara…

5 min readRead the primary source
Primary-source image accompanying NC-GRPO paper reports stronger vision-language reasoning from latent-space rollout diversity
Dokumen sumber utamaSumber direkam
Penerbit
arxiv.org
Tautan sumber
arxiv.orghttps://arxiv.org/abs/2608.21595
Jenis sumber
Dokumen primer — pengumuman resmi, makalah, pengarsipan, atau halaman pihak pertama yang kita baca langsung.
KonteksPahami ini dalam 60 detik

Mulai di sini

Istilah-istilah penting

Model Bahasa Visi (VLM)
Model multimodal yang secara bersama-sama memproses informasi visual dan tekstual.
Pembelajaran Penguatan
Pelatihan dengan imbalan memberi sinyal saat agen mempelajari tindakan yang memaksimalkan keuntungan jangka panjang.
Memori (Memori Agen)
Konteks tersimpan yang digunakan agen AI di seluruh langkah atau sesi untuk meningkatkan kontinuitas.
Uji diri Anda sendiriKuis Penjelasan Model AI

Apa yang terjadi

Makalah arXiv memperkenalkan GRPO Kontras Kebisingan, atau NC-GRPO, sebuah metode untuk melatih model bahasa visi dengan pembelajaran penguatan dan penghargaan yang dapat diverifikasi. Ini menambahkan noise Gaussian yang dikalibrasi ke lapisan tersembunyi terakhir model selama pengkodean cepat untuk setengah dari setiap grup peluncuran, menciptakan jalur penalaran alternatif tanpa mengubah protokol gambar, penghargaan, tujuan, atau inferensi. Diuji pada Qwen2.5-VL-7B yang dilatih di Geometry3K, penulis melaporkan kinerja dalam domain yang lebih kuat, penalaran matematis di luar domain yang lebih baik di lima tolok ukur yang ada, dan ketahanan halusinasi yang lebih baik daripada vanilla GRPO.

Makalah ini mempelajari pembelajaran penguatan dengan imbalan yang dapat diverifikasi untuk model bahasa visi, di mana keluaran kandidat dapat diperiksa berdasarkan jawaban yang diketahui atau sinyal objektif lainnya. Proposal utamanya adalah Noise-Contrastive GRPO, atau NC-GRPO. Alih-alih meningkatkan keragaman dengan mengubah suhu decoding atau mengubah gambar input dalam ruang piksel, metode ini menyuntikkan noise Gaussian yang dikalibrasi skala ke dalam lapisan tersembunyi terakhir yang dihasilkan saat prompt sedang dikodekan. Setengah dari peluncuran di setiap grup pengoptimalan menerima gangguan, sedangkan cabang lainnya memberikan perbandingan tanpa gangguan.

Penulis menggambarkan gangguan tersebut sebagai cara untuk menciptakan cabang dari keadaan keberangkatan internal yang terlantar. Sebuah cabang yang masih mencapai jawaban yang benar setelah perpindahan tersebut menerima penguatan relatif terhadap cabang yang tergelincir. Dalam kerangka makalah ini, sensitivitas model pada titik cabang internal tersebut menjadi sinyal gradien kebijakan. Abstraknya menyatakan bahwa tujuan pelatihan, definisi penghargaan, dan protokol inferensi tidak berubah, dan bahwa metode ini dapat diintegrasikan ke dalam jalur pembelajaran penguatan standar melalui perubahan mesin inferensi sekitar 50 baris. Ini adalah klaim yang dibuat oleh penulis, bukan penilaian implementasi yang diverifikasi secara independen.

Eksperimen yang dilaporkan menggunakan Qwen2.5-VL-7B yang dilatih di Geometry3K. Terhadap vanilla GRPO, makalah tersebut mengatakan NC-GRPO secara signifikan meningkatkan penalaran matematis di luar domain pada lima tolok ukur yang ada, dengan uji McNemar gabungan p kurang dari atau sama dengan 0,001. Ini juga melaporkan peningkatan pada tugas dalam domain dan ketahanan halusinasi. Abstrak menyatakan bahwa kebisingan ruang gambar menghasilkan hasil rata-rata di luar domain yang lebih besar pada tolok ukur persepsi yang berat, tetapi mengalami kemunduran pada ketahanan halusinasi. Ablasi mekanisme mengaitkan efek tersebut dengan keragaman stokastik independen, bukan sekadar jumlah atau arah kebisingan, sementara studi skala kebisingan mengidentifikasi trade-off antara spesialisasi penalaran dan kemampuan umum.

Detail sumber: arxiv.org ↗

Mengapa itu penting

Pekerjaan ini membahas masalah praktis dalam pembelajaran penguatan untuk model multimodal: bagaimana menghasilkan jalur penalaran kandidat yang cukup beragam tanpa mendistorsi masukan visual. Jika hasil yang dilaporkan digeneralisasikan, diversifikasi ruang laten dapat menawarkan perubahan teknis yang relatif kecil untuk meningkatkan transfer penalaran sambil mempertahankan tugas awal dan pengaturan imbalan. Temuan ini juga menunjukkan bahwa pelatihan untuk spesialisasi dan ketahanan matematika mungkin memerlukan pengorbanan yang dapat dikontrol dibandingkan dengan tingkat kebisingan yang optimal secara universal.

Penelitian ini relevan karena keberagaman peluncuran adalah bagian dari cara pembelajaran penguatan mencari perilaku yang lebih baik. Jika setiap kandidat dalam grup pengoptimalan mengikuti jalur internal yang hampir sama, sinyal pelatihan mungkin menawarkan informasi terbatas tentang keputusan mana yang kuat. NC-GRPO menguji apakah keragaman dapat dimasukkan ke dalam representasi model sambil membiarkan gambar yang diamati dan imbalan eksternal dari tugas tersebut tidak tersentuh. Perbedaan ini mungkin penting bagi sistem bahasa penglihatan, di mana perubahan piksel dapat menciptakan artefak atau mengubah masalah itu sendiri, bukannya menguji ketahanan dalam penalaran.

Kontras yang dilaporkan dengan gangguan ruang gambar berpotensi berguna. Para penulis mengatakan kebisingan tingkat piksel rata-rata berkinerja lebih baik untuk tolok ukur di luar domain yang banyak persepsi, tetapi merusak ketahanan halusinasi, sedangkan NC-GRPO meningkatkan ketahanan tersebut dalam eksperimen mereka. Hal ini menunjukkan lokasi gangguan yang berbeda menghasilkan kemampuan yang berbeda: perubahan masukan dapat menguji toleransi visual, sementara perubahan laten dapat mendorong jalur penalaran yang tetap stabil setelah adanya variasi internal. Sumber tersebut tidak menunjukkan rincian yang cukup untuk menentukan apakah penafsiran ini bersifat sebab-akibat di luar ablasi penulis.

Daya tarik praktis metode ini berasal dari klaim kompatibilitasnya dengan pengaturan RLVR yang ada. Abstraknya menyatakan bahwa imbalan, tujuan, dan prosedur inferensi tidak tersentuh, dan penerapannya memerlukan sekitar 50 baris perubahan mesin inferensi. Jika klaim tersebut terbukti, peneliti dapat mengevaluasi teknik tersebut tanpa mendesain ulang seluruh rangkaian pelatihan. Hal ini tidak berarti pendekatan ini murah secara keseluruhan: sumbernya tidak memberikan anggaran komputasi, durasi pelatihan, dampak memori, atau pengukuran throughput. Oleh karena itu, signifikansi publiknya bergantung pada apakah peningkatan kualitas yang dilaporkan membenarkan biaya peluncuran atau pengoptimalan tambahan.

Interactive Mechanism

Mekanisme Interaktif: Cara Kerja Sebenarnya

Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Pemeriksaan Konsep Interaktif+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Apa yang harus ditonton selanjutnya

Pertanyaan utama yang belum terjawab adalah apakah peningkatan tersebut dapat bertahan pada lebih banyak ukuran model, tugas visual, dan kumpulan data pelatihan, dan apakah peningkatan tersebut dapat bertahan dalam replikasi independen. Sumber tidak memberikan perubahan akurasi yang tepat, ukuran kumpulan data, hasil per tolok ukur, biaya komputasi, atau detail implementasi lengkap. Hal ini juga tidak menentukan ketersediaan produksi atau keandalan di dunia nyata. Pekerjaan tindak lanjut harus menguji apakah gangguan laten meningkatkan tugas-tugas di luar matematika dan apakah manfaat halusinasi yang dilaporkan tetap berada dalam kondisi gambaran, petunjuk, dan penerapan yang tidak dikenal.

Buktinya masih terbatas pada satu sumber dan satu pengaturan pelatihan bernama: Qwen2.5-VL-7B yang dilatih di Geometry3K. Abstrak tidak mengidentifikasi lima tolok ukur yang ada, melaporkan skor masing-masing, memberikan jumlah sampel, atau menyatakan besarnya peningkatan kekuatan halusinasi. Laporan ini juga tidak menyebutkan apakah perbandingan tersebut menggunakan komputasi yang cocok, jumlah peluncuran yang sama, atau upaya penyetelan hyperparameter yang identik. Rincian tersebut diperlukan untuk menilai apakah hasilnya mencerminkan metode yang berguna secara luas atau konfigurasi eksperimental yang menguntungkan.

Replikasi harus memeriksa skala model, kelompok model, jenis tugas dan modalitas. Para penulis mendeskripsikan NC-GRPO sebagai modalitas-agnostik, namun sumber tersebut tidak memberikan eksperimen yang menunjukkan klaim tersebut di luar pengaturan bahasa penglihatan yang dilaporkan. Tes lebih lanjut dapat mencakup tugas-tugas yang menuntut persepsi, penalaran visual komposisional, pertanyaan-pertanyaan nonmatematis, dan petunjuk yang dirancang untuk menghasilkan jawaban yang tidak didukung. Peneliti juga harus memisahkan keuntungan dari gangguan itu sendiri dan keuntungan yang disebabkan oleh pengambilan sampel stokastik tambahan atau perbedaan pelatihan lainnya.

Hasil skala kebisingan dari makalah ini membuat perilaku penerapan menjadi hal yang tidak diketahui. Abstrak ini menggambarkan hubungan antara penalaran spesialisasi dan kemampuan umum, namun tidak menentukan bagaimana praktisi harus memilih pengaturan tersebut atau seberapa stabil tradeoff di seluruh tugas. Tidak ada klaim atas model yang dirilis, integrasi produk, atau evaluasi produksi. Pembaca harus memperlakukan temuan ini sebagai hasil penelitian awal dari pracetak arXiv hingga metrik, kode, atau detail implementasi yang tepat, dan replikasi independen tersedia.

Panduan & kuis terkait

Model AI DijelaskanPelatihan AItransformatorChatGPT & LLMUji pengetahuan Anda — coba kuis AI gratisCari istilah AI di glosarium kamiIkuti pelacak rilis model AI
Apakah ini berguna?