Apa yang terjadi
Makalah arXiv memperkenalkan GRPO Kontras Kebisingan, atau NC-GRPO, sebuah metode untuk melatih model bahasa visi dengan pembelajaran penguatan dan penghargaan yang dapat diverifikasi. Ini menambahkan noise Gaussian yang dikalibrasi ke lapisan tersembunyi terakhir model selama pengkodean cepat untuk setengah dari setiap grup peluncuran, menciptakan jalur penalaran alternatif tanpa mengubah protokol gambar, penghargaan, tujuan, atau inferensi. Diuji pada Qwen2.5-VL-7B yang dilatih di Geometry3K, penulis melaporkan kinerja dalam domain yang lebih kuat, penalaran matematis di luar domain yang lebih baik di lima tolok ukur yang ada, dan ketahanan halusinasi yang lebih baik daripada vanilla GRPO.
Makalah ini mempelajari pembelajaran penguatan dengan imbalan yang dapat diverifikasi untuk model bahasa visi, di mana keluaran kandidat dapat diperiksa berdasarkan jawaban yang diketahui atau sinyal objektif lainnya. Proposal utamanya adalah Noise-Contrastive GRPO, atau NC-GRPO. Alih-alih meningkatkan keragaman dengan mengubah suhu decoding atau mengubah gambar input dalam ruang piksel, metode ini menyuntikkan noise Gaussian yang dikalibrasi skala ke dalam lapisan tersembunyi terakhir yang dihasilkan saat prompt sedang dikodekan. Setengah dari peluncuran di setiap grup pengoptimalan menerima gangguan, sedangkan cabang lainnya memberikan perbandingan tanpa gangguan.
Penulis menggambarkan gangguan tersebut sebagai cara untuk menciptakan cabang dari keadaan keberangkatan internal yang terlantar. Sebuah cabang yang masih mencapai jawaban yang benar setelah perpindahan tersebut menerima penguatan relatif terhadap cabang yang tergelincir. Dalam kerangka makalah ini, sensitivitas model pada titik cabang internal tersebut menjadi sinyal gradien kebijakan. Abstraknya menyatakan bahwa tujuan pelatihan, definisi penghargaan, dan protokol inferensi tidak berubah, dan bahwa metode ini dapat diintegrasikan ke dalam jalur pembelajaran penguatan standar melalui perubahan mesin inferensi sekitar 50 baris. Ini adalah klaim yang dibuat oleh penulis, bukan penilaian implementasi yang diverifikasi secara independen.
Eksperimen yang dilaporkan menggunakan Qwen2.5-VL-7B yang dilatih di Geometry3K. Terhadap vanilla GRPO, makalah tersebut mengatakan NC-GRPO secara signifikan meningkatkan penalaran matematis di luar domain pada lima tolok ukur yang ada, dengan uji McNemar gabungan p kurang dari atau sama dengan 0,001. Ini juga melaporkan peningkatan pada tugas dalam domain dan ketahanan halusinasi. Abstrak menyatakan bahwa kebisingan ruang gambar menghasilkan hasil rata-rata di luar domain yang lebih besar pada tolok ukur persepsi yang berat, tetapi mengalami kemunduran pada ketahanan halusinasi. Ablasi mekanisme mengaitkan efek tersebut dengan keragaman stokastik independen, bukan sekadar jumlah atau arah kebisingan, sementara studi skala kebisingan mengidentifikasi trade-off antara spesialisasi penalaran dan kemampuan umum.
Mengapa itu penting
Pekerjaan ini membahas masalah praktis dalam pembelajaran penguatan untuk model multimodal: bagaimana menghasilkan jalur penalaran kandidat yang cukup beragam tanpa mendistorsi masukan visual. Jika hasil yang dilaporkan digeneralisasikan, diversifikasi ruang laten dapat menawarkan perubahan teknis yang relatif kecil untuk meningkatkan transfer penalaran sambil mempertahankan tugas awal dan pengaturan imbalan. Temuan ini juga menunjukkan bahwa pelatihan untuk spesialisasi dan ketahanan matematika mungkin memerlukan pengorbanan yang dapat dikontrol dibandingkan dengan tingkat kebisingan yang optimal secara universal.
Penelitian ini relevan karena keberagaman peluncuran adalah bagian dari cara pembelajaran penguatan mencari perilaku yang lebih baik. Jika setiap kandidat dalam grup pengoptimalan mengikuti jalur internal yang hampir sama, sinyal pelatihan mungkin menawarkan informasi terbatas tentang keputusan mana yang kuat. NC-GRPO menguji apakah keragaman dapat dimasukkan ke dalam representasi model sambil membiarkan gambar yang diamati dan imbalan eksternal dari tugas tersebut tidak tersentuh. Perbedaan ini mungkin penting bagi sistem bahasa penglihatan, di mana perubahan piksel dapat menciptakan artefak atau mengubah masalah itu sendiri, bukannya menguji ketahanan dalam penalaran.
Kontras yang dilaporkan dengan gangguan ruang gambar berpotensi berguna. Para penulis mengatakan kebisingan tingkat piksel rata-rata berkinerja lebih baik untuk tolok ukur di luar domain yang banyak persepsi, tetapi merusak ketahanan halusinasi, sedangkan NC-GRPO meningkatkan ketahanan tersebut dalam eksperimen mereka. Hal ini menunjukkan lokasi gangguan yang berbeda menghasilkan kemampuan yang berbeda: perubahan masukan dapat menguji toleransi visual, sementara perubahan laten dapat mendorong jalur penalaran yang tetap stabil setelah adanya variasi internal. Sumber tersebut tidak menunjukkan rincian yang cukup untuk menentukan apakah penafsiran ini bersifat sebab-akibat di luar ablasi penulis.
Daya tarik praktis metode ini berasal dari klaim kompatibilitasnya dengan pengaturan RLVR yang ada. Abstraknya menyatakan bahwa imbalan, tujuan, dan prosedur inferensi tidak tersentuh, dan penerapannya memerlukan sekitar 50 baris perubahan mesin inferensi. Jika klaim tersebut terbukti, peneliti dapat mengevaluasi teknik tersebut tanpa mendesain ulang seluruh rangkaian pelatihan. Hal ini tidak berarti pendekatan ini murah secara keseluruhan: sumbernya tidak memberikan anggaran komputasi, durasi pelatihan, dampak memori, atau pengukuran throughput. Oleh karena itu, signifikansi publiknya bergantung pada apakah peningkatan kualitas yang dilaporkan membenarkan biaya peluncuran atau pengoptimalan tambahan.
Mekanisme Interaktif: Cara Kerja Sebenarnya
Jelajahi teknologi yang mendasari di balik perkembangan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang harus ditonton selanjutnya
Pertanyaan utama yang belum terjawab adalah apakah peningkatan tersebut dapat bertahan pada lebih banyak ukuran model, tugas visual, dan kumpulan data pelatihan, dan apakah peningkatan tersebut dapat bertahan dalam replikasi independen. Sumber tidak memberikan perubahan akurasi yang tepat, ukuran kumpulan data, hasil per tolok ukur, biaya komputasi, atau detail implementasi lengkap. Hal ini juga tidak menentukan ketersediaan produksi atau keandalan di dunia nyata. Pekerjaan tindak lanjut harus menguji apakah gangguan laten meningkatkan tugas-tugas di luar matematika dan apakah manfaat halusinasi yang dilaporkan tetap berada dalam kondisi gambaran, petunjuk, dan penerapan yang tidak dikenal.
Buktinya masih terbatas pada satu sumber dan satu pengaturan pelatihan bernama: Qwen2.5-VL-7B yang dilatih di Geometry3K. Abstrak tidak mengidentifikasi lima tolok ukur yang ada, melaporkan skor masing-masing, memberikan jumlah sampel, atau menyatakan besarnya peningkatan kekuatan halusinasi. Laporan ini juga tidak menyebutkan apakah perbandingan tersebut menggunakan komputasi yang cocok, jumlah peluncuran yang sama, atau upaya penyetelan hyperparameter yang identik. Rincian tersebut diperlukan untuk menilai apakah hasilnya mencerminkan metode yang berguna secara luas atau konfigurasi eksperimental yang menguntungkan.
Replikasi harus memeriksa skala model, kelompok model, jenis tugas dan modalitas. Para penulis mendeskripsikan NC-GRPO sebagai modalitas-agnostik, namun sumber tersebut tidak memberikan eksperimen yang menunjukkan klaim tersebut di luar pengaturan bahasa penglihatan yang dilaporkan. Tes lebih lanjut dapat mencakup tugas-tugas yang menuntut persepsi, penalaran visual komposisional, pertanyaan-pertanyaan nonmatematis, dan petunjuk yang dirancang untuk menghasilkan jawaban yang tidak didukung. Peneliti juga harus memisahkan keuntungan dari gangguan itu sendiri dan keuntungan yang disebabkan oleh pengambilan sampel stokastik tambahan atau perbedaan pelatihan lainnya.
Hasil skala kebisingan dari makalah ini membuat perilaku penerapan menjadi hal yang tidak diketahui. Abstrak ini menggambarkan hubungan antara penalaran spesialisasi dan kemampuan umum, namun tidak menentukan bagaimana praktisi harus memilih pengaturan tersebut atau seberapa stabil tradeoff di seluruh tugas. Tidak ada klaim atas model yang dirilis, integrasi produk, atau evaluasi produksi. Pembaca harus memperlakukan temuan ini sebagai hasil penelitian awal dari pracetak arXiv hingga metrik, kode, atau detail implementasi yang tepat, dan replikasi independen tersedia.