Apa yang berlaku
Penyelidik Zhibo Hou, Fan Zhao, Zhiyu An dan Wan Du mencadangkan Suntikan Golden-GRPO, atau GRIN, rangka kerja pembelajaran kendiri tiga peringkat untuk terus menambah pengetahuan kepada model bahasa yang besar. Komponen utamanya, Golden-GRPO, ialah kaedah pembelajaran pengukuhan dasar campuran yang membekalkan jawapan rujukan apabila percubaan atas dasar model gagal berdasarkan fakta baharu. Makalah ini memperkenalkan dua penanda aras peringkat dokumen, Kosong dan Kaunter, untuk menguji pemerolehan pengetahuan baru dan penimpaan balas fakta. Penulis melaporkan bahawa GRIN mengatasi prestasi penalaan halus diselia dan garis dasar pembelajaran peneguhan dasar campuran lain pada soalan yang lebih sukar sambil memadankannya pada ingatan fakta asas.
Sumbernya ialah abstrak arXiv untuk kertas kerja yang diserahkan pada 26 Ogos 2026. Penulis merangka suntikan pengetahuan berterusan sebagai satu cara untuk memastikan model bahasa besar sentiasa terkini dalam persekitaran yang cepat berubah. Mereka berpendapat bahawa kaedah penalaan halus sedia ada boleh menghafal fakta yang disuntik dalam format yang digunakan untuk latihan tetapi mungkin gagal apabila maklumat yang sama diparafrasa, digabungkan dengan dokumen lain atau digunakan dalam penaakulan. Oleh itu makalah ini memfokuskan sama ada model boleh menggunakan maklumat baharu secara fleksibel selepas kemas kini, bukan sahaja mengulang fakta langsung.
Sistem yang dicadangkan dipanggil Golden-GRPO Injection, atau GRIN, dan digambarkan sebagai rangka kerja pembelajaran kendiri tiga peringkat. Algoritma pusatnya, Golden-GRPO, ialah kaedah pembelajaran pengukuhan dasar campuran yang direka untuk suntikan pengetahuan. Menurut abstrak, ia memberikan "jawapan emas" sebagai isyarat pembelajaran walaupun pelancaran atas dasar gagal berdasarkan fakta baru. Dari segi praktikal, kaedah ini bertujuan untuk mengelak hanya bergantung pada percubaan berjaya model itu sendiri apabila pengetahuan yang diperkenalkan adalah baharu dan model belum tahu cara menjawab dengan betul.
Kertas itu juga memperkenalkan dua penanda aras peringkat dokumen. Blank menyasarkan pemerolehan novel, manakala Counter menyasarkan ganti fakta. Abstrak mengatakan kedua-dua penanda aras menilai tiga keupayaan: mengingati satu fakta, mendapatkan maklumat daripada pelbagai sumber dan melakukan penaakulan inferens. Struktur ini penting kerana ia memisahkan ingatan terus daripada tugas yang memerlukan model yang dikemas kini untuk menggabungkan maklumat atau memperoleh jawapan. Sumber tidak memberikan saiz penanda aras, perkara, proses pembinaan atau contoh.
Penulis melaporkan bahawa pembelajaran pengukuhan dasar bercampur membolehkan "penyerapan pengetahuan" melebihi apa yang boleh dicapai oleh penalaan halus yang diselia. Mereka selanjutnya menyatakan bahawa GRIN secara ketara mengatasi garis dasar pembelajaran peneguhan dan peneguhan dasar yang diselia dengan ketara pada jenis soalan yang lebih sukar, sambil memadankan kaedah tersebut pada ingatan fakta asas. Ini adalah tuntutan yang dibuat oleh pengarang kertas itu. Sumber yang dibekalkan tidak mengandungi skor berangka, anggaran ketidakpastian, keputusan ablasi atau butiran tentang model dan data yang digunakan, jadi magnitud dan keteguhan peningkatan yang dilaporkan tidak boleh dinilai daripada abstrak sahaja.
Mengapa ia penting
Kertas kerja itu menangani had praktikal mengemas kini model bahasa: mempelajari fakta dalam format yang digunakan semasa latihan tidak semestinya bermakna menerapkannya apabila perkataan, dokumen atau permintaan penaakulan berubah. Jika pendekatan yang dilaporkan digeneralisasikan, ia boleh menjadikan kemas kini model lebih berguna dengan menguji sama ada pengetahuan yang baru dibekalkan disepadukan dan bukannya hanya dihafal. Sumber tidak memberikan pengesahan bebas, keputusan terperinci atau bukti penggunaan, jadi kepentingannya kekal sebagai tuntutan penyelidikan empirikal dan bukannya keupayaan pengeluaran yang mantap.
Isu utama ialah perbezaan antara menghafal pernyataan yang baru dibekalkan dan menggunakan maklumat tersebut sebagai sebahagian daripada tingkah laku model yang lebih luas. Sistem yang menjawab hanya apabila digesa dalam perkataan yang sama yang digunakan semasa latihan mungkin kurang berguna berbanding sistem yang boleh mengecam parafrasa, menyambungkan dokumen berasingan dan menaakul daripada maklumat yang dikemas kini. GRIN direka bentuk berdasarkan perbezaan itu, menjadikan kertas itu relevan secara langsung dengan cara model bahasa boleh dikekalkan selepas latihan asalnya.
Penilaian yang dicadangkan juga menunjukkan standard yang lebih menuntut untuk kemas kini model. Pengingatan fakta tunggal boleh menunjukkan sama ada item telah dikekalkan, tetapi pengambilan berbilang sumber dan penaakulan inferens menguji sama ada maklumat itu boleh diakses dan digunakan dalam konteks yang berbeza-beza. Tulis ganti kontrafaktual amat berkaitan dengan pengemaskinian berterusan kerana ia meneliti sama ada model boleh menggantikan versi maklumat terdahulu dengan yang baharu. Sumber tidak menentukan sejauh mana GRIN melaksanakan operasi ini dengan pasti, tetapi ia mengenal pasti keupayaan konkrit yang perlu diukur oleh kaedah kemas kini.
Jika keputusan pengarang kekal pada model dan set data, pendekatan itu boleh mengurangkan jurang antara mengemas kini gelagat tersimpan model dan membolehkannya menggunakan pengetahuan yang baru diperkenalkan. Itu mungkin penting untuk aplikasi yang perubahan maklumat dan jawapan bergantung pada menggabungkan beberapa dokumen yang dibekalkan. Walau bagaimanapun, sumber itu menerangkan rangka kerja penyelidikan, bukan produk atau penggunaan yang dikeluarkan. Ia tidak menunjukkan bahawa GRIN berfungsi dalam tetapan operasi sebenar, kekal stabil sepanjang banyak kitaran kemas kini atau mengelak daripada merosakkan keupayaan yang tidak berkaitan.
Terdapat juga batasan penting untuk bukti yang tersedia di sini. Penyerahan adalah pracetak dan bahan yang dibekalkan hanyalah teks dan abstrak halaman pendaratan arXiv. Tiada hasil semakan rakan diberikan, dan tiada replikasi luaran atau penilaian bebas disebut. Abstrak tidak mengenal pasti pelaksanaan garis dasar, bilangan model yang dinilai, jenis pengetahuan yang disuntik, atau kekuatan statistik perbandingan. Perkara yang tidak diketahui itu bermakna hasilnya adalah penyelidikan yang berpotensi berguna, tetapi belum lagi merupakan penyelesaian umum yang ditunjukkan untuk memastikan model bahasa yang digunakan sentiasa terkini.
Mekanisme Interaktif: Bagaimana Ia Berfungsi Sebenarnya
Terokai teknologi asas di sebalik pembangunan ini secara interaktif.
Which component of an AI application is the machine-learning model itself?
Apa yang perlu ditonton seterusnya
Susulan yang paling penting ialah bukti penuh di sebalik keuntungan yang dilaporkan GRIN: komposisi penanda aras, model dan butiran latihan, keputusan berangka, perbandingan dengan kaedah kemas kini yang lebih kukuh dan prestasi pada pengetahuan yang tidak dipilih oleh pengarang. Ia juga tidak jelas daripada sumber bagaimana kaedah mengendalikan dokumen yang bercanggah atau tidak betul, berapa kerap timpa balas fakta berjaya, sama ada pendekatan itu mengubah pengetahuan yang dipelajari sebelum ini secara tidak sengaja, dan sama ada kod atau data penanda aras akan dikeluarkan.
Kertas penuh harus menjelaskan perkara yang dilakukan oleh tiga peringkat GRIN dan cara Golden-GRPO mencampurkan dasarnya. Ia juga harus menunjukkan sama ada isyarat jawapan rujukan dijana, dipilih atau disediakan sebaliknya, kerana kebolehpercayaan dan kos isyarat itu boleh menjejaskan penggunaan praktikal. Butiran tentang tempoh latihan, keperluan pengiraan dan bilangan contoh kemas kini akan membantu menentukan sama ada kaedah itu boleh dilaksanakan di luar percubaan terkawal.
Penanda aras memerlukan pemeriksaan rapi. Pembaca harus mencari domain yang diwakili dalam Blank dan Counter, cara fakta baru dipisahkan daripada data latihan terdahulu, cara soalan berbilang sumber dibina dan cara jawapan inferensi dijaringkan. Ia juga penting untuk melihat sama ada keuntungan yang dilaporkan berterusan di bawah parafrasa dan gabungan dokumen yang tidak sejajar dengan contoh latihan. Abstrak menetapkan ujian yang dimaksudkan tetapi tidak memberikan maklumat yang mencukupi untuk menilai keluasan atau kesukarannya.
Tulis ganti kontrafak menimbulkan persoalan kebolehpercayaan yang berasingan: menukar satu pengetahuan boleh menyebabkan perubahan yang tidak diingini di tempat lain. Sumber itu tidak menyatakan sama ada pengarang mengukur pengekalan fakta yang tidak berkaitan, konflik antara dokumen, kemas kini berulang atau pengembalian kepada maklumat terdahulu. Ujian tersebut akan membantu membezakan pengemaskinian pengetahuan terkawal daripada kaedah yang hanya meningkatkan prestasi pada set contoh yang disuntik yang sempit.
Akhir sekali, kerja susulan harus menentukan sama ada penemuan itu mereplikasi merentas model bahasa dan jenis pengetahuan. Sumber itu tidak menyebut kod, rancangan keluaran penanda aras, pusat pemeriksaan model awam atau pengguna dunia sebenar. Ia juga tidak menyatakan cara kaedah mengendalikan jawapan rujukan yang salah atau maklumat yang baru disuntik yang bercanggah dengan dokumen lain. Sehingga soalan-soalan tersebut dijawab, kesimpulan yang paling jelas adalah terhad: kertas itu melaporkan hala tuju percubaan yang menjanjikan untuk menilai dan melatih kemas kini pengetahuan berterusan, dengan kelebihan terkuatnya yang didakwa muncul pada tugas yang lebih sukar dan tidak dapat diingat semula.