Komawa Labarai
Bidi'aAI Understanding takaitaccen bayani

Takardar GRIN tana ba da shawarar ƙarfafa koyo don ci gaba da allurar ilimi a cikin ƙirar harshe

Sabuwar takarda ta arXiv tana ba da shawarar allurar Golden-GRPO, tsarin ilmantarwa mai matakai uku wanda aka yi niyya don taimakawa manyan samfuran harshe su sami sabon ilimin allura da amfani da shi a cikin fastoci, takaddun da aka haɗa da ayyukan tunani.

6 min readRead the primary source
Primary-source image accompanying GRIN paper proposes reinforcement learning for continual knowledge injection in language models
Takardun tushe na farkoAn rubuta tushen tushe
Mawallafi
arxiv.org
Tushen hanyar haɗin gwiwa
arxiv.orghttps://arxiv.org/abs/2608.25243
Nau'in tushe
Takardun farko - sanarwar hukuma, takarda, yin rajista, ko shafi na farko da muka karanta kai tsaye.
MaganaFahimtar wannan a cikin daƙiƙa 60

Fara a nan

Mabuɗin sharuddan

Ƙarfafa Koyo
Horowa ta siginar lada inda wakili ke koyon ayyuka waɗanda ke haɓaka dawowa na dogon lokaci.
Kyakkyawan-Tuning
Ci gaba da horarwa akan ƙayyadaddun bayanai na yanki don daidaita samfurin da aka riga aka horar zuwa takamaiman aiki.
Karfi
Ƙarfin samfurin don kula da aiki a ƙarƙashin amo, canje-canje, ko abubuwan shigar gaba.
Gwada kankaAI Model An Bayyana Tambayoyi

Me ya faru

Masu bincike Zhibo Hou, Fan Zhao, Zhiyu An da Wan Du sun ba da shawarar Golden-GRPO Injection, ko GRIN, tsarin koyo da kai na matakai uku don ci gaba da ƙara ilimi ga manyan nau'ikan harshe. Babban ɓangaren sa, Golden-GRPO, hanya ce ta haɓaka-manufofin ƙarfafawa-koyo wanda ke ba da amsar tunani lokacin da yunƙurin aiwatar da tsarin ya gaza kan sabuwar hujja. Takardar ta gabatar da ma'auni-matakin daftarin aiki, Blank da Counter, don gwada ilimin sabon labari da sake rubutawa na karya. Marubutan sun ba da rahoton cewa GRIN ya zarce kulawar daidaitawa da sauran ƙa'idodi masu haɗaɗɗiyar ƙarfafa-koyo akan tambayoyi masu wuya yayin da suka dace da su akan ainihin abin tunawa.

Madogaran shine arXiv abstract don takarda da aka ƙaddamar a kan Agusta 26, 2026. Mawallafa sun tsara alluran ilimin ci gaba da ci gaba da zama hanyar kiyaye manyan nau'ikan harshe a halin yanzu a cikin yanayi mai saurin canzawa. Suna jayayya cewa hanyoyin gyaran gyare-gyaren da ake kulawa zasu iya haddace bayanan allura a tsarin da aka yi amfani da su don horarwa amma yana iya kasawa idan aka kwatanta wannan bayanin, hade da wasu takardu ko amfani da su wajen tunani. Takardar don haka tana mai da hankali kan ko ƙirar zata iya amfani da sabbin bayanai a sassauƙa bayan sabuntawa, ba kawai maimaita gaskiyar kai tsaye ba.

Tsarin da aka tsara ana kiransa Golden-GRPO Injection, ko GRIN, kuma an siffanta shi azaman tsarin ilmantarwa na matakai uku. Algorithm ɗinta na tsakiya, Golden-GRPO, hanya ce mai gauraya-manufofin ƙarfafa-koyo da aka ƙera don allurar ilimi. Bisa ga taƙaitaccen bayanin, yana ba da "amsa na zinariya" a matsayin siginar koyo ko da lokacin da tsarin aiwatarwa ya gaza kan gaskiyar labari. A cikin sharuddan aiki, hanyar da aka yi niyya don guje wa dogaro kawai ga ƙoƙarin nasara na samfurin lokacin da ilimin da aka gabatar ya zama sabon kuma samfurin bai riga ya san yadda za a amsa daidai ba.

Har ila yau, takardar ta gabatar da ma'auni na matakin daftari biyu. Blank yana nufin siyan sabon labari, yayin da Counter ke hari akan sake rubutawa na karya. Ƙididdigar ta ce duka ma'auni suna kimanta iyawa guda uku: tunawa da gaskiya guda ɗaya, maido bayanai daga maɓuɓɓuka da yawa, da kuma yin tunani mara kyau. Wannan tsarin yana da mahimmanci saboda yana raba tunowa kai tsaye daga ayyukan da ke buƙatar sabunta samfurin don haɗa bayanai ko samun amsa. Madogararsa baya bayar da girman ma'auni, batun batun, tsarin gini ko misalai.

Marubutan sun ba da rahoton cewa ilmantarwa mai gauraya-manufofin ƙarfafawa yana ba da damar "ƙarar ilimi" fiye da abin da daidaitawa mai kyau zai iya cimma. Sun kuma bayyana cewa GRIN yana da matuƙar ƙaƙƙarfan ƙwaƙƙwaran sa ido da kyau da kuma ingantaccen tsarin ƙarfafa tsarin ilmantarwa akan nau'ikan tambayoyi masu wuyar gaske, yayin da ya dace da waɗancan hanyoyin akan ainihin abin tunawa. Waɗannan iƙirari ne da marubutan jaridar suka yi. Tushen da aka kawo ba ya ƙunshi ƙididdiga na ƙididdigewa, ƙididdiga marasa tabbas, sakamakon sokewa ko cikakkun bayanai game da waɗanne samfura da bayanai aka yi amfani da su, don haka ba za a iya ƙididdige girma da ƙarfi na ci gaban da aka ruwaito shi kaɗai ba.

Bayanan tushe: arxiv.org ↗

Me ya sa yake da mahimmanci

Takardar ta yi magana akan ƙayyadaddun ƙayyadaddun ƙayyadaddun ƙirar harshe: koyan gaskiya cikin sigar da aka yi amfani da su yayin horo ba lallai ba ne yana nufin yin amfani da ita lokacin da ake buƙatar yin magana, takardu ko tunani. Idan tsarin da aka ruwaito ya zama gama gari, zai iya sa sabunta ƙirar ƙila ta fi amfani ta gwada ko sabbin ilimin da aka kawo an haɗa su maimakon haddace kawai. Madogararsa ba ta bayar da ingantaccen ingantaccen aiki, cikakken sakamako ko shaida na turawa, don haka mahimmancin ya kasance da'awar bincike mai ma'ana maimakon ingantacciyar damar samarwa.

Batu na tsakiya shine bambanci tsakanin haddar sabuwar sanarwa da aka kawo da kuma amfani da wannan bayanin a matsayin wani ɓangare na babban ɗabi'ar ƙira. Tsarin da ke ba da amsa kawai lokacin da aka sa a cikin kalmomi iri ɗaya da aka yi amfani da su yayin horo na iya zama ƙasa da amfani fiye da wanda zai iya gane juzu'i, haɗa takaddun daban da dalili daga sabunta bayanai. An tsara GRIN akan wannan bambance-bambancen, yana mai da takarda ta dace kai tsaye ga yadda za'a iya kiyaye ƙirar harshe bayan horo na asali.

Ƙimar da aka tsara kuma tana nuna ma'auni mai buƙata don sabunta samfurin. Tunawa ta gaskiya guda ɗaya na iya nuna ko an riƙe abu, amma maido da tushe da yawa da dalilai na ƙima na iya gwada ko za'a iya samun dama ga bayanin kuma a yi amfani da shi a cikin yanayi daban-daban. Rubutun ɓatanci yana da dacewa musamman ga ci gaba da ɗaukakawa saboda yana bincika ko ƙirar zata iya maye gurbin sigar bayanan farko da sabo. Madogararsa ba ta tabbatar da yadda GRIN ke dogara da waɗannan ayyukan ba, amma tana gano ainihin iyawar da ke buƙatar sabunta hanyoyin da ake buƙata don aunawa.

Idan sakamakon marubutan ya riƙa ɗaukan samfura da saitin bayanai, tsarin zai iya rage tazara tsakanin sabunta halayen da aka adana samfurin da kuma ba shi damar yin amfani da sabon ilimin da aka gabatar. Wannan na iya zama mahimmanci ga aikace-aikace inda bayanai ke canzawa da amsoshi sun dogara akan haɗa takardu da yawa da aka kawo. Koyaya, tushen yana bayyana tsarin bincike, ba samfurin da aka saki ko turawa ba. Ba ya nuna cewa GRIN yana aiki a cikin saitunan aiki na gaske, yana tsayawa kan kwanciyar hankali fiye da yawancin zagayowar ɗaukakawa ko kuma guje wa ɓarna abubuwan da ba su da alaƙa.

Hakanan akwai iyakoki masu mahimmanci ga shaidar da ake samu a nan. Ƙaddamarwa riga-kafi ne, kuma kayan da aka kawo shine kawai rubutu da taƙaitaccen shafi na arXiv. Ba a bayar da sakamako na nazari na tsara ba, kuma ba a buga kwafi na waje ko kima mai zaman kansa ba. Ƙididdigar ƙididdiga ba ta gano ainihin aiwatarwa ba, adadin ƙididdiga na ƙididdiga, nau'ikan ilimin da aka allura, ko ƙarfin ƙididdiga na kwatancen. Waɗancan abubuwan da ba a san su ba suna nufin sakamakon yana da yuwuwar bincike mai fa'ida, amma har yanzu ba a nuna cikakkiyar mafita ba don kiyaye ƙirar harsunan da aka tura a halin yanzu.

Interactive Mechanism

Ingantacciyar hanyar sadarwa: Yadda A zahiri yake Aiki

Bincika fasahar da ke bayan wannan ci gaban ta hanyar mu'amala.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Duba ra'ayi na hulɗa+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Abin kallo na gaba

Mafi mahimmancin bin diddigin shine cikakken shaida a bayan nasarorin da aka ruwaito na GRIN: abun da ke ciki, samfuri da cikakkun bayanai na horo, sakamakon ƙididdigewa, kwatancen hanyoyin sabuntawa masu ƙarfi, da aiki akan ilimin da marubuta ba su zaɓa ba. Har ila yau, ba a sani ba daga tushen yadda hanyar ke tafiyar da takardun da ke cin karo da juna ko kuma ba daidai ba, sau nawa ake samun nasara a rubuce-rubuce na karya, ko tsarin ya canza ilimin da aka koya a baya ba da gangan ba, da kuma ko za a fitar da lambar ko bayanan ƙididdiga.

Cikakken takarda ya kamata ya fayyace abin da matakai uku na GRIN suke yi da yadda Golden-GRPO ke haɗa manufofinta. Hakanan yakamata ya nuna ko an samar da siginar tunani-amsa, zaɓi ko akasin haka, tunda dogaro da farashin siginar na iya shafar amfani mai amfani. Cikakkun bayanai game da tsawon lokacin horo, buƙatun ƙididdiga da adadin sabbin misalan za su taimaka sanin ko hanyar ta yiwu fiye da gwajin sarrafawa.

Ma'auni suna ba da damar gwadawa na kusa. Ya kamata masu karatu su nemi wuraren da aka wakilta a cikin Blank da Counter, yadda aka raba gaskiya daga bayanan horo na farko, yadda ake gina tambayoyi masu tushe da yawa, da kuma yadda ake samun amsoshi marasa mahimmanci. Hakanan zai zama mahimmanci a ga ko nasarorin da aka ruwaito sun ci gaba a ƙarƙashin fassarori da haɗakar da takaddun waɗanda ba su dace da misalan horon ba. Abstract ɗin yana kafa gwaje-gwajen da aka yi niyya amma baya samar da isassun bayanai don tantance faɗin su ko wahalarsu.

Rubutun ƙira yana haifar da wata tambaya ta aminci: canza yanki ɗaya na ilimi na iya haifar da canje-canjen da ba a yi niyya ba a wani wuri. Majiyar ba ta ce ko marubutan sun auna riƙe bayanan da ba su da alaƙa, rikice-rikice tsakanin takardu, sabuntawa da maimaitawa ko jujjuya bayanan baya. Waɗancan gwaje-gwajen za su taimaka bambance sabunta ilimin sarrafawa daga hanyar da ke inganta aiki kawai akan ƙaramin misalan allura.

A ƙarshe, aikin bin diddigin ya kamata ya tabbatar da ko binciken ya yi kwafi a cikin nau'ikan harshe da nau'ikan ilimi. Tushen bai ambaci lamba ba, tsare-tsaren sakin ma'auni, wuraren bincike na jama'a ko masu amfani da duniyar gaske. Har ila yau, ba ta bayyana yadda hanyar ke tafiyar da amsoshi ba daidai ba ko sabbin bayanan allura waɗanda suka ci karo da wasu takardu. Har sai an amsa waɗannan tambayoyin, ƙarshen ƙarshe yana iyakance: takardar ta ba da rahoton jagorar gwaji mai ban sha'awa don kimantawa da horar da ci gaba da sabunta ilimi, tare da fa'idarta mafi ƙarfi tana bayyana akan ayyuka masu wuyar gaske, waɗanda ba a tunawa ba.

Jagorori masu alaƙa & tambayoyin tambayoyi

AI Model ya bayyanaAI horoMasu canjiMakomar AIGwada abin da kuka sani - gwada gwajin AI kyautaNemo kalmar AI a cikin ƙamus ɗin muBi samfurin AI na sakin tracker
An sami wannan yana da amfani?