Rudi kwa Habari
UbunifuAI Understanding muhtasari

Karatasi ya NC-GRPO inaripoti hoja zenye nguvu za lugha ya maono kutoka kwa utofauti wa utoaji wa nafasi iliyofichika.

Chapisho la awali la arXiv linatanguliza NC-GRPO, mbinu ya uimarishaji-mafunzo ambayo inatatiza uwakilishi fiche wa mtindo wa lugha ya maono badala ya taswira yake ya ingizo. Ripoti ya waandishi iliboresha hoja za kihisabati nje ya kikoa na uthabiti wa kuona kwenye Qwen2.5-VL-7B, huku wakibaini utofauti kati ya…

5 min readRead the primary source
Primary-source image accompanying NC-GRPO paper reports stronger vision-language reasoning from latent-space rollout diversity
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.21595
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Muundo wa Lugha-Maono (VLM)
Muundo wa aina nyingi ambao huchakata kwa pamoja maelezo ya kuona na maandishi.
Mafunzo ya Kuimarisha
Mazoezi kwa kutumia ishara za zawadi ambapo wakala hujifunza vitendo vinavyoongeza faida ya muda mrefu.
Kumbukumbu (Kumbukumbu ya Wakala)
Muktadha uliohifadhiwa wakala wa AI hutumia katika hatua au vipindi ili kuboresha mwendelezo.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Karatasi ya arXiv inatanguliza Noise-Contrastive GRPO, au NC-GRPO, mbinu ya kufunza miundo ya lugha maono na ujifunzaji wa kuimarisha na zawadi zinazoweza kuthibitishwa. Huongeza kelele iliyorekebishwa ya Gaussian kwenye safu ya mwisho iliyofichwa ya modeli wakati wa usimbaji wa haraka kwa nusu ya kila kikundi cha uchapishaji, na kuunda njia mbadala za kufikiria bila kubadilisha picha, zawadi, lengo au itifaki ya uelekezaji. Iliyojaribiwa kwenye Qwen2.5-VL-7B iliyofunzwa kwenye Geometry3K, waandishi wanaripoti utendaji thabiti zaidi wa kikoa, uboreshaji wa hoja za kihisabati nje ya kikoa kati ya vigezo vitano vilivyowekwa, na uimara bora wa kuona kuliko vanilla GRPO.

Karatasi husoma ujifunzaji wa kuimarisha kwa zawadi zinazoweza kuthibitishwa kwa miundo ya lugha ya maono, ambapo matokeo ya mtahiniwa yanaweza kuangaliwa dhidi ya jibu linalojulikana au ishara nyingine ya lengo. Pendekezo lake kuu ni Noise-Contrastive GRPO, au NC-GRPO. Badala ya kuongeza utofauti kwa kubadilisha halijoto ya kusimbua au kubadilisha taswira ya ingizo katika nafasi ya pikseli, mbinu hii huingiza kelele ya Gaussian iliyosawazishwa katika safu ya mwisho iliyofichwa inayotolewa wakati kidokezo kinaposimbwa. Nusu ya uchapishaji katika kila kikundi cha uboreshaji hupokea usumbufu, wakati matawi yaliyosalia hutoa ulinganisho usio na wasiwasi.

Waandishi wanaelezea usumbufu kama njia ya kuunda matawi kutoka kwa hali ya kuondoka kwa ndani. Tawi ambalo bado linafikia jibu sahihi baada ya uhamishaji huo hupokea uimarishaji unaohusiana na tawi ambalo limeachwa. Katika uundaji wa karatasi, unyeti wa modeli katika sehemu hiyo ya ndani ya tawi inakuwa ishara ya upinde rangi ya sera. Muhtasari unasema kwamba hii inaacha lengo la mafunzo, ufafanuzi wa zawadi na itifaki ya uelekezaji bila kubadilika, na kwamba mbinu inaweza kuunganishwa katika bomba la kawaida la uimarishaji wa mafunzo kupitia takriban badiliko la injini ya uelekezaji-line-50. Haya ni madai yaliyotolewa na waandishi, sio tathmini ya utekelezaji iliyothibitishwa kwa kujitegemea.

Jaribio lililoripotiwa linatumia Qwen2.5-VL-7B iliyofunzwa kwenye Geometry3K. Dhidi ya vanilla GRPO, jarida linasema NC-GRPO inaboresha kwa kiasi kikubwa hoja za hisabati nje ya kikoa kwenye alama tano zilizoshikiliwa, na jaribio la pamoja la McNemar la p chini ya au sawa na 0.001. Pia inaripoti uboreshaji wa kazi ya ndani ya kikoa na juu ya uthabiti wa ukumbi. Muhtasari unasema kelele ya nafasi ya picha ilitoa matokeo makubwa ya wastani ya nje ya kikoa kwenye alama za utambuzi-nzito lakini ilirudi nyuma kwenye uthabiti wa kuona. Uondoaji wa utaratibu unahusisha athari kwa uanuwai huru wa stokastiki badala ya kiasi au mwelekeo wa kelele, wakati utafiti wa kiwango cha kelele unabainisha tofauti kati ya utaalamu wa kufikiri na uwezo wa jumla.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Kazi inashughulikia tatizo la kiutendaji katika ujifunzaji wa uimarishaji kwa miundo mingi: jinsi ya kutoa njia za kutosha za kutahiniwa tofauti bila kupotosha maoni ya kuona. Ikiwa matokeo yaliyoripotiwa yanajumlisha, utofautishaji wa nafasi fiche unaweza kutoa mabadiliko madogo ya kihandisi kwa ajili ya kuboresha uhamishaji wa hoja huku tukihifadhi kazi asilia na usanidi wa zawadi. Matokeo pia yanapendekeza kuwa mafunzo ya utaalamu wa hisabati na uthabiti yanaweza kuhusisha ubadilishanaji unaoweza kudhibitiwa badala ya kiwango kimoja cha kelele bora zaidi kwa wote.

Utafiti ni muhimu kwa sababu utofauti wa uchapishaji ni sehemu ya jinsi mafunzo ya kuimarisha hutafuta tabia bora. Ikiwa kila mgombea katika kikundi cha uboreshaji anafuata karibu njia sawa ya ndani, mawimbi ya mafunzo yanaweza kutoa maelezo machache kuhusu maamuzi ambayo ni thabiti. NC-GRPO hujaribu kama utofauti unaweza kuanzishwa ndani ya uwakilishi wa modeli huku ukiacha picha inayoonekana na zawadi ya nje ya kazi bila kuguswa. Tofauti hiyo inaweza kuwa muhimu kwa mifumo ya lugha ya maono, ambapo kubadilisha pikseli kunaweza kuunda vizalia vya programu au kubadilisha tatizo lenyewe badala ya kujaribu uthabiti katika kufikiri.

Tofauti iliyoripotiwa na upotoshaji wa nafasi ya picha inaweza kuwa muhimu. Waandishi wanasema kelele ya kiwango cha pikseli ilifanya vyema zaidi kwa wastani kwa alama za utambuzi-zito nje ya kikoa, lakini ilidhuru uthabiti wa maono, ilhali NC-GRPO iliboresha uimara huo katika jaribio lao. Hii inaelekeza kwenye maeneo tofauti ya misukosuko yanayozalisha uwezo tofauti: mabadiliko ya ingizo yanaweza kupima ustahimilivu wa mwonekano, ilhali mabadiliko fiche yanaweza kuhimiza njia za kufikiri ambazo hubaki thabiti baada ya utofauti wa ndani. Chanzo hakionyeshi maelezo ya kutosha ili kubaini kama tafsiri hii ni sababu zaidi ya uondoaji wa waandishi.

Rufaa ya vitendo ya mbinu hiyo inatokana na upatanifu unaodaiwa na usanidi uliopo wa RLVR. Muhtasari unasema utaratibu wa malipo, lengo na uelekezaji haujaguswa, na kwamba utekelezaji unahitaji takriban mistari 50 ya mabadiliko ya injini ya uelekezaji. Ikiwa madai hayo yatathibitishwa, watafiti wanaweza kutathmini mbinu hiyo bila kupanga upya safu kamili ya mafunzo. Hiyo haimaanishi kuwa mbinu hiyo ni nafuu kwa jumla: chanzo hakitoi bajeti ya kukokotoa, muda wa mafunzo, athari ya kumbukumbu au kipimo cha matokeo. Umuhimu wake kwa umma kwa hivyo unategemea ikiwa faida za ubora zilizoripotiwa zinahalalisha uchapishaji wowote au gharama ya uboreshaji.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Maswali kuu yaliyo wazi ni ikiwa faida hushikilia saizi nyingi zaidi za modeli, kazi za kuona na seti za data za mafunzo, na ikiwa zitadumu uigaji huru. Chanzo hakitoi mabadiliko kamili ya usahihi, ukubwa wa seti ya data, matokeo ya kila kipimo, kukokotoa gharama au maelezo kamili ya utekelezaji. Pia haiashirii upatikanaji wa uzalishaji au kutegemewa katika ulimwengu halisi. Kazi ya ufuatiliaji inapaswa kupima ikiwa misukosuko iliyofichika inaboresha kazi zaidi ya hisabati na kama manufaa yaliyoripotiwa ya kuona ndoto yanasalia chini ya picha zisizojulikana, vidokezo na masharti ya matumizi.

Ushahidi unabaki kuwa mdogo kwa chanzo kimoja na usanidi wa mafunzo uliopewa jina: Qwen2.5-VL-7B iliyofunzwa kwenye Jiometri3K. Muhtasari hautambui vigezo vitano vilivyoshikiliwa, kuripoti alama zao binafsi, kutoa hesabu za sampuli au kutaja ukubwa wa uboreshaji wa uimara wa kuona ukumbi. Pia haisemi ikiwa ulinganisho uliotumika hesabu zinazolingana, idadi sawa ya uchapishaji au juhudi zinazofanana za kurekebisha kipenyo. Maelezo hayo ni muhimu ili kutathmini ikiwa matokeo yanaonyesha mbinu muhimu kwa upana au usanidi unaofaa wa majaribio.

Urudufu unapaswa kuchunguza ukubwa wa mfano, familia ya mfano, aina ya kazi na utaratibu. Waandishi wanaelezea NC-GRPO kama hali ya utambuzi, lakini chanzo hakitoi jaribio linaloonyesha dai hilo nje ya mpangilio wa lugha maono ulioripotiwa. Majaribio zaidi yanaweza kujumuisha kazi nzito za utambuzi, hoja za taswira za utunzi, maswali yasiyo ya kihisabati na vidokezo vilivyoundwa ili kushawishi majibu ambayo hayatumiki. Watafiti wanapaswa pia kutenganisha faida kutoka kwa usumbufu wenyewe kutoka kwa faida inayosababishwa na sampuli za ziada za stochastic au tofauti zingine za mafunzo.

Matokeo ya kiwango cha kelele ya karatasi hufanya tabia ya upelekaji kuwa isiyojulikana. Muhtasari unafafanua piga kati ya utaalam wa hoja na uwezo wa jumla, lakini haibainishi jinsi watendaji wanapaswa kuchagua mpangilio huo au jinsi biashara inavyokuwa thabiti katika kazi zote. Hakuna dai la modeli iliyotolewa, ujumuishaji wa bidhaa au tathmini ya uzalishaji. Wasomaji wanapaswa kuzingatia matokeo kama matokeo ya utafiti wa mapema kutoka kwa kichapisho cha awali cha arXiv hadi vipimo kamili, msimbo au maelezo ya utekelezaji na ujibuji huru upatikane.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaMafunzo ya AITransfomaChatGPT na LLMJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?