Nini kilitokea
Karatasi ya arXiv inatanguliza Noise-Contrastive GRPO, au NC-GRPO, mbinu ya kufunza miundo ya lugha maono na ujifunzaji wa kuimarisha na zawadi zinazoweza kuthibitishwa. Huongeza kelele iliyorekebishwa ya Gaussian kwenye safu ya mwisho iliyofichwa ya modeli wakati wa usimbaji wa haraka kwa nusu ya kila kikundi cha uchapishaji, na kuunda njia mbadala za kufikiria bila kubadilisha picha, zawadi, lengo au itifaki ya uelekezaji. Iliyojaribiwa kwenye Qwen2.5-VL-7B iliyofunzwa kwenye Geometry3K, waandishi wanaripoti utendaji thabiti zaidi wa kikoa, uboreshaji wa hoja za kihisabati nje ya kikoa kati ya vigezo vitano vilivyowekwa, na uimara bora wa kuona kuliko vanilla GRPO.
Karatasi husoma ujifunzaji wa kuimarisha kwa zawadi zinazoweza kuthibitishwa kwa miundo ya lugha ya maono, ambapo matokeo ya mtahiniwa yanaweza kuangaliwa dhidi ya jibu linalojulikana au ishara nyingine ya lengo. Pendekezo lake kuu ni Noise-Contrastive GRPO, au NC-GRPO. Badala ya kuongeza utofauti kwa kubadilisha halijoto ya kusimbua au kubadilisha taswira ya ingizo katika nafasi ya pikseli, mbinu hii huingiza kelele ya Gaussian iliyosawazishwa katika safu ya mwisho iliyofichwa inayotolewa wakati kidokezo kinaposimbwa. Nusu ya uchapishaji katika kila kikundi cha uboreshaji hupokea usumbufu, wakati matawi yaliyosalia hutoa ulinganisho usio na wasiwasi.
Waandishi wanaelezea usumbufu kama njia ya kuunda matawi kutoka kwa hali ya kuondoka kwa ndani. Tawi ambalo bado linafikia jibu sahihi baada ya uhamishaji huo hupokea uimarishaji unaohusiana na tawi ambalo limeachwa. Katika uundaji wa karatasi, unyeti wa modeli katika sehemu hiyo ya ndani ya tawi inakuwa ishara ya upinde rangi ya sera. Muhtasari unasema kwamba hii inaacha lengo la mafunzo, ufafanuzi wa zawadi na itifaki ya uelekezaji bila kubadilika, na kwamba mbinu inaweza kuunganishwa katika bomba la kawaida la uimarishaji wa mafunzo kupitia takriban badiliko la injini ya uelekezaji-line-50. Haya ni madai yaliyotolewa na waandishi, sio tathmini ya utekelezaji iliyothibitishwa kwa kujitegemea.
Jaribio lililoripotiwa linatumia Qwen2.5-VL-7B iliyofunzwa kwenye Geometry3K. Dhidi ya vanilla GRPO, jarida linasema NC-GRPO inaboresha kwa kiasi kikubwa hoja za hisabati nje ya kikoa kwenye alama tano zilizoshikiliwa, na jaribio la pamoja la McNemar la p chini ya au sawa na 0.001. Pia inaripoti uboreshaji wa kazi ya ndani ya kikoa na juu ya uthabiti wa ukumbi. Muhtasari unasema kelele ya nafasi ya picha ilitoa matokeo makubwa ya wastani ya nje ya kikoa kwenye alama za utambuzi-nzito lakini ilirudi nyuma kwenye uthabiti wa kuona. Uondoaji wa utaratibu unahusisha athari kwa uanuwai huru wa stokastiki badala ya kiasi au mwelekeo wa kelele, wakati utafiti wa kiwango cha kelele unabainisha tofauti kati ya utaalamu wa kufikiri na uwezo wa jumla.
Maelezo ya chanzo: arxiv.org ↗
Kwa nini ni muhimu
Kazi inashughulikia tatizo la kiutendaji katika ujifunzaji wa uimarishaji kwa miundo mingi: jinsi ya kutoa njia za kutosha za kutahiniwa tofauti bila kupotosha maoni ya kuona. Ikiwa matokeo yaliyoripotiwa yanajumlisha, utofautishaji wa nafasi fiche unaweza kutoa mabadiliko madogo ya kihandisi kwa ajili ya kuboresha uhamishaji wa hoja huku tukihifadhi kazi asilia na usanidi wa zawadi. Matokeo pia yanapendekeza kuwa mafunzo ya utaalamu wa hisabati na uthabiti yanaweza kuhusisha ubadilishanaji unaoweza kudhibitiwa badala ya kiwango kimoja cha kelele bora zaidi kwa wote.
Utafiti ni muhimu kwa sababu utofauti wa uchapishaji ni sehemu ya jinsi mafunzo ya kuimarisha hutafuta tabia bora. Ikiwa kila mgombea katika kikundi cha uboreshaji anafuata karibu njia sawa ya ndani, mawimbi ya mafunzo yanaweza kutoa maelezo machache kuhusu maamuzi ambayo ni thabiti. NC-GRPO hujaribu kama utofauti unaweza kuanzishwa ndani ya uwakilishi wa modeli huku ukiacha picha inayoonekana na zawadi ya nje ya kazi bila kuguswa. Tofauti hiyo inaweza kuwa muhimu kwa mifumo ya lugha ya maono, ambapo kubadilisha pikseli kunaweza kuunda vizalia vya programu au kubadilisha tatizo lenyewe badala ya kujaribu uthabiti katika kufikiri.
Tofauti iliyoripotiwa na upotoshaji wa nafasi ya picha inaweza kuwa muhimu. Waandishi wanasema kelele ya kiwango cha pikseli ilifanya vyema zaidi kwa wastani kwa alama za utambuzi-zito nje ya kikoa, lakini ilidhuru uthabiti wa maono, ilhali NC-GRPO iliboresha uimara huo katika jaribio lao. Hii inaelekeza kwenye maeneo tofauti ya misukosuko yanayozalisha uwezo tofauti: mabadiliko ya ingizo yanaweza kupima ustahimilivu wa mwonekano, ilhali mabadiliko fiche yanaweza kuhimiza njia za kufikiri ambazo hubaki thabiti baada ya utofauti wa ndani. Chanzo hakionyeshi maelezo ya kutosha ili kubaini kama tafsiri hii ni sababu zaidi ya uondoaji wa waandishi.
Rufaa ya vitendo ya mbinu hiyo inatokana na upatanifu unaodaiwa na usanidi uliopo wa RLVR. Muhtasari unasema utaratibu wa malipo, lengo na uelekezaji haujaguswa, na kwamba utekelezaji unahitaji takriban mistari 50 ya mabadiliko ya injini ya uelekezaji. Ikiwa madai hayo yatathibitishwa, watafiti wanaweza kutathmini mbinu hiyo bila kupanga upya safu kamili ya mafunzo. Hiyo haimaanishi kuwa mbinu hiyo ni nafuu kwa jumla: chanzo hakitoi bajeti ya kukokotoa, muda wa mafunzo, athari ya kumbukumbu au kipimo cha matokeo. Umuhimu wake kwa umma kwa hivyo unategemea ikiwa faida za ubora zilizoripotiwa zinahalalisha uchapishaji wowote au gharama ya uboreshaji.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Maswali kuu yaliyo wazi ni ikiwa faida hushikilia saizi nyingi zaidi za modeli, kazi za kuona na seti za data za mafunzo, na ikiwa zitadumu uigaji huru. Chanzo hakitoi mabadiliko kamili ya usahihi, ukubwa wa seti ya data, matokeo ya kila kipimo, kukokotoa gharama au maelezo kamili ya utekelezaji. Pia haiashirii upatikanaji wa uzalishaji au kutegemewa katika ulimwengu halisi. Kazi ya ufuatiliaji inapaswa kupima ikiwa misukosuko iliyofichika inaboresha kazi zaidi ya hisabati na kama manufaa yaliyoripotiwa ya kuona ndoto yanasalia chini ya picha zisizojulikana, vidokezo na masharti ya matumizi.
Ushahidi unabaki kuwa mdogo kwa chanzo kimoja na usanidi wa mafunzo uliopewa jina: Qwen2.5-VL-7B iliyofunzwa kwenye Jiometri3K. Muhtasari hautambui vigezo vitano vilivyoshikiliwa, kuripoti alama zao binafsi, kutoa hesabu za sampuli au kutaja ukubwa wa uboreshaji wa uimara wa kuona ukumbi. Pia haisemi ikiwa ulinganisho uliotumika hesabu zinazolingana, idadi sawa ya uchapishaji au juhudi zinazofanana za kurekebisha kipenyo. Maelezo hayo ni muhimu ili kutathmini ikiwa matokeo yanaonyesha mbinu muhimu kwa upana au usanidi unaofaa wa majaribio.
Urudufu unapaswa kuchunguza ukubwa wa mfano, familia ya mfano, aina ya kazi na utaratibu. Waandishi wanaelezea NC-GRPO kama hali ya utambuzi, lakini chanzo hakitoi jaribio linaloonyesha dai hilo nje ya mpangilio wa lugha maono ulioripotiwa. Majaribio zaidi yanaweza kujumuisha kazi nzito za utambuzi, hoja za taswira za utunzi, maswali yasiyo ya kihisabati na vidokezo vilivyoundwa ili kushawishi majibu ambayo hayatumiki. Watafiti wanapaswa pia kutenganisha faida kutoka kwa usumbufu wenyewe kutoka kwa faida inayosababishwa na sampuli za ziada za stochastic au tofauti zingine za mafunzo.
Matokeo ya kiwango cha kelele ya karatasi hufanya tabia ya upelekaji kuwa isiyojulikana. Muhtasari unafafanua piga kati ya utaalam wa hoja na uwezo wa jumla, lakini haibainishi jinsi watendaji wanapaswa kuchagua mpangilio huo au jinsi biashara inavyokuwa thabiti katika kazi zote. Hakuna dai la modeli iliyotolewa, ujumuishaji wa bidhaa au tathmini ya uzalishaji. Wasomaji wanapaswa kuzingatia matokeo kama matokeo ya utafiti wa mapema kutoka kwa kichapisho cha awali cha arXiv hadi vipimo kamili, msimbo au maelezo ya utekelezaji na ujibuji huru upatikane.