Nini kilitokea
Karatasi ya arXiv inatanguliza CoVA-SFT, mkusanyiko wa data wa mafunzo ulioundwa ili kusaidia miundo ya lugha nyingi kutumia vifupisho vya kuona wakati wa kutatua matatizo ya kufikiri. Seti ya data ina sampuli 51,900, zaidi ya hatua 222,000 za hoja za aina nyingi, familia tano za mpangilio na kazi 17 changamano. Waandishi pia wanatanguliza CoVA-Bench, alama ya sampuli 1,700 iliyoshikiliwa. Wanaripoti kwamba miundo iliyosanifiwa vyema kwenye CoVA-SFT ilifanya kazi vizuri zaidi kuliko misingi ya msururu wa mawazo ulioingiliana kwa zaidi ya mara mbili kwa wastani, huku ikiendelea kufuatilia misingi mikuu ya msururu wa mawazo pekee.
Karatasi, iliyowasilishwa kwa arXiv mnamo Agosti 29, 2026, inawasilisha CoVA-SFT kama shirika la mafunzo kwa miundo ya lugha nyingi. Msingi wake mkuu ni kwamba mawazo ya msururu wa mawazo pekee ni ya kutosheleza matatizo ya kuona kwa sababu hulazimisha muundo wa kuona kuwa nathari. Waandishi badala yake wanaelezea njia ambayo modeli huingilia maandishi na vifupisho vya kuona wakati wa kutatua kazi.
Kulingana na muhtasari wa karatasi, CoVA-SFT ina sampuli 51,900 na zaidi ya hatua 222,000 za hoja nyingi. Mifano inashughulikia familia tano za mpangilio na kazi 17 ngumu. Chanzo kinasema kuwa mkusanyiko huo ni pamoja na uundaji wa mantiki dhahiri, uwasilishaji wa mawakala na vitanzi vya uthibitishaji, ambavyo vinanuiwa kufundisha miundo jinsi ya kuunda na kudumisha nafasi ya kazi ya ndani inayoonekana wakati wa hoja.
Waandishi pia wanatanguliza CoVA-Bench, seti shirikishi ya tathmini iliyo na sampuli 1,700 za majaribio zilizoshikiliwa katika kategoria zile zile za kazi. Kigezo kinawasilishwa kama njia ya kusaidia ulinganisho unaoweza kuzalishwa kati ya mbinu. Chanzo hakitoi kazi za kibinafsi, usambazaji wa sampuli kati yao, utambulisho wa miundo iliyotathminiwa au mbinu kamili ya bao.
Gazeti hilo linaripoti kuwa miundo iliyosanifiwa vizuri kwenye CoVA-SFT ilifanya kazi vizuri kuliko misingi yote ya mawazo iliyoingiliana kwa zaidi ya mara mbili kwa wastani kwenye CoVA-Bench. Matokeo hayo ni madai yaliyotolewa na waandishi na hayajathibitishwa kivyake hapa. Muhtasari huohuo unasema kwamba miundo hiyo bado haikufikia misingi mikali ya msururu wa mawazo ya maandishi pekee, na kufanya matokeo kuwa uboreshaji juu ya baadhi ya mbinu nyingi badala ya ushahidi kwamba tatizo pana la kuona-sababu limetatuliwa.
Maelezo ya chanzo: arxiv.org ↗
Kwa nini ni muhimu
Kazi inalenga kizuizi maalum katika AI ya aina nyingi: mifano inaweza kupokea pembejeo za kuona, lakini data ya mafunzo haiwafundishi kila wakati jinsi ya kuunda, kudumisha na kuthibitisha uwakilishi wa kati unaoonekana. Seti kubwa ya data na alama zinazoweza kuzalishwa zinaweza kuwapa watafiti njia ya kawaida ya kutafiti tatizo hilo. Matokeo ya karatasi yenyewe yamehitimu, hata hivyo: faida zilizoripotiwa hupimwa kwenye CoVA-Benchi, na miundo iliyosanifiwa vyema inasalia nyuma ya mifumo thabiti ya kutoa hoja ya maandishi pekee.
Mifumo ya multimodal mara nyingi huhitaji kufikiria juu ya uhusiano wa anga, mpangilio na miundo mingine ambayo ni ngumu kuwakilisha kwa uaminifu katika mlolongo wa maneno. CoVA-SFT inashughulikia tatizo hilo la mafunzo moja kwa moja kwa kufanya uwakilishi wa kati unaoonekana kuwa sehemu ya mifano. Ikiwa mbinu hiyo itakuwa ya jumla, inaweza kusaidia miundo kushughulikia kazi ambapo kuhifadhi muundo ni muhimu kama vile kutambua vitu binafsi au kusoma maandishi.
Kiwango cha corpus inayopendekezwa ni muhimu ndani ya tatizo finyu lililoelezwa na chanzo. Zaidi ya hatua 222,000 za hoja huwapa watafiti lengo kubwa zaidi la kusoma jinsi vifupisho vya kuona na urekebishaji wa kibinafsi huathiri tabia ya mfano kuliko mkusanyiko mdogo wa maonyesho. CoVA-Bench inaongeza sehemu ya tathmini isiyobadilika, ambayo inaweza kurahisisha matokeo kulinganisha katika mifumo ya siku zijazo.
Matokeo yaliyoripotiwa pia ni machache. Waandishi hulinganisha dhidi ya misingi iliyoingiliana ya mlolongo wa mawazo na kuripoti zaidi ya faida ya wastani mara mbili kwenye benchmark yao, lakini wanakubali kwamba miundo iliyopangwa vyema inasalia chini ya mifumo thabiti ya mlolongo wa mawazo ya maandishi pekee. Hii inapendekeza kuwa uwakilishi unaopendekezwa unaweza kushughulikia tatizo moja bila kulinganisha uwezo wa kufikiri wa mbinu kali zaidi zinazotegemea maandishi.
Thamani ya vitendo itategemea maelezo ambayo hayapo kwenye ukurasa wa chanzo. Haijulikani wazi kama seti ya data, maelezo, zana za uonyeshaji au vituo vya ukaguzi vilivyofunzwa vinapatikana kwa umma, jinsi urekebishaji ulivyo ghali, au kama mifano hiyo inaonyesha hali zinazoonekana nje ya kigezo. Chanzo pia hakitoi ushahidi wowote kuhusu usalama, ufunikaji wa idadi ya watu, ufikiaji au utendakazi katika programu za kiwango cha juu.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
Which component of an AI application is the machine-learning model itself?
Nini cha kutazama baadaye
Jaribio muhimu linalofuata ni ikiwa CoVA-SFT inaboresha utendaji zaidi ya kiwango chake kinachohusishwa na uhamisho katika miundo, miundo na kazi za kuona za ulimwengu halisi. Watafiti wanapaswa pia kuchunguza kama hoja za wazi za mkusanyiko wa data na misururu ya uthibitishaji inaboresha kutegemewa au hasa kuhimiza tabia mahususi ya benchmark. Chanzo hakiainishi leseni ya seti ya data, hali ya upakuaji wa umma, gharama ya mafunzo, usanifu wa miundo, matokeo ya kiwango cha kazi au utendaji kwenye tathmini za nje.
Uthibitishaji wa nje unapaswa kuwa kipaumbele cha kwanza. Matokeo kwenye hifadhidata huru za hoja za kuona zinaweza kusaidia kuonyesha ikiwa CoVA-SFT inafundisha uwezo unaoweza kuhamishwa badala ya kuboresha mipangilio na kazi zinazowakilishwa katika CoVA-Benchi. Ulinganisho unapaswa kujumuisha miundo sawa ya msingi, kukokotoa bajeti na masharti ya ushawishi ili faida iliyoripotiwa iweze kufasiriwa kwa haki.
Watafiti wanapaswa kutafuta utofauti wa kiwango cha kazi nyuma ya wastani ulioripotiwa. Uboreshaji wa jumla wa zaidi ya mara mbili unaweza kuficha faida kubwa kwenye baadhi ya familia za mpangilio na uboreshaji kidogo au bila kwa zingine. Chanzo hakisemi ikiwa ongezeko la utendakazi linalingana katika kazi zote 17, wala hakiripoti mifumo ya makosa au hatua za kujiamini.
Loops za uthibitishaji zilizoelezewa na waandishi zinafaa uchunguzi wa karibu. Zinaweza kusaidia miundo kupata makosa katika miundo ya kati inayoonekana, lakini pia zinaweza kuongeza gharama ya makisio au kutoa mwonekano wa kutegemewa bila kuhakikisha majibu sahihi ya mwisho. Tathmini za siku zijazo zinapaswa kupima usahihi, urekebishaji, ukokotoaji na uokoaji wa kutofaulu kando.
Hatimaye, uga utahitaji taarifa wazi zaidi kuhusu ufikiaji na uzalishaji tena. Chanzo kinabainisha karatasi kama inavyokubaliwa kwa Matokeo ya EMNLP 2026, lakini hakisemi leseni ya seti ya data, eneo la kutolewa, mchakato wa ufafanuzi au mahitaji ya maunzi. Maelezo hayo yatabainisha ikiwa CoVA-SFT inakuwa nyenzo ya utafiti inayoweza kutumika kwa upana au inasalia kuwa mbinu ya mafunzo mahususi ya karatasi.