Rudi kwa Habari
UbunifuAI Understanding muhtasari

Seti ya data ya CoVA-SFT inalenga kufundisha AI ya aina nyingi kusababu kupitia vifupisho vya kuona

Watafiti wanatanguliza CoVA-SFT, mkusanyiko wa data wa mifano 51,900 ya moduli nyingi na zaidi ya hatua 222,000 za hoja, wakiripoti kwamba miundo iliyosanifiwa vizuri iliongeza zaidi ya mara mbili utendakazi wa misingi iliyoingiliana ya mawazo kwenye benchmark shirikishi yake.

5 min readRead the primary source
Source-page capture accompanying CoVA-SFT dataset aims to teach multimodal AI to reason through visual abstractions
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.28958
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Seti ya data
Mkusanyiko wa mifano iliyoundwa au isiyo na muundo inayotumika kwa mafunzo, uthibitishaji au majaribio.
Mlolongo-wa-Mawazo
Mtindo wa hoja ambapo mtindo wa AI hutenganisha tatizo katika hatua za kati.
Seti ya Tathmini
Seti ya data iliyosimamishwa inayotumika kupima ubora wa kielelezo baada ya mafunzo.
Jijaribu mwenyeweMaswali Yanayofafanuliwa kwa Miundo ya AI

Nini kilitokea

Karatasi ya arXiv inatanguliza CoVA-SFT, mkusanyiko wa data wa mafunzo ulioundwa ili kusaidia miundo ya lugha nyingi kutumia vifupisho vya kuona wakati wa kutatua matatizo ya kufikiri. Seti ya data ina sampuli 51,900, zaidi ya hatua 222,000 za hoja za aina nyingi, familia tano za mpangilio na kazi 17 changamano. Waandishi pia wanatanguliza CoVA-Bench, alama ya sampuli 1,700 iliyoshikiliwa. Wanaripoti kwamba miundo iliyosanifiwa vyema kwenye CoVA-SFT ilifanya kazi vizuri zaidi kuliko misingi ya msururu wa mawazo ulioingiliana kwa zaidi ya mara mbili kwa wastani, huku ikiendelea kufuatilia misingi mikuu ya msururu wa mawazo pekee.

Karatasi, iliyowasilishwa kwa arXiv mnamo Agosti 29, 2026, inawasilisha CoVA-SFT kama shirika la mafunzo kwa miundo ya lugha nyingi. Msingi wake mkuu ni kwamba mawazo ya msururu wa mawazo pekee ni ya kutosheleza matatizo ya kuona kwa sababu hulazimisha muundo wa kuona kuwa nathari. Waandishi badala yake wanaelezea njia ambayo modeli huingilia maandishi na vifupisho vya kuona wakati wa kutatua kazi.

Kulingana na muhtasari wa karatasi, CoVA-SFT ina sampuli 51,900 na zaidi ya hatua 222,000 za hoja nyingi. Mifano inashughulikia familia tano za mpangilio na kazi 17 ngumu. Chanzo kinasema kuwa mkusanyiko huo ni pamoja na uundaji wa mantiki dhahiri, uwasilishaji wa mawakala na vitanzi vya uthibitishaji, ambavyo vinanuiwa kufundisha miundo jinsi ya kuunda na kudumisha nafasi ya kazi ya ndani inayoonekana wakati wa hoja.

Waandishi pia wanatanguliza CoVA-Bench, seti shirikishi ya tathmini iliyo na sampuli 1,700 za majaribio zilizoshikiliwa katika kategoria zile zile za kazi. Kigezo kinawasilishwa kama njia ya kusaidia ulinganisho unaoweza kuzalishwa kati ya mbinu. Chanzo hakitoi kazi za kibinafsi, usambazaji wa sampuli kati yao, utambulisho wa miundo iliyotathminiwa au mbinu kamili ya bao.

Gazeti hilo linaripoti kuwa miundo iliyosanifiwa vizuri kwenye CoVA-SFT ilifanya kazi vizuri kuliko misingi yote ya mawazo iliyoingiliana kwa zaidi ya mara mbili kwa wastani kwenye CoVA-Bench. Matokeo hayo ni madai yaliyotolewa na waandishi na hayajathibitishwa kivyake hapa. Muhtasari huohuo unasema kwamba miundo hiyo bado haikufikia misingi mikali ya msururu wa mawazo ya maandishi pekee, na kufanya matokeo kuwa uboreshaji juu ya baadhi ya mbinu nyingi badala ya ushahidi kwamba tatizo pana la kuona-sababu limetatuliwa.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Kazi inalenga kizuizi maalum katika AI ya aina nyingi: mifano inaweza kupokea pembejeo za kuona, lakini data ya mafunzo haiwafundishi kila wakati jinsi ya kuunda, kudumisha na kuthibitisha uwakilishi wa kati unaoonekana. Seti kubwa ya data na alama zinazoweza kuzalishwa zinaweza kuwapa watafiti njia ya kawaida ya kutafiti tatizo hilo. Matokeo ya karatasi yenyewe yamehitimu, hata hivyo: faida zilizoripotiwa hupimwa kwenye CoVA-Benchi, na miundo iliyosanifiwa vyema inasalia nyuma ya mifumo thabiti ya kutoa hoja ya maandishi pekee.

Mifumo ya multimodal mara nyingi huhitaji kufikiria juu ya uhusiano wa anga, mpangilio na miundo mingine ambayo ni ngumu kuwakilisha kwa uaminifu katika mlolongo wa maneno. CoVA-SFT inashughulikia tatizo hilo la mafunzo moja kwa moja kwa kufanya uwakilishi wa kati unaoonekana kuwa sehemu ya mifano. Ikiwa mbinu hiyo itakuwa ya jumla, inaweza kusaidia miundo kushughulikia kazi ambapo kuhifadhi muundo ni muhimu kama vile kutambua vitu binafsi au kusoma maandishi.

Kiwango cha corpus inayopendekezwa ni muhimu ndani ya tatizo finyu lililoelezwa na chanzo. Zaidi ya hatua 222,000 za hoja huwapa watafiti lengo kubwa zaidi la kusoma jinsi vifupisho vya kuona na urekebishaji wa kibinafsi huathiri tabia ya mfano kuliko mkusanyiko mdogo wa maonyesho. CoVA-Bench inaongeza sehemu ya tathmini isiyobadilika, ambayo inaweza kurahisisha matokeo kulinganisha katika mifumo ya siku zijazo.

Matokeo yaliyoripotiwa pia ni machache. Waandishi hulinganisha dhidi ya misingi iliyoingiliana ya mlolongo wa mawazo na kuripoti zaidi ya faida ya wastani mara mbili kwenye benchmark yao, lakini wanakubali kwamba miundo iliyopangwa vyema inasalia chini ya mifumo thabiti ya mlolongo wa mawazo ya maandishi pekee. Hii inapendekeza kuwa uwakilishi unaopendekezwa unaweza kushughulikia tatizo moja bila kulinganisha uwezo wa kufikiri wa mbinu kali zaidi zinazotegemea maandishi.

Thamani ya vitendo itategemea maelezo ambayo hayapo kwenye ukurasa wa chanzo. Haijulikani wazi kama seti ya data, maelezo, zana za uonyeshaji au vituo vya ukaguzi vilivyofunzwa vinapatikana kwa umma, jinsi urekebishaji ulivyo ghali, au kama mifano hiyo inaonyesha hali zinazoonekana nje ya kigezo. Chanzo pia hakitoi ushahidi wowote kuhusu usalama, ufunikaji wa idadi ya watu, ufikiaji au utendakazi katika programu za kiwango cha juu.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Nini cha kutazama baadaye

Jaribio muhimu linalofuata ni ikiwa CoVA-SFT inaboresha utendaji zaidi ya kiwango chake kinachohusishwa na uhamisho katika miundo, miundo na kazi za kuona za ulimwengu halisi. Watafiti wanapaswa pia kuchunguza kama hoja za wazi za mkusanyiko wa data na misururu ya uthibitishaji inaboresha kutegemewa au hasa kuhimiza tabia mahususi ya benchmark. Chanzo hakiainishi leseni ya seti ya data, hali ya upakuaji wa umma, gharama ya mafunzo, usanifu wa miundo, matokeo ya kiwango cha kazi au utendaji kwenye tathmini za nje.

Uthibitishaji wa nje unapaswa kuwa kipaumbele cha kwanza. Matokeo kwenye hifadhidata huru za hoja za kuona zinaweza kusaidia kuonyesha ikiwa CoVA-SFT inafundisha uwezo unaoweza kuhamishwa badala ya kuboresha mipangilio na kazi zinazowakilishwa katika CoVA-Benchi. Ulinganisho unapaswa kujumuisha miundo sawa ya msingi, kukokotoa bajeti na masharti ya ushawishi ili faida iliyoripotiwa iweze kufasiriwa kwa haki.

Watafiti wanapaswa kutafuta utofauti wa kiwango cha kazi nyuma ya wastani ulioripotiwa. Uboreshaji wa jumla wa zaidi ya mara mbili unaweza kuficha faida kubwa kwenye baadhi ya familia za mpangilio na uboreshaji kidogo au bila kwa zingine. Chanzo hakisemi ikiwa ongezeko la utendakazi linalingana katika kazi zote 17, wala hakiripoti mifumo ya makosa au hatua za kujiamini.

Loops za uthibitishaji zilizoelezewa na waandishi zinafaa uchunguzi wa karibu. Zinaweza kusaidia miundo kupata makosa katika miundo ya kati inayoonekana, lakini pia zinaweza kuongeza gharama ya makisio au kutoa mwonekano wa kutegemewa bila kuhakikisha majibu sahihi ya mwisho. Tathmini za siku zijazo zinapaswa kupima usahihi, urekebishaji, ukokotoaji na uokoaji wa kutofaulu kando.

Hatimaye, uga utahitaji taarifa wazi zaidi kuhusu ufikiaji na uzalishaji tena. Chanzo kinabainisha karatasi kama inavyokubaliwa kwa Matokeo ya EMNLP 2026, lakini hakisemi leseni ya seti ya data, eneo la kutolewa, mchakato wa ufafanuzi au mahitaji ya maunzi. Maelezo hayo yatabainisha ikiwa CoVA-SFT inakuwa nyenzo ya utafiti inayoweza kutumika kwa upana au inasalia kuwa mbinu ya mafunzo mahususi ya karatasi.

Miongozo & maswali yanayohusiana

Mifano ya AI ImefafanuliwaTransfomaMafunzo ya AIChatGPT na LLMJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?