Komawa Labarai
Bidi'aAI Understanding takaitaccen bayani

Preprint yana ba da shawara mafi inganci don inganta fahimtar AI na dogayen bidiyoyi

Wani sabon safa na arXiv yana gabatar da Kula da Sashe-zuwa-Video, hanyar horo da aka tsara don taimakawa tsarin AI da yawa don gano cikakkun bayanai masu dacewa a cikin dogon bidiyo yayin rage horo da ƙima.

5 min readRead the primary source
Primary-source image accompanying Preprint proposes a more efficient way to improve AI understanding of long videos
Takardun tushe na farkoAn rubuta tushen tushe
Mawallafi
arxiv.org
Tushen hanyar haɗin gwiwa
arxiv.orghttps://arxiv.org/abs/2608.20814
Nau'in tushe
Takardun farko - sanarwar hukuma, takarda, yin rajista, ko shafi na farko da muka karanta kai tsaye.
MaganaFahimtar wannan a cikin daƙiƙa 60

Fara a nan

Mabuɗin sharuddan

Ƙarfafa Koyo
Horowa ta siginar lada inda wakili ke koyon ayyuka waɗanda ke haɓaka dawowa na dogon lokaci.
Kyakkyawan-Tuning
Ci gaba da horarwa akan ƙayyadaddun bayanai na yanki don daidaita samfurin da aka riga aka horar zuwa takamaiman aiki.
Bayani
Alamomin da aka ƙara ɗan adam ko metadata da aka yi amfani da su don horarwa ko kimanta ƙirar koyon inji.
Gwada kankaAI Model An Bayyana Tambayoyi

Me ya faru

Masu bincike suna ba da shawarar Sakin-zuwa-Video Supervision, ko S2V, don tsarin AI na multimodal wanda ke amsa tambayoyi game da dogayen bidiyoyi. Hanyar tana haifar da misalan tambaya-da-amsa daga gajerun ɓangarorin bidiyo na gida, sannan ta yi amfani da waɗannan misalan don horar da ƙira akan cikakkun bidiyoyi masu dacewa. Marubutan sun ba da rahoton haɓakawa a kan ma'auni na fahimtar dogon bidiyo da yawa ta amfani da samfuran 10,000 VQA, tare da wucewa guda ɗaya na gaba da ƙayyadaddun alamun fitarwa a cikin mahimmanci.

Takardar, wanda aka ƙaddamar zuwa arXiv a kan Agusta 21, 2026, yana magance dogon fahimtar fahimtar bidiyo ta hanyar manyan harsunan multimodal. Mafarin sa shi ne dogayen bidiyoyi masu rikitarwa sun ƙunshi abubuwa masu ɗauke da hankali waɗanda za su iya ɓoye bayanan da ke cikin gida. A cewar mawallafa, wannan na iya haifar da samfurin don mayar da hankali kan shaidar da ba daidai ba kuma ya samar da amsar da ba daidai ba. Don haka binciken ya ta'allaka ne akan takamaiman ikon AI: haɗa tambaya game da bidiyo zuwa lokacin da ya dace ko yanki a cikin wancan bidiyon.

Hanyar da aka tsara ana kiranta Segment-to-Video Supervision, ko S2V. Masu binciken sun fara samar da misalan amsa tambaya na gani daga guntu, guntu guntu. Waɗannan misalan ana mayar da su zuwa cikakken tsarin bidiyo yayin horo. Dalilin da aka bayyana shi ne cewa ƙananan sassa suna yin cikakkun bayanai masu kyau da sauƙi don lura, yayin da horo a kan cikakken bidiyon yana koyar da samfurin don haɗa waɗannan cikakkun bayanai tare da tambayoyi duk da kasancewar abubuwan da ba su da alaƙa. Hanyar tana amfani da koyon ƙarfafawa tare da abin da ƙayyadaddun bayanan ya bayyana azaman lada mai sauƙi na tushen daidaito da samfuran VQA 10,000.

A lokacin ƙididdigewa, samfurin S2V da aka ƙirƙira an ƙirƙira shi don amsawa tare da wucewar gaba ɗaya da ƙayyadaddun adadin abubuwan fitarwa. The authors say their experiments show consistent improvements on multiple long-video-understanding benchmarks compared with both general multimodal models and reasoning-based methods. Har ila yau, suna da'awar samun nasarori a cikin horarwa da ingantaccen aiki. Madogararsa ba ta bayyana ma'auni ko bayar da girman ribar da aka ruwaito a cikin taƙaitaccen bayani ba, don haka ya kamata a kula da waɗannan da'awar a matsayin sakamakon da takarda ta ruwaito maimakon kafa hujja mai zaman kansa.

Bayanan tushe: arxiv.org ↗

Me ya sa yake da mahimmanci

Dogayen bidiyo sun ƙunshi ɗimbin abubuwan da ba su da mahimmanci, yana mai da wahala ga tsarin AI don gano takamaiman shaidar da ake buƙata don amsa tambaya. Hanyar takardar ta yi niyya ga wannan matsala yayin da ake neman guje wa babban farashin ƙididdiga, ƙirar lada mai rikitarwa da latency da ke da alaƙa da ƙarin ƙayyadaddun hanyoyin tunani. Idan an inganta shi da kansa, dabarar za ta iya yin nazarin dogon bidiyo mai amfani sosai a cikin saitunan da aka ƙuntata, lokacin amsawa ko alamar albarkatun.

Binciken dogon bidiyo yana da wahala ga dalili madaidaiciya: bayanan da ake buƙata don amsa tambaya na iya ɗaukar ɗan ƙaramin yanki na mahallin da ya fi girma. Tsarin AI wanda ke aiwatar da duk bidiyon dole ne ya bambanta shaidar da ta dace daga ayyukan baya, maimaita al'amuran da abubuwan da ba su da alaƙa. Hanyar S2V tana mai da hankali kan horarwa kan shaidar gida da farko, sannan ta yi amfani da cikakken bidiyon azaman saitin wanda dole ne a dawo da wannan shaidar. Wannan martani ne da aka yi niyya ga ƙayyadaddun tsakiya a cikin tsarin AI mai iya yin bidiyo.

Da'awar inganci yana da yuwuwar mahimmanci saboda haɓaka tunani galibi yana zuwa tare da ƙarin farashi. Takardar ta ce hanyoyin da suka gabata na iya buƙatar ƙwaƙƙwaran ƙarfafawa-daidaitacce sama da sama, bayanai masu tsada da ƙirƙira ƙira mai lada. Har ila yau, ya ce wasu tsare-tsare masu nuna kai-tsaye ko na tsai da ra'ayi suna samar da amsoshi masu tsayi da kuma ƙara jinkirin fahimta. S2V yana da nufin rage waɗancan nauyin ta hanyar ƙaramin saitin horo na VQA, lada mai sauƙi da tsarin amsa ta hanyar wucewa. Idan an maimaita aikin da aka bayar da rahoton, hanyar zata iya yin tasiri ga masu haɓaka sarrafa manyan tarin bidiyo ko aiki ƙarƙashin lokacin amsawa da ƙididdige ƙuntatawa.

Muhimmancin aiki ya kasance mai sharadi. Kyakkyawan aikin ma'auni ba shi da kansa ba zai kafa ingantaccen fahimta a cikin bidiyo na ainihi ba, inda tambayoyi na iya zama da ban sha'awa, za a iya yada hujjoji masu dacewa a cikin lokaci mai nisa, kuma kurakurai na iya samun sakamako daban-daban dangane da aikace-aikacen. Madogararsa baya bayar da rahoton sakamakon turawa, kimantawar ɗan adam, takamaiman gwajin yanki ko ƙimar gazawa. Har ila yau, ba ta tabbatar da cewa hanyar tana rage jimillar farashi a kowane wuri ba, tun da ƙirƙirar misalan horo na gida da shirya cikakkun bayanai na bidiyo na iya ɗaukar nauyin aikin nasu.

Interactive Mechanism

Ingantacciyar hanyar sadarwa: Yadda A zahiri yake Aiki

Bincika fasahar da ke bayan wannan ci gaban ta hanyar mu'amala.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Duba ra'ayi na hulɗa+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Abin kallo na gaba

Takardar siffa ce ta arXiv, kuma ƙayyadaddun ta ba ta samar da daidaitattun ribar daidaito, sunaye masu ƙima, ƙididdige buƙatu ko kwatance cikin ƙididdiga. Ya kamata ƙarin bincike ya bincika ko haɓakar da aka ruwaito sun riƙe tsawon tsayin bidiyo, yanki da nau'ikan tambayoyi, ko zaɓin yanki yana gabatar da wuraren makafi, kuma ko hanyar ta ci gaba da inganci idan aka yi amfani da ita tare da mafi girma ko nau'ikan multimodal daban-daban.

Shaida mai mahimmanci ta gaba ita ce dalla-dalla na lambobi da tsari daga cikakkiyar takarda. Ya kamata masu karatu su nemo ainihi da girman ma'auni na dogon bidiyo, ƙirar tushe, ainihin canje-canjen daidaito da ma'aunin horo da ƙima. Hakanan zai zama mahimmanci ko kwatancen sun yi amfani da iyalai iri ɗaya, abubuwan shigar bidiyo da ƙididdige kasafin kuɗi. Ba tare da waɗannan cikakkun bayanai ba, ƙayyadaddun bayanan yana goyan bayan wanzuwar hanyar da aka tsara da kuma rahoton marubutan da aka ba da rahoton sakamakon, amma ba madaidaicin ƙima na fa'idarsa ba.

Kulawa na tushen yanki na iya gabatar da ciniki idan zaɓaɓɓun shirye-shiryen bidiyo ba su ƙunshi isashen mahallin ba. Ya kamata kimantawa ta gwada tambayoyin waɗanda amsoshinsu suka dogara da abubuwan da suka faru kafin da bayan wani yanki da aka keɓe, mu'amala ta ɓangarorin bidiyo masu nisa, ko alaƙar ɗan lokaci. Hakanan ya kamata a bincika ko tsararrun yanki sun fi son cikakkun bayanai na gani yayin da bacewar sauti, tarihin lokaci, ainihin lasifikar ko mafi faɗin mahallin labari. Majiyar ta bayyana amsa tambayoyin bidiyo amma ba ta fayyace yadda aka tafiyar da waɗannan hanyoyin ko lokuta masu wahala ba.

Kwafi mai zaman kanta zai ƙayyade ko S2V fasaha ce mai fa'ida mai fa'ida ko kuma sakamakon da aka danganta da takamaiman bayanai da zaɓin ƙira. Ayyukan bin diddigi masu fa'ida zai kwatanta hanyar tare da sauran ingantattun dabarun bidiyo na dogon lokaci, gwada shi akan wuraren da ba a gani ba kuma auna tsarin kuskure tare da daidaito. Sabuwar buga takardar kuma ba ta da rahoton ingantacciyar hanyar waje a cikin tushen da aka kawo. Har sai an sami waɗannan cak ɗin, gudunmawar da ta fi ƙarfinta ita ce ƙaƙƙarfan shawara tare da mawallafin da aka ba da rahoton rahoto da inganta ingantaccen aiki, ba shaida cewa AI mai tsayin bidiyo ya warware tunani na gida ba.

Jagorori masu alaƙa & tambayoyin tambayoyi

AI Model ya bayyanaAI horoMasu canjiMenene AI?Gwada abin da kuka sani - gwada gwajin AI kyautaNemo kalmar AI a cikin ƙamus ɗin muBi samfurin AI na sakin tracker
An sami wannan yana da amfani?