Rudi kwa Habari
UbunifuAI Understanding muhtasari

AffectOmni hufunza AI ya aina nyingi kuelezea hisia kwa kutumia ushahidi wa kuona unaozingatia watu

Kielelezo kipya kinaelezea AffectOmni, mfumo wa uimarishaji-ujifunzaji iliyoundwa kufanya miundo ya AI ya aina nyingi msingi wa maamuzi ya kimaadili juu ya dalili zinazozingatia watu kama vile sura ya uso, lugha ya mwili na mpangilio wa muda. Waandishi wanaripoti uboreshaji juu ya misingi ya mizani ya 7B ya chanzo huria kwenye vigezo vitatu…

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
Hati ya chanzo msingiChanzo kimerekodiwa
Mchapishaji
arxiv.org
Kiungo cha chanzo
arxiv.orghttps://arxiv.org/abs/2608.26193
Aina ya chanzo
Hati ya msingi - tangazo rasmi, karatasi, faili, au ukurasa wa mtu wa kwanza tunasoma moja kwa moja.
MuktadhaElewa hili katika sekunde 60

Anzia hapa

Masharti muhimu

Mafunzo ya Kuimarisha
Mazoezi kwa kutumia ishara za zawadi ambapo wakala hujifunza vitendo vinavyoongeza faida ya muda mrefu.
Mfano wa Multimodal
Muundo ambao unaweza kuchakata au kutoa aina nyingi za data kama vile maandishi, picha na sauti.
Urekebishaji
Jinsi alama za kujiamini za mfano zinalingana na uwezekano halisi wa usahihi.
Jijaribu mwenyeweAI ni nini? Maswali

Nini kilitokea

Watafiti wamependekeza AffectOmni, mfumo wa kufunza modeli za lugha kubwa za aina nyingi ili kusababu kuhusu hisia, nia na ishara zingine zinazoathiri katika picha au matukio yanayohusiana na kijamii na sanaa. Machapisho ya awali yanasema kuwa miundo wakati fulani inaweza kufikia majibu sahihi kwa kutegemea muktadha unaowazunguka huku ikipuuza ushahidi unaozingatia watu ambao ungefanya hoja zao kuwa rahisi kukagua.

Chapa ya awali iliyowasilishwa kwa arXiv mnamo Agosti 24 inafafanua AffectOmni, mfumo wa uimarishaji wa mafunzo ya hoja zinazoweza kuthibitishwa katika miundo ya lugha kubwa ya aina nyingi. Karatasi inaangazia matukio ya kijamii na sanaa ambayo mfumo unaweza kuhitaji kukisia hisia, dhamira au mpangilio wa matukio. Waandishi hubainisha udhaifu mahususi katika mifumo iliyopo: mwanamitindo anaweza kutoa jibu sahihi huku akitumia njia za mkato kulingana na muktadha wa eneo pana badala ya kuzingatia viashiria vinavyowalenga watu kama vile misemo midogo na lugha ya mwili.

Mfumo huo unaongeza vipengele viwili vya zawadi vinavyoitwa Umakini wa Watu na Agizo la Muda. Kulingana na chanzo, People Focus inahimiza mtindo kuchagua ushahidi unaohusisha watu, wakati Agizo la Muda linahimiza mawazo ambayo yamepangwa wakati matukio yanapotokea. Karatasi hiyo inasema ishara hizi zinakusudiwa kupunguza tabia ya njia ya mkato na kuboresha uhusiano kati ya jibu la mfano na ushahidi wa kuona unaounga mkono. Chanzo hakitoi maelezo ya kutosha kubainisha jinsi zawadi hizi zinavyofanya kazi katika aina zote za tukio au kama zinazuia njia ya mkato katika majaribio huru.

AffectOmni pia hutumia alama linganishi za ndani ya kikundi wakati wa ujifunzaji wa uimarishaji. Waandishi wanasema hii inakusudiwa kushughulikia mkusanyiko wa alama katika ukadiriaji wa modeli za lugha kubwa, ambapo majibu mengi ya watahiniwa hupokea alama zinazofanana na kwa hivyo kutoa ishara dhaifu za kibaguzi. Baada ya kielelezo kutoa mantiki isiyolipishwa, Muhtasari wa Kufikiri hubadilisha mantiki hiyo kuwa maagizo ya ushahidi unaotekelezeka. Maagizo hayo basi huwekwa katika maeneo ya ushahidi wa kiwango cha pixel kwa kutumia SAM3, na kuunda kile ambacho waandishi wanaelezea kama kiolesura kinachoweza kukaguliwa nje ya kitanzi cha mafunzo.

Chanzo kinaripoti majaribio kwenye vigezo vitatu: IntentBench, Daily Omni na WorldSense. Ikilinganishwa na miundo ya chanzo huria katika kipimo cha 7B, waandishi huripoti uboreshaji thabiti, ikijumuisha faida ya 4.66% ya utambuzi wa hisia na faida ya 14.29% kwenye kazi nyeti za muda. Chanzo hakibainishi ikiwa takwimu hizi ni faida za asilimia kamili au uboreshaji wa asilimia linganifu, na hakitoi hesabu za sampuli, vipindi vya uaminifu, upau wa makosa au ulinganisho na mifumo thabiti zaidi ya wamiliki. Alama ya awali inasema msimbo unapatikana, lakini chanzo hakitoi kiungo cha hazina kinachoweza kutumika au kuelezea masharti ya leseni.

Maelezo ya chanzo: arxiv.org ↗

Kwa nini ni muhimu

Utambuzi wa athari ni uwezo wa matokeo kwa mifumo inayotafsiri mwingiliano wa kijamii, lakini lebo sahihi haionyeshi kuwa mwanamitindo aligundua mtu husika, usemi au ishara. Mbinu ya AffectOmni inashughulikia tatizo hilo la ufuatiliaji kwa kuoanisha hoja za kielelezo na maeneo ya ushahidi ambayo yanaweza kukaguliwa nje ya mchakato wa mafunzo. Ikiwa faida zilizoripotiwa zitashikilia zaidi ya viwango vya waandishi, mbinu inaweza kutoa njia ya kuwajibika zaidi ya kutathmini mifumo mingi inayotafsiri tabia ya binadamu.

Suala la vitendo sio tu ikiwa mtindo wa multimodal unaweza kutaja hisia. Katika programu zinazotafsiri matukio ya kijamii, watumiaji wanaweza kuhitaji kujua ni ushahidi gani unaoonekana ulisababisha uamuzi. Mfumo unaoweka tukio kwa usahihi kwa sababu isiyo sahihi unaweza kushindwa wakati mandharinyuma, mavazi, mpangilio au viashiria vingine vya muktadha vinabadilika. Msisitizo wa karatasi juu ya ushahidi unaozingatia watu hushughulikia pengo hilo la kutegemewa moja kwa moja, ingawa chanzo kinaripoti tafsiri ya waandishi badala ya matokeo yaliyothibitishwa kwa kujitegemea.

Hatua ya msingi ya ushahidi inaweza kufanya matokeo ya mfano wa kuathiriwa kuwa rahisi kukaguliwa. Kwa kutafsiri mantiki kuwa maagizo na kuyahusisha na maeneo ya kiwango cha pikseli, AffectOmni inatoa vizalia vya programu madhubuti ambavyo mtathmini anaweza kukagua. Hili linafanya kazi zaidi kuliko ombi la jumla la kielelezo kujieleza: dai linahusishwa na maeneo katika picha ya uingizaji. Hata hivyo, maeneo yaliyoangaziwa hayapaswi kuchukuliwa kiotomatiki kama uthibitisho wa sababu za kisababishi. Chanzo hakithibitishi kwamba mikoa inafichua kwa uaminifu mchakato wa ndani uliotoa jibu.

Maboresho yaliyoripotiwa yanaweza kuwa ya manufaa kwa sababu uelewa wa muda na ufafanuzi wa kihisia ni pointi za kawaida za kushindwa katika mifumo ya multimodal. Uboreshaji wa 14.29% kwenye kazi nyeti za muda, ikiwa itatolewa tena na kufafanuliwa kwa uwazi, inaweza kuwa muhimu kwa mifumo inayochanganua mfuatano badala ya picha zilizotengwa. Chanzo hakisemi jinsi kazi zilivyo ngumu, jinsi vigezo viliundwa au ikiwa faida hutafsiriwa kwa matumizi muhimu kama vile elimu, ufikiaji, udhibiti au mwingiliano wa kompyuta ya binadamu.

Kazi pia inaonyesha chaguo pana la muundo katika tathmini ya AI: kuthawabisha sio tu matokeo lakini uteuzi na mpangilio wa ushahidi unaounga mkono. Mbinu hiyo inaweza kusaidia watafiti kutofautisha msingi halisi wa kuona kutoka kwa majibu yanayotolewa kupitia miunganisho ya hifadhidata. Hata hivyo, hukumu zinazohusika kwa asili ni nyeti kwa muktadha na tafsiri. Mbinu inayotuza inazingatia viashiria vya binadamu vinavyoonekana bado inaweza kusimba mawazo kuhusu usemi wa kihisia, kanuni za kijamii au maana ya ishara, hasa wakati mawazo hayo yanaonyeshwa katika data ya mafunzo.

Interactive Mechanism

Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli

Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Ukaguzi wa Dhana ya Kuingiliana+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

Nini cha kutazama baadaye

Matokeo yanatoka kwa nakala moja ya awali ya arXiv yenye kurasa 12 na yanaripotiwa na waandishi wake; chanzo hakianzishi uigaji huru, usambazaji wa ulimwengu halisi au utendaji katika makundi na mipangilio mipana. Kazi ya ufuatiliaji inapaswa kupima kama kiunzi kinasalia kutegemewa na tamaduni zisizojulikana, mwingiliano usioeleweka, ubora duni wa picha na matukio ambapo viashiria vya hisia ni hafifu au vinapingana. Itakuwa muhimu pia kubainisha ikiwa maeneo ya ushahidi yanaonyesha mchakato wa uamuzi wa kielelezo kikweli au kutoa tu maeneo yanayokubalika baada ya jibu kuundwa.

Swali la kwanza ni replication. AffectOmni imewasilishwa kama kichapo cha awali cha arXiv, si kama matokeo yaliyokaguliwa na wenzao au yaliyothibitishwa kwa kujitegemea. Watafiti wanapaswa kuangalia ikiwa mafanikio yaliyoripotiwa yanaendelea chini ya itifaki sawa ya tathmini, iwapo yatasalia baada ya kudhibiti data ya ziada ya mafunzo au ukubwa wa kielelezo, na kama mbinu hiyo inaboresha urekebishaji na ugunduzi wa makosa badala ya alama za kuigwa pekee.

Upeo wa benchmark utajalisha. Chanzo kinataja IntentBench, Daily Omni na WorldSense lakini hakielezi hali zao za kijamii, lugha, ubora wa picha, mipangilio ya kitamaduni au usawa wa hali zao za kijamii. Tathmini za siku zijazo zinapaswa kupima hisia zisizoeleweka, ishara mchanganyiko, nyuso zilizofungwa, misimamo isiyo ya kawaida ya mwili na matukio ambayo mtu mahiri zaidi si chanzo cha ushahidi husika. Wanapaswa pia kuripoti matokeo ya kikundi kidogo ambapo tafsiri inaweza kutofautiana katika tamaduni au ulemavu.

Dai la ukaguzi linastahili majaribio yaliyolengwa. Mtathmini anaweza kulinganisha maeneo yaliyoangaziwa na maelezo ya kibinadamu, kutatiza maeneo yaliyochaguliwa, kuyaficha, au kuchukua nafasi ya muktadha wa usuli huku akishikilia ushahidi unaozingatia watu mara kwa mara. Majaribio kama haya yangesaidia kuamua ikiwa maeneo ya ushahidi ni muhimu kwa uamuzi wa modeli au yanatolewa baada ya ukweli. Chanzo hakiripoti majaribio haya, kwa hivyo kiwango cha uthibitishaji unaodaiwa bado hakijulikani.

Hatimaye, mipaka ya vitendo haijaanzishwa. Hakuna taarifa kwenye chanzo kuhusu muda wa kusubiri, gharama ya kukokotoa, utoaji leseni, upatikanaji wa usambazaji, ulinzi wa faragha au matumizi katika mifumo ya moja kwa moja. Waandishi huripoti matokeo dhidi ya misingi huria ya mizani ya 7B, lakini chanzo hakionyeshi ikiwa AffectOmni ina ushindani na miundo mikubwa zaidi au imara nje ya vigezo vitatu vilivyotajwa. Hadi maswali hayo yatajibiwa, kazi inaeleweka vyema zaidi kama pendekezo la utafiti lenye matokeo ya kuahidi yaliyoripotiwa, na si kama suluhu iliyoidhinishwa ya kutafsiri hisia za watu.

Miongozo & maswali yanayohusiana

AI ni nini?Mifano ya AI ImefafanuliwaTransfomaMaadili ya AIJaribu unachojua - jaribu maswali ya AI bila malipoTafuta istilahi ya AI katika faharasa yetuFuata kifuatiliaji cha toleo la muundo wa AI
Je, umepata hii kuwa muhimu?