Nini kilitokea
Watafiti wamependekeza AffectOmni, mfumo wa kufunza modeli za lugha kubwa za aina nyingi ili kusababu kuhusu hisia, nia na ishara zingine zinazoathiri katika picha au matukio yanayohusiana na kijamii na sanaa. Machapisho ya awali yanasema kuwa miundo wakati fulani inaweza kufikia majibu sahihi kwa kutegemea muktadha unaowazunguka huku ikipuuza ushahidi unaozingatia watu ambao ungefanya hoja zao kuwa rahisi kukagua.
Chapa ya awali iliyowasilishwa kwa arXiv mnamo Agosti 24 inafafanua AffectOmni, mfumo wa uimarishaji wa mafunzo ya hoja zinazoweza kuthibitishwa katika miundo ya lugha kubwa ya aina nyingi. Karatasi inaangazia matukio ya kijamii na sanaa ambayo mfumo unaweza kuhitaji kukisia hisia, dhamira au mpangilio wa matukio. Waandishi hubainisha udhaifu mahususi katika mifumo iliyopo: mwanamitindo anaweza kutoa jibu sahihi huku akitumia njia za mkato kulingana na muktadha wa eneo pana badala ya kuzingatia viashiria vinavyowalenga watu kama vile misemo midogo na lugha ya mwili.
Mfumo huo unaongeza vipengele viwili vya zawadi vinavyoitwa Umakini wa Watu na Agizo la Muda. Kulingana na chanzo, People Focus inahimiza mtindo kuchagua ushahidi unaohusisha watu, wakati Agizo la Muda linahimiza mawazo ambayo yamepangwa wakati matukio yanapotokea. Karatasi hiyo inasema ishara hizi zinakusudiwa kupunguza tabia ya njia ya mkato na kuboresha uhusiano kati ya jibu la mfano na ushahidi wa kuona unaounga mkono. Chanzo hakitoi maelezo ya kutosha kubainisha jinsi zawadi hizi zinavyofanya kazi katika aina zote za tukio au kama zinazuia njia ya mkato katika majaribio huru.
AffectOmni pia hutumia alama linganishi za ndani ya kikundi wakati wa ujifunzaji wa uimarishaji. Waandishi wanasema hii inakusudiwa kushughulikia mkusanyiko wa alama katika ukadiriaji wa modeli za lugha kubwa, ambapo majibu mengi ya watahiniwa hupokea alama zinazofanana na kwa hivyo kutoa ishara dhaifu za kibaguzi. Baada ya kielelezo kutoa mantiki isiyolipishwa, Muhtasari wa Kufikiri hubadilisha mantiki hiyo kuwa maagizo ya ushahidi unaotekelezeka. Maagizo hayo basi huwekwa katika maeneo ya ushahidi wa kiwango cha pixel kwa kutumia SAM3, na kuunda kile ambacho waandishi wanaelezea kama kiolesura kinachoweza kukaguliwa nje ya kitanzi cha mafunzo.
Chanzo kinaripoti majaribio kwenye vigezo vitatu: IntentBench, Daily Omni na WorldSense. Ikilinganishwa na miundo ya chanzo huria katika kipimo cha 7B, waandishi huripoti uboreshaji thabiti, ikijumuisha faida ya 4.66% ya utambuzi wa hisia na faida ya 14.29% kwenye kazi nyeti za muda. Chanzo hakibainishi ikiwa takwimu hizi ni faida za asilimia kamili au uboreshaji wa asilimia linganifu, na hakitoi hesabu za sampuli, vipindi vya uaminifu, upau wa makosa au ulinganisho na mifumo thabiti zaidi ya wamiliki. Alama ya awali inasema msimbo unapatikana, lakini chanzo hakitoi kiungo cha hazina kinachoweza kutumika au kuelezea masharti ya leseni.
Maelezo ya chanzo: arxiv.org ↗
Kwa nini ni muhimu
Utambuzi wa athari ni uwezo wa matokeo kwa mifumo inayotafsiri mwingiliano wa kijamii, lakini lebo sahihi haionyeshi kuwa mwanamitindo aligundua mtu husika, usemi au ishara. Mbinu ya AffectOmni inashughulikia tatizo hilo la ufuatiliaji kwa kuoanisha hoja za kielelezo na maeneo ya ushahidi ambayo yanaweza kukaguliwa nje ya mchakato wa mafunzo. Ikiwa faida zilizoripotiwa zitashikilia zaidi ya viwango vya waandishi, mbinu inaweza kutoa njia ya kuwajibika zaidi ya kutathmini mifumo mingi inayotafsiri tabia ya binadamu.
Suala la vitendo sio tu ikiwa mtindo wa multimodal unaweza kutaja hisia. Katika programu zinazotafsiri matukio ya kijamii, watumiaji wanaweza kuhitaji kujua ni ushahidi gani unaoonekana ulisababisha uamuzi. Mfumo unaoweka tukio kwa usahihi kwa sababu isiyo sahihi unaweza kushindwa wakati mandharinyuma, mavazi, mpangilio au viashiria vingine vya muktadha vinabadilika. Msisitizo wa karatasi juu ya ushahidi unaozingatia watu hushughulikia pengo hilo la kutegemewa moja kwa moja, ingawa chanzo kinaripoti tafsiri ya waandishi badala ya matokeo yaliyothibitishwa kwa kujitegemea.
Hatua ya msingi ya ushahidi inaweza kufanya matokeo ya mfano wa kuathiriwa kuwa rahisi kukaguliwa. Kwa kutafsiri mantiki kuwa maagizo na kuyahusisha na maeneo ya kiwango cha pikseli, AffectOmni inatoa vizalia vya programu madhubuti ambavyo mtathmini anaweza kukagua. Hili linafanya kazi zaidi kuliko ombi la jumla la kielelezo kujieleza: dai linahusishwa na maeneo katika picha ya uingizaji. Hata hivyo, maeneo yaliyoangaziwa hayapaswi kuchukuliwa kiotomatiki kama uthibitisho wa sababu za kisababishi. Chanzo hakithibitishi kwamba mikoa inafichua kwa uaminifu mchakato wa ndani uliotoa jibu.
Maboresho yaliyoripotiwa yanaweza kuwa ya manufaa kwa sababu uelewa wa muda na ufafanuzi wa kihisia ni pointi za kawaida za kushindwa katika mifumo ya multimodal. Uboreshaji wa 14.29% kwenye kazi nyeti za muda, ikiwa itatolewa tena na kufafanuliwa kwa uwazi, inaweza kuwa muhimu kwa mifumo inayochanganua mfuatano badala ya picha zilizotengwa. Chanzo hakisemi jinsi kazi zilivyo ngumu, jinsi vigezo viliundwa au ikiwa faida hutafsiriwa kwa matumizi muhimu kama vile elimu, ufikiaji, udhibiti au mwingiliano wa kompyuta ya binadamu.
Kazi pia inaonyesha chaguo pana la muundo katika tathmini ya AI: kuthawabisha sio tu matokeo lakini uteuzi na mpangilio wa ushahidi unaounga mkono. Mbinu hiyo inaweza kusaidia watafiti kutofautisha msingi halisi wa kuona kutoka kwa majibu yanayotolewa kupitia miunganisho ya hifadhidata. Hata hivyo, hukumu zinazohusika kwa asili ni nyeti kwa muktadha na tafsiri. Mbinu inayotuza inazingatia viashiria vya binadamu vinavyoonekana bado inaweza kusimba mawazo kuhusu usemi wa kihisia, kanuni za kijamii au maana ya ishara, hasa wakati mawazo hayo yanaonyeshwa katika data ya mafunzo.
Mbinu shirikishi: Jinsi Inavyofanya Kazi Kweli
Chunguza teknolojia msingi nyuma ya ukuzaji huu kwa maingiliano.
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
Nini cha kutazama baadaye
Matokeo yanatoka kwa nakala moja ya awali ya arXiv yenye kurasa 12 na yanaripotiwa na waandishi wake; chanzo hakianzishi uigaji huru, usambazaji wa ulimwengu halisi au utendaji katika makundi na mipangilio mipana. Kazi ya ufuatiliaji inapaswa kupima kama kiunzi kinasalia kutegemewa na tamaduni zisizojulikana, mwingiliano usioeleweka, ubora duni wa picha na matukio ambapo viashiria vya hisia ni hafifu au vinapingana. Itakuwa muhimu pia kubainisha ikiwa maeneo ya ushahidi yanaonyesha mchakato wa uamuzi wa kielelezo kikweli au kutoa tu maeneo yanayokubalika baada ya jibu kuundwa.
Swali la kwanza ni replication. AffectOmni imewasilishwa kama kichapo cha awali cha arXiv, si kama matokeo yaliyokaguliwa na wenzao au yaliyothibitishwa kwa kujitegemea. Watafiti wanapaswa kuangalia ikiwa mafanikio yaliyoripotiwa yanaendelea chini ya itifaki sawa ya tathmini, iwapo yatasalia baada ya kudhibiti data ya ziada ya mafunzo au ukubwa wa kielelezo, na kama mbinu hiyo inaboresha urekebishaji na ugunduzi wa makosa badala ya alama za kuigwa pekee.
Upeo wa benchmark utajalisha. Chanzo kinataja IntentBench, Daily Omni na WorldSense lakini hakielezi hali zao za kijamii, lugha, ubora wa picha, mipangilio ya kitamaduni au usawa wa hali zao za kijamii. Tathmini za siku zijazo zinapaswa kupima hisia zisizoeleweka, ishara mchanganyiko, nyuso zilizofungwa, misimamo isiyo ya kawaida ya mwili na matukio ambayo mtu mahiri zaidi si chanzo cha ushahidi husika. Wanapaswa pia kuripoti matokeo ya kikundi kidogo ambapo tafsiri inaweza kutofautiana katika tamaduni au ulemavu.
Dai la ukaguzi linastahili majaribio yaliyolengwa. Mtathmini anaweza kulinganisha maeneo yaliyoangaziwa na maelezo ya kibinadamu, kutatiza maeneo yaliyochaguliwa, kuyaficha, au kuchukua nafasi ya muktadha wa usuli huku akishikilia ushahidi unaozingatia watu mara kwa mara. Majaribio kama haya yangesaidia kuamua ikiwa maeneo ya ushahidi ni muhimu kwa uamuzi wa modeli au yanatolewa baada ya ukweli. Chanzo hakiripoti majaribio haya, kwa hivyo kiwango cha uthibitishaji unaodaiwa bado hakijulikani.
Hatimaye, mipaka ya vitendo haijaanzishwa. Hakuna taarifa kwenye chanzo kuhusu muda wa kusubiri, gharama ya kukokotoa, utoaji leseni, upatikanaji wa usambazaji, ulinzi wa faragha au matumizi katika mifumo ya moja kwa moja. Waandishi huripoti matokeo dhidi ya misingi huria ya mizani ya 7B, lakini chanzo hakionyeshi ikiwa AffectOmni ina ushindani na miundo mikubwa zaidi au imara nje ya vigezo vitatu vilivyotajwa. Hadi maswali hayo yatajibiwa, kazi inaeleweka vyema zaidi kama pendekezo la utafiti lenye matokeo ya kuahidi yaliyoripotiwa, na si kama suluhu iliyoidhinishwa ya kutafsiri hisia za watu.