ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

AffectOmni ሰዎችን ያማከለ ምስላዊ ማስረጃን በመጠቀም ስሜቶችን ለማስረዳት መልቲሞዳል AI ያሠለጥናል።

አዲስ ቅድመ-ህትመት የመልቲሞዳል AI ሞዴሎች በሰዎች ላይ ያተኮሩ እንደ የፊት አገላለጾች፣ የሰውነት ቋንቋ እና ጊዜአዊ ቅደም ተከተል ባሉ ምልክቶች ላይ ተጽእኖ የሚያሳድሩ ውሳኔዎችን ለማድረግ የተነደፈውን የማጠናከሪያ-መማሪያ ማእቀፍ AffectOmniን ይገልፃል። ደራሲዎቹ በክፍት-ምንጭ 7B-ሚዛን መሰረቶች ላይ በሶስት መለኪያዎች ላይ ማሻሻያዎችን ሪፖርት አድርገዋል…

6 min readRead the primary source
Primary-source image accompanying AffectOmni trains multimodal AI to explain emotions using people-centered visual evidence
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.26193
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

የማጠናከሪያ ትምህርት
ወኪሉ የረጅም ጊዜ መመለሻን ከፍ የሚያደርጉ ድርጊቶችን የሚማርበት የሽልማት ምልክቶችን ማሰልጠን።
መልቲሞዳል ሞዴል
እንደ ጽሑፍ፣ ምስል እና ኦዲዮ ያሉ በርካታ የውሂብ አይነቶችን ማስኬድ ወይም ማመንጨት የሚችል ሞዴል።
መለካት
የአንድ ሞዴል በራስ መተማመን ውጤቶች ከትክክለኛ ትክክለኛነት እድሎች ጋር ምን ያህል እንደሚዛመዱ።
እራስህን ፈትን።AI ምንድን ነው? ጥያቄ

ምን ተፈጠረ

ተመራማሪዎች የመልቲሞዳል ትልልቅ ቋንቋ ሞዴሎችን በማህበራዊ እና በሥነ ጥበብ ነክ ምስሎች ወይም ትዕይንቶች ላይ ስሜትን፣ ዓላማዎችን እና ሌሎች አነቃቂ ምልክቶችን እንዲያስቡበት አፍፌኦምኒ የተባለውን ማዕቀፍ አቅርበዋል። ቅድመ ህትመቱ ሞዴሎች አንዳንድ ጊዜ በሰዎች ላይ ያተኮሩ ማስረጃዎችን በመመልከት በዙሪያው ባለው አውድ ላይ ተመርኩዘው ትክክለኛ መልስ ላይ ሊደርሱ እንደሚችሉ ይከራከራል ይህም ምክንያታቸውን ለማጣራት ቀላል ያደርገዋል።

በነሀሴ 24 ለarXiv የቀረበው ቅድመ ህትመት AffectOmniን ይገልፃል ፣ለተረጋገጠ አፅንኦታዊ አስተሳሰብ በብዙ ሞዳል ትላልቅ ቋንቋ ሞዴሎች። ወረቀቱ አንድ ሥርዓት ስሜትን፣ ዓላማን ወይም የክስተቶችን ቅደም ተከተል ለመገመት በሚያስፈልግባቸው ከማህበራዊ እና ከሥነ ጥበብ ጋር በተያያዙ ትዕይንቶች ላይ ያተኩራል። ደራሲዎቹ በነባር ስርዓቶች ውስጥ የተወሰነ ድክመትን ይለያሉ፡ አንድ ሞዴል በሰፊ ትእይንት አውድ ላይ ተመስርተው አቋራጭ መንገዶችን ሲጠቀሙ እንደ ማይክሮ አገላለጾች እና የሰውነት ቋንቋ ያሉ ሰዎችን ያማከለ ምልክቶችን ከመከታተል ይልቅ ትክክለኛውን መልስ ሊሰጥ ይችላል።

ማዕቀፉ የሰዎች ትኩረት እና ጊዜያዊ ቅደም ተከተል የሚባሉ ሁለት የሽልማት ክፍሎችን ይጨምራል። እንደ ምንጩ፣ ፒፕል ፎከስ ሞዴሉን ሰዎችን የሚያካትቱ ማስረጃዎችን እንዲመርጥ ያበረታታል፣ ጊዜያዊ ትዕዛዝ ደግሞ ክስተቶች በሚከሰቱበት ጊዜ በዙሪያው የተዋቀረ አስተሳሰብን ያበረታታል። ወረቀቱ እነዚህ ምልክቶች የአቋራጭ ባህሪን ለመቀነስ እና በአምሳያው መልስ እና እሱን በሚደግፉ ምስላዊ ማስረጃዎች መካከል ያለውን ግንኙነት ለማሻሻል የታሰቡ ናቸው ብሏል። ምንጩ እነዚህ ሽልማቶች በሁሉም ትዕይንቶች ላይ እንዴት እንደሚታዩ ወይም በገለልተኛ ሙከራዎች ውስጥ አቋራጭ መንገዶችን እንደሚከለክሉ ለማረጋገጥ በቂ ዝርዝር መረጃ አይሰጥም።

AffectOmni በማጠናከሪያ ትምህርት ወቅት በቡድን ውስጥ የንፅፅር ነጥብን ይጠቀማል። ደራሲዎቹ ይህ በትልቅ ቋንቋ-ሞዴል ዳኝነት የውጤት ስብስቦችን ለመቅረፍ የታሰበ ነው ይላሉ፣ ብዙ እጩ መልሶች ተመሳሳይ ነጥብ የሚያገኙበት እና ስለዚህ ደካማ አድሎአዊ የስልጠና ምልክቶችን ያመነጫሉ። ሞዴሉ የነጻ ቅፅ ምክንያታዊነትን ካመነጨ በኋላ፣ Thinking Summarizer ያንን ምክንያት ወደ ተፈፃሚ የማስረጃ መመሪያዎች ይለውጠዋል። እነዚያ መመሪያዎች SAM3 ን በመጠቀም ወደ ፒክስል-ደረጃ ማስረጃ ክልሎች ይመሰረታሉ፣ ይህም ደራሲዎቹ ከስልጠና ዑደት ውጪ እንደ ውጫዊ ኦዲት ሊደረግ የሚችል በይነገጽ ይገልጻሉ።

ምንጩ በሶስት መመዘኛዎች ላይ ሙከራዎችን ዘግቧል፡ IntentBench፣ Daily Omni እና WorldSense። በክፍት ምንጭ ሞዴሎች በ7B ሚዛን፣ ደራሲዎቹ ተከታታይ ማሻሻያዎችን ሪፖርት አድርገዋል፣ በስሜት ማወቂያ ላይ 4.66% ትርፍ እና 14.29% በጊዜያዊ ሚስጥራዊነት ያላቸው ተግባራትን ጨምሮ። ምንጩ እነዚህ አሃዞች ፍጹም መቶኛ-ነጥብ ረብ ወይም አንጻራዊ መቶኛ መሻሻሎች መሆናቸውን አይገልጽም እና የናሙና ቆጠራዎችን፣ የመተማመን ክፍተቶችን ፣ የስህተት አሞሌዎችን ወይም ከጠንካራዎቹ የባለቤትነት ስርዓቶች ጋር ማነፃፀርን አይሰጥም። ቅድመ ህትመቱ ኮድ ይገኛል ይላል፣ ነገር ግን ምንጩ ጥቅም ላይ ሊውል የሚችል የመረጃ ቋት አገናኝ አያቀርብም ወይም የፍቃድ መስጫ ውሎችን አይገልጽም።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

ተፅዕኖ ማወቂያ ማህበራዊ ግንኙነቶችን ለሚተረጉሙ ስርዓቶች የውጤት ችሎታ ነው፣ ​​ነገር ግን ትክክለኛ መለያ የግድ ሞዴል የሚመለከተውን ሰው፣ አገላለጽ ወይም የእጅ ምልክት እንዳስተዋለ አያሳይም። የAffectOmni አካሄድ ከስልጠናው ሂደት ውጭ ሊፈተሹ ከሚችሉት የሞዴል አመክንዮዎችን ከማስረጃ ክልሎች ጋር በማጣመር የመከታተያ ችግርን ይመለከታል። የተዘገበው ትርፍ ከደራሲያን መመዘኛዎች በላይ የሚይዝ ከሆነ፣ ዘዴው የሰውን ባህሪ የሚተረጉሙ የመልቲሞዳል ስርዓቶችን ለመገምገም የበለጠ ተጠያቂነት ያለው መንገድ ሊሰጥ ይችላል።

ተግባራዊው ጉዳይ የመልቲሞዳል ሞዴል ስሜትን መሰየም መቻሉ ብቻ አይደለም። ማህበራዊ ትዕይንቶችን በሚተረጉሙ መተግበሪያዎች ውስጥ ተጠቃሚዎች የትኞቹ የሚታዩ ማስረጃዎች ለፍርድ እንደመሩ ማወቅ አለባቸው። ትዕይንቱን በተሳሳተ ምክንያት በትክክል የሚሰይም ስርዓት ከበስተጀርባ፣ ልብስ፣ መቼት ወይም ሌላ የአውድ ምልክቶች ሲቀየሩ ሊሳካ ይችላል። የወረቀቱ አጽንዖት በሰዎች ላይ ያተኮረ ማስረጃዎች የአስተማማኝነት ክፍተቱን በቀጥታ ይመለከታቸዋል፣ ምንም እንኳን ምንጩ የጸሐፊዎችን ትርጓሜ ቢዘግብም በግል የተረጋገጠ ግኝት ነው።

በማስረጃ ላይ የተመሰረተው እርምጃ ተፅዕኖ ፈጣሪ የሆኑ የሞዴል ውጤቶችን ለኦዲት ቀላል ያደርገዋል። አመክንዮ ወደ መመሪያ በመተርጎም እና እነሱን ከፒክሰል ደረጃ ክልሎች ጋር በማጣመር፣ AffectOmni አንድ ገምጋሚ ​​ሊመረምረው የሚችል ተጨባጭ ቅርስ ያቀርባል። ይህ እራሱን ለማብራራት ሞዴል ከሚቀርበው አጠቃላይ ጥያቄ የበለጠ የሚሰራ ነው፡ የይገባኛል ጥያቄው በግቤት ምስል ውስጥ ካሉ ቦታዎች ጋር የተያያዘ ነው። ያም ሆኖ፣ የደመቁ ክልሎች የምክንያት አሳማኝ ማስረጃ ተደርጎ ሊወሰዱ አይገባም። ክልሎች መልሱን ያመጣውን የውስጥ ሂደት በታማኝነት መግለጻቸውን ምንጩ አላረጋገጠም።

የተዘገበው ማሻሻያ ጠቃሚ ሊሆን ይችላል ምክንያቱም ጊዜያዊ ግንዛቤ እና ስሜታዊ ትርጓሜ በመልቲሞዳል ሲስተም ውስጥ የተለመዱ የውድቀት ነጥቦች ናቸው። በጊዜያዊ ሚስጥራዊነት ያላቸው ተግባራት ላይ የ14.29% ማሻሻያ፣ በተናጥል ከተባዙ እና በግልፅ ከተገለጸ፣ ከተገለሉ ምስሎች ይልቅ ቅደም ተከተሎችን ለሚተነትኑ ስርዓቶች አስፈላጊ ሊሆን ይችላል። ምንጩ ሥራዎቹ ምን ያህል ከባድ እንደሆኑ፣ መመዘኛዎቹ እንዴት እንደተሠሩ ወይም ጥቅሞቹ እንደ ትምህርት፣ ተደራሽነት፣ ልከኝነት ወይም የሰው-ኮምፒውተር መስተጋብር ወደ መሳሰሉት አጠቃቀሞች መተርጎማቸውን አይገልጽም።

ስራው በ AI ግምገማ ውስጥ ሰፋ ያለ የንድፍ ምርጫን ያሳያል፡ ውጤቱን ብቻ ሳይሆን ደጋፊ ማስረጃዎችን መምረጥ እና ማደራጀት። ያ አቀራረብ ተመራማሪዎች በመረጃ ስብስብ ማህበራት በኩል ከሚቀርቡት መልሶች እውነተኛ ምስላዊ መሰረትን እንዲለዩ ሊረዳቸው ይችላል። ሆኖም፣ አነቃቂ ፍርዶች በተፈጥሯቸው ለዐውደ-ጽሑፍ እና ለትርጉም ስሜታዊ ናቸው። በሚታዩ የሰዎች ምልክቶች ላይ የሚያተኩር ዘዴ አሁንም ስለ ስሜታዊ አገላለጽ፣ ማህበራዊ ደንቦች ወይም የምልክት ምልክቶች ትርጉም ግምቶችን ሊያካትት ይችላል፣ በተለይ እነዚህ ግምቶች በስልጠናው መረጃ ላይ ሲንጸባረቁ።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
What is AI? Quiz

A route planner searches possible journeys using explicit rules. What does this illustrate about AI?

ቀጥሎ ምን እንደሚታይ

ውጤቶቹ ከአንድ ባለ 12-ገጽ arXiv ቅድመ-ህትመት የመጡ ናቸው እና በጸሐፊዎቹ ሪፖርት የተደረጉ ናቸው። ምንጩ ራሱን የቻለ ማባዛት፣ የገሃዱ ዓለም ማሰማራት ወይም አፈጻጸምን በሰፊ ህዝብ እና አቀማመጦች ውስጥ አላስቀመጠም። የክትትል ስራ ማዕቀፉ አስተማማኝ ሆኖ መቆየቱን በማይታወቁ ባህሎች፣ አሻሚ መስተጋብሮች፣ ደካማ የምስል ጥራት እና ስሜታዊ ምልክቶች ስውር ወይም እርስ በርስ የሚቃረኑ መሆናቸውን ማረጋገጥ አለበት። እንዲሁም የማስረጃ ክልሎች የሞዴሉን የውሳኔ ሂደት በትክክል የሚያንፀባርቁ ወይም መልሱ ከተሰራ በኋላ አሳማኝ ድጋፍ ሰጪ ቦታዎችን ብቻ ያቀርቡ እንደሆነ መወሰን አስፈላጊ ይሆናል።

የመጀመሪያው ጥያቄ ማባዛት ነው. AffectOmni እንደ arXiv ቅድመ-ህትመት ነው የሚቀርበው እንጂ በአቻ-የተገመገመ ወይም በራሱ የተረጋገጠ ውጤት አይደለም። ተመራማሪዎች ሪፖርት የተደረጉት ውጤቶች በተመሳሳይ የግምገማ ፕሮቶኮል መቀጠላቸውን፣ ለተጨማሪ የሥልጠና መረጃ ወይም የሞዴል መጠን ከተቆጣጠሩ በኋላ መቆየታቸውን፣ እና ዘዴው የቤንችማርክ ነጥቦችን ብቻ ሳይሆን የመለኪያ እና የስህተት ማወቂያን እንደሚያሻሽል ማረጋገጥ አለባቸው።

የቤንችማርክ ወሰን አስፈላጊ ይሆናል. ምንጩ IntentBench፣ Daily Omni እና WorldSense የሚል ስም ሰጥቷቸዋል ነገር ግን የስነ ሕዝብ አወቃቀር ሽፋንን፣ ቋንቋዎችን፣ የምስል ጥራትን፣ የባህል መቼቶችን ወይም የማህበራዊ ሁኔታዎችን ሚዛን አይገልጽም። የወደፊት ግምገማዎች አሻሚ ስሜቶችን, የተቀላቀሉ ምልክቶችን, የተዘጉ ፊቶችን, ያልተለመዱ የሰውነት አቀማመጦችን እና ትዕይንቶችን በጣም ጎበዝ ሰው ተዛማጅ ማስረጃዎች ምንጭ አለመሆኑን መሞከር አለባቸው. በባህሎች ወይም በአካል ጉዳተኞች አተረጓጎም ሊለያይ የሚችልበትን የንዑስ ቡድን ውጤቶችን ሪፖርት ማድረግ አለባቸው።

የኦዲትነት ይገባኛል ጥያቄ የታለመ ሙከራ ይገባዋል። ገምጋሚው የደመቁትን ክልሎች ከሰዎች ማብራሪያዎች ጋር ማነፃፀር፣ የተመረጡትን ክልሎች ማዛባት፣ መደበቅ ወይም የጀርባ አውድ በመተካት ሰዎችን ያማከለ መረጃን በቋሚነት በመያዝ ሊረዳ ይችላል። እንደነዚህ ያሉ ሙከራዎች ማስረጃዎቹ ክልሎች ለአምሳያው ውሳኔ አስፈላጊ መሆናቸውን ወይም ከእውነታው በኋላ የተፈጠሩ መሆናቸውን ለመወሰን ይረዳሉ. ምንጩ እነዚህን ሙከራዎች ሪፖርት አያደርግም፣ ስለዚህ የይገባኛል ጥያቄው የማረጋገጫ መጠን ያልታወቀ ነው።

በመጨረሻም, ተግባራዊ ገደቦች አልተዘጋጁም. በምንጩ ውስጥ ስለ መዘግየት፣ ዋጋ ማስላት፣ ፍቃድ መስጠት፣ ስለማሰማራት ተገኝነት፣ የግላዊነት ጥበቃዎች ወይም በቀጥታ ስርአቶች ውስጥ ስለአጠቃቀም ምንም መረጃ የለም። ደራሲዎቹ በክፍት ምንጭ 7B-መመዘኛ መሰረት ላይ ውጤቶችን ሪፖርት አድርገዋል፣ነገር ግን ምንጩ AffectOmni ከትላልቅ ሞዴሎች ጋር መወዳደር ወይም ከሶስቱ ከተሰየሙት መመዘኛዎች ውጭ ጠንካራ መሆን አለመሆኑን አያሳይም። እነዚያ ጥያቄዎች መልስ እስኪያገኙ ድረስ ሥራው በተሻለ ሁኔታ የተረዳው እንደ የምርምር ፕሮፖዛል ተስፋ ሰጪ ሪፖርት ውጤቶች እንጂ የሰዎችን ስሜት ለመተርጎም እንደ ትክክለኛ መፍትሄ አይደለም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ምንድን ነው?AI ሞዴሎች ተብራርተዋልትራንስፎርመሮችየAI ሥነ ምግባርየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?