ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

ቤንችማርክ የእይታ-ቋንቋ ሞዴሎች አሻሚ ኢላማዎችን በውይይት ለመለየት ሲታገሉ አገኘ

አዲስ ቤንችማርክ እንደዘገበው ትልልቅ የእይታ-ቋንቋ ሞዴሎች ምስላዊ ኢላማዎችን ባልተሟሉ መግለጫዎች እና መስተጋብር መለየት ሲገባቸው ከሰው መነሻ መስመር በታች በጥሩ ሁኔታ ይሰራሉ።

5 min readRead the primary source
Primary-source image accompanying Benchmark finds vision-language models struggle to identify ambiguous targets through dialogue
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.23978
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ቤንችማርክ
የሞዴል አፈጻጸምን ለመለካት እና ለማነፃፀር የሚያገለግል ደረጃውን የጠበቀ ሙከራ ወይም የውሂብ ስብስብ።
መለካት
የአንድ ሞዴል በራስ መተማመን ውጤቶች ከትክክለኛ ትክክለኛነት እድሎች ጋር ምን ያህል እንደሚዛመዱ።
ማብራሪያ
የማሽን መማሪያ ሞዴሎችን ለማሰልጠን ወይም ለመገምገም የሚያገለግሉ በሰው የተጨመሩ መለያዎች ወይም ሜታዳታ።
እራስህን ፈትን።AI ሞዴሎች የተብራሩ ጥያቄዎች

ምን ተፈጠረ

አዲስ የ arXiv ቅድመ-ህትመት በትላልቅ የእይታ-ቋንቋ ሞዴሎች ውስጥ መስተጋብራዊ ምስላዊ መሬትን ለመሞከር ቁጥጥር የሚደረግበት ማዕቀፍ ያስተዋውቃል። ጥናቱ ስለ ምስላዊ ዒላማ መጀመሪያ ምን ያህል መረጃ እንደሚሰጥ እና ምን ያህል በውይይት መሰብሰብ እንዳለበት ይለያያል። በአራቱ በሰው ላይ የተመሰረቱ ምስላዊ አውዶች እና አራት የመስተጋብር ፕሮቶኮሎች፣ ደራሲዎቹ እንደዘገቡት አሁን ያሉ ሞዴሎች ከተግባር ደረጃ ከሰዎች መነሻ በታች ጉልህ በሆነ መልኩ እንደሚሰሩ ገልጸዋል።

ወረቀቱ የማመላከቻ አገላለጽን ወደ ምስላዊ ዒላማ የማገናኘት ተግባር አድርጎ የሚገልጸውን የእይታ መሬትን ይመለከታል። ደራሲዎቹ የጋራ ግምገማዎች ብዙውን ጊዜ አንድ-ምት ናቸው ብለው ይከራከራሉ፡ አንድ ሞዴል መረጃ ሰጭ መግለጫ ይቀበላል እና ወደታሰበው ዕቃ ያሰራዋል። የእነሱ ማዕቀፍ ይልቁንስ ማጣቀሻን እንደ መስተጋብራዊ ሂደት ይወስዳሉ ይህም የመጀመሪያው መረጃ ያልተሟላ ወይም ግልጽ ያልሆነ እና ኢላማው በውይይት ሊመሰረት ይችላል.

ግምገማው ሁለት ማዕከላዊ ሁኔታዎችን ይለያያል፡ በጅምር ላይ ምን ያህል የታለመ መረጃ እንደሚቀርብ እና ምን ያህል በመስተጋብር ማግኘት እንዳለበት። ምንጩ ማዕቀፉ በሰው ላይ የተመሰረቱ አራት ምስላዊ አውዶችን እና አራት የመስተጋብር ፕሮቶኮሎችን ይሸፍናል ብሏል። እዚህ በቀረበው የarXiv ገፅ ጽሑፍ ውስጥ እነዛን አውድ ወይም ፕሮቶኮሎች አይለይም፣ ስለዚህ የፈተና መቼቶች ስፋት እና እውነታ ከዚህ ምንጭ ብቻ ሊገመገም አይችልም።

በተፈተኑት ቅንብሮች ውስጥ፣ ደራሲዎቹ አሁን ያሉ ትልልቅ የእይታ-ቋንቋ ሞዴሎች ከተግባር ደረጃ ከሰዎች መነሻ በታች ጉልህ በሆነ መልኩ እንደሚሰሩ ዘግበዋል። ማጠቃለያው መሰረታዊ ነጥቦችን፣ የተገመገሙትን ሞዴሎች ብዛት ወይም ማንነት፣ የሰው ንፅፅር ቡድን መጠን፣ ወይም ያንን ክፍተት ለመመስረት ጥቅም ላይ የሚውሉ ስታትስቲካዊ ሂደቶችን አያቀርብም። ስለዚህ ውጤቱ እንደ ወረቀቱ ሪፖርት ግኝት መነበብ አለበት እንጂ እንደ ኢንደስትሪ-ሰፊ መለኪያ መሆን የለበትም።

የተዘገበው ንድፍ ወጥ በሆነ መልኩ አሉታዊ አይደለም። የክትትል ጥያቄዎች የመጀመሪያ ኢላማ መግለጫን ሲያሻሽሉ ወይም ሲጠግኑ መስተጋብር ሊረዳ ይችላል። ነገር ግን፣ ምንም የመጀመሪያ መግለጫ ካልቀረበ እና ሞዴሉ ጥያቄዎችን በመጠየቅ የታለመ መረጃ ማግኘት ሲኖርበት አፈፃፀሙ ዝቅተኛ ነው። ደራሲዎቹ ይህንን በንቃት፣ በጥያቄ ላይ የተመሰረተ መሰረት ማድረግ እንደ ችግር ይገልፁታል። ተከታይ ጥናቶች በሰው እና በ AI የመነጩ ገለጻዎች፣ የተለያዩ የማመዛዘን ጥረቶች፣ ተደጋጋሚ መስተጋብሮች፣ መግለጫ ሰጪዎች እና የእይታ አውዶች ተመሳሳይ ንድፎችን አግኝተዋል፣ ነገር ግን ምንጩ እነዚያን ሁኔታዎች ለማነፃፀር የሚያስፈልጉትን ዝርዝሮች አልሰጠም።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

ግኝቶቹ ሙሉ መግለጫውን ከምስል ጋር ከማዛመድ ይልቅ አሻሚ ማመሳከሪያዎችን መፍታት ያለባቸው በመልቲሞዳል AI ስርዓቶች ውስጥ ተግባራዊ ድክመትን ይለያሉ። ሞዴሎቹ አንዳንድ ጊዜ ተከታይ ጥያቄዎች የመጀመሪያውን መግለጫ ሲያብራሩ ወይም ሲጠግኑ ይሻሻላሉ፣ ነገር ግን አንድን ሰው ዒላማ ማለት ምን ማለት እንደሆነ ለማወቅ በንቃት ጥያቄዎችን ሲጠይቁ በጣም መጥፎ ስራ ይሰራሉ። የተዘገበው ከልክ ያለፈ በራስ መተማመን ለተጠቃሚዎች እርግጠኛ አለመሆንን ለሚያስተላልፉ ስርዓቶችም ስጋት ይፈጥራል።

ስርዓቱ ምን ማግኘት እንዳለበት የተሟላ እና ትክክለኛ መግለጫ ሲቀበል ብዙ የእይታ AI ተግባራት ቀላል ናቸው። የወረቀቱ አስተዋጽዖ አንድ ሰው ግልጽ ያልሆነ ነገርን በሚጠቅስበት፣ የጋራ አውድ በሚወስድበት ወይም መረጃን በደረጃ በሚያቀርብበት አነስተኛ ሥርዓት ላይ ማተኮር ነው። በዚያ ቅንብር ውስጥ ስኬት ከእይታ ማዛመድ የበለጠ ነገርን ይፈልጋል፡ ስርዓቱ አሻሚነትን ማወቅ፣ ምን መረጃ እንደሚጎድል መወሰን፣ ጠቃሚ ጥያቄ መጠየቅ እና መልሱን ከሚያየው ጋር ማጣመር አለበት።

በአምሳያዎች እና በሰዎች የተግባር-ደረጃ መነሻ መስመሮች መካከል ያለው የተዘገበው ክፍተት አስፈላጊ ነው ምክንያቱም አንድ ስርዓት በተራ ንግግሮች ላይ እምነት የማይጣልበት ሆኖ ባለ አንድ-ምት ማሳያ ሊሆን ይችላል። አንድ ተጠቃሚ ሞዴል ሀረጎችን እንዲረዳ ሊጠብቅ ይችላል፣ ለምሳሌ በአንድ ትዕይንት ላይ ያለን ነገር ግልፅ ያልሆነ ማጣቀሻ፣ ነገር ግን መለኪያው እንደሚያሳየው ሞዴሉ የትኛው ነገር እንደታሰበ በንቃት መመስረት ሲኖርበት አፈፃፀሙ እንደሚበላሽ ያሳያል። ምንጩ እያንዳንዱ የተዘረጋ ስርዓት በተመሳሳይ መለኪያ ይህ ድክመት አለበት ብሎ አይናገርም፣ ነገር ግን መደበኛ የአንድ-ምት ሙከራዎች ሊያመልጡት የሚችሉትን የውድቀት ሁነታን ይለያል።

ወረቀቱ ደካማ ልኬትንም ዘግቧል፡ ሞዴሎች ብዙውን ጊዜ ከተጨባጭ ትክክለኛነት ማረጋገጫዎች የበለጠ በራስ መተማመንን ይገልጻሉ። ይህ በቀላሉ መልስ ከማግኘት የተለየ የአሠራር ችግር ይፈጥራል። የተሳሳተ ኢላማ ሲመርጥ ስርዓቱ በእርግጠኝነት የሚሰማ ከሆነ ተጠቃሚው ውጤቱን ለማረጋገጥ ያነሰ ምክንያት ሊኖረው ይችላል። ማጠቃለያው በራስ መተማመን እንዴት እንደተፈጠረ፣ መለኪያ እንዴት እንደተለካ፣ ወይም የትኛውም ሞዴል ወይም ፕሮቶኮል ከሌሎቹ በተሻለ ሁኔታ መከናወኑን አይገልጽም።

ሰፋ ያለ አንድምታ፣ በጸሐፊዎቹ ፍሬም ላይ የተመሰረተ፣ በይነተገናኝ ምስላዊ መሰረት ማድረግ እንደ ምስላዊ ተዛማጅ፣ መረጃ ፍለጋ እና ውህደት መገምገም አለበት። ያ የመልቲሞዳል ረዳቶች እና ምስሎችን ለመተርጎም ንግግርን ለሚጠቀሙ ሌሎች ስርዓቶች መሞከርን ማሳወቅ ይችላል። አሁንም፣ ምንጩ ምንም አይነት የማሰማራት ማስረጃ፣ የተጠቃሚ-ተፅዕኖ መለኪያዎች፣ የደህንነት ክስተቶች፣ ወይም ማመሳከሪያው በአንድ የተወሰነ የንግድ ወይም የህዝብ ሴክተር ትግበራ ላይ አፈጻጸምን እንደሚተነብይ የሚያሳይ ማስረጃ አያቀርብም።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

ቀጥሎ ምን እንደሚታይ

ወረቀቱ የarXiv ቅድመ-ህትመት ሲሆን ምንጩ የሞዴል ስሞችን፣ የናሙና መጠኖችን፣ የግምገማ መለኪያዎችን፣ የተግባር-ደረጃ ውጤቶችን፣ ወይም ስለ አራቱ ምስላዊ አውዶች እና የግንኙነት ፕሮቶኮሎች ዝርዝሮችን አይሰጥም። ተጨማሪ ማጣራት ማዕቀፉ በአጠቃላይ ሞዴሎች፣ ቋንቋዎች፣ የእይታ አካባቢዎች እና የገሃዱ ዓለም አጠቃቀም ጉዳዮችን እና የተሻለ የጥያቄ ምርጫ ወይም እርግጠኛ አለመሆን አፈጻጸምን እንደሚያሻሽል መገምገም አለበት።

የመጀመሪያው ጥያቄ እንደገና መወለድ ነው. ምንጩ ወረቀቱን እንደ arXiv:2608.23978 በነሀሴ 25, 2026 የገባው እና የስሪት-አንድ ቅድመ-ህትመት ብሎ ሰይሞታል። ስራው ከ EMNLP 2026 ዋና ዋና ጉዳዮች ጋር የተቆራኘ ነው ይላል ነገር ግን ተቀባይነትን ወይም በአቻ የተገመገመ ህትመቶችን አያረጋግጥም። አንባቢዎች ለተግባር ግንባታ፣ የማብራሪያ ሂደት፣ የሞዴል ዝርዝር፣ ጥያቄዎች፣ የውጤት አሰጣጥ ደንቦች እና ስታቲስቲካዊ ትንታኔዎች ሙሉውን ወረቀት መመርመር አለባቸው።

ሁለተኛው ጉዳይ ውጫዊ ትክክለኛነት ነው. አብስትራክቱ ዘይቤዎቹ በተለያዩ የመግለጫ ምንጮች፣ የማመዛዘን ጥረቶች፣ ተደጋጋሚ መስተጋብሮች፣ መግለጫ አቅራቢዎች እና ምስላዊ አውዶች ላይ እንደሚቀጥሉ ይናገራል፣ ነገር ግን እነዚያን በቀረበው ቁሳቁስ ውስጥ ያሉ ልዩነቶችን አይገልጽም። በማይታወቁ ምስሎች፣ በተዘበራረቁ አካባቢዎች፣ በተለያዩ ቋንቋዎች፣ የተደራሽነት ሁኔታዎች እና የቀጥታ የተጠቃሚ ውይይት ላይ የሚደረግ ክትትል የተዘገበው ድክመት ጠባብ ወይም አጠቃላይ መሆኑን ለማወቅ ይረዳል።

ለመከታተል ሶስተኛው ቦታ የጣልቃ ገብነት ንድፍ ነው. ወረቀቱ የሚያመለክተው የመከታተያ ጥያቄዎች የመጀመሪያ መግለጫን ሊያሻሽሉ ወይም ሊጠግኑ ይችላሉ፣ ነገር ግን ንቁ መጠይቅ አስቸጋሪ ሆኖ ይቆያል። ይህ ልዩነት ለወደፊት ሥራ ጠቃሚ ፈተናን ይጠቁማል፡ ሞዴሎች እርግጠኛ አለመሆንን አስቀድመው ለይተው ከመገመት ይልቅ የታለሙ ጥያቄዎችን መጠየቅ ይችሉ እንደሆነ። ምንጩ ያንን ባህሪ ለማሻሻል የተሳካ ዘዴን አይዘግብም፣ ስለዚህ የተለየ ማበረታቻ፣ ስልጠና ወይም የበይነገጽ ቴክኒክ ችግሩን ይፈታል የሚለው ማንኛውም ጥያቄ የተለየ ማስረጃ ያስፈልገዋል።

በመጨረሻም, የመለኪያ ልኬት ቀጣይ ትኩረት ሊሰጠው ይገባል. ግልጽ ጥያቄዎችን የሚጠይቅ ነገር ግን ከመጠን በላይ በራስ የመተማመን መንፈስ አሁንም ሊወገዱ የሚችሉ ስህተቶችን ሊፈጥር ይችላል። የወደፊት ውጤቶች ሁለቱንም የመሠረት ትክክለኛነት እና የመተማመንን ጥራት፣ በተደጋጋሚ መስተጋብር እና በተለያዩ የእይታ ሁኔታዎች ላይ አፈጻጸምን ጨምሮ ሪፖርት ማድረግ አለባቸው። እነዚህ ዝርዝሮች እስኪገኙ ድረስ፣ ወረቀቱ ስለ ወቅታዊው የኤልቪኤልኤም ግምገማ ግልጽ ጥንቃቄን ይደግፋል፣ ነገር ግን ትክክለኛ የስርዓቶች ደረጃ ወይም ለአንድ የተወሰነ ማሰማራት ዝግጁነት መደምደሚያ አይደለም።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

AI ሞዴሎች ተብራርተዋልChatGPT እና LLMsAI ወኪሎችየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?