ምን ተፈጠረ
MIT ቴክኖሎጂ ክለሳ በሰባት እንቆቅልሽ ዙሪያ የተገነባ በይነተገናኝ ባህሪ አሳትሟል ይህም የኤአይኢ ሞዴሎች እንዴት እንደሚያስቡ ይመረምራል። ጽሁፉ ሞዴሎች በአንዳንድ ስራዎች ላይ በፍጥነት መሻሻላቸውን ነገር ግን አሁንም ከቦታ አያያዝ፣ ከታወቁ ችግሮች ስውር ልዩነቶች፣ የእይታ ረቂቅነት እና ከጊዜ ወደ ጊዜ እየተባባሰ ባለ ባለብዙ እርከን አስተሳሰብ እየታገሉ መሆናቸውን ዘግቧል።
MIT ቴክኖሎጂ ሪቪው እንደዘገበው ባህሪው የቦታ አስተሳሰብን፣ የማስታወስ ችሎታን እና መላመድን፣ ረቂቅ እና ምስላዊ አስተሳሰብን፣ የሰው ልጅን ግንዛቤ እና ውስብስብነትን የሚሸፍኑ ሰባት ሙከራዎችን አቅርቧል። ጽሑፉ እንቆቅልሽ መፍታትን በረዥሙ የ AI ግምገማ ታሪክ ውስጥ ያስቀምጣል፣ እንደ ቼከር፣ ቼዝ እና ጎ ያሉ ጨዋታዎች ከሜዳው የመጀመሪያዎቹ ዓመታት ጀምሮ እንደ የሙከራ አልጋዎች ጥቅም ላይ ውለዋል ብሏል። የእንቆቅልሽ አፈጻጸም በከፍተኛ ሁኔታ መሻሻል አሳይቷል፡- የኮሎምቢያ ዩኒቨርሲቲ ቡድን እ.ኤ.አ. በ2024 መገባደጃ ላይ ዋነኞቹ ሞዴሎች የኒውዮርክ ታይምስ ግንኙነቶች እንቆቅልሾችን 18 በመቶውን ብቻ የፈቱ ሲሆን እ.ኤ.አ. በ2025 መጀመሪያ ላይ አንዳንድ ሞዴሎች ሁል ጊዜ ፍፁም በሆነ መልኩ ሊፈቱ ይችላሉ። ምንጩ ሞዴሎቹን አይለይም ወይም በባህሪው ውስጥ ባሉ ምሳሌዎች ላይ ደረጃውን የጠበቀ ንፅፅር አያቀርብም።
MIT ቴክኖሎጂ ሪቪው እንደሚለው የቦታ ማመዛዘን ዋነኛ ድክመት ነው። የአእምሮ-አዙሪት ክፍል አንባቢዎች ከሌላ አንግል የሚታየውን ባለ ሶስት አቅጣጫዊ ነገር እንዲለዩ ይጠይቃል እና ጽሑፉ የእይታ-ግቤት ችሎታ ያላቸው የቋንቋ ሞዴሎች አሁንም በእንደዚህ ያሉ ተግባራት ላይ በጣም ደካማ እንደሚሆኑ ዘግቧል። ባህሪው ይህንን ችግር የአለም ሞዴሎችን በማደግ ላይ ካሉት የ AI ስርዓቶች የይገባኛል ጥያቄዎች ጋር ያገናኛል፣ ይህም አሁን ያሉ ትልልቅ የቋንቋ ሞዴሎች የሰው ልጅ የቦታ ስፔሻሊስቶች ሊያደርጉት በሚችሉት መንገድ ባለ ሶስት አቅጣጫዊ ነገሮችን የሚቆጣጠሩ አይመስሉም በማለት ይከራከራሉ። ጽሁፉ የማስታወስ እና የመላመድ ችግርንም ይገልፃል፡ ብዙ መረጃ ላይ የሰለጠኑ ሞዴሎች የታወቀ የእንቆቅልሽ ንድፍ ሊያውቁ እና ትንሽ ለውጥን ሊዘነጉ ይችላሉ። ለዚህ ስጋት እንደ ማስረጃ የ2024 Google እና የኢሊኖይ ዩኒቨርሲቲ ኡርባና-ቻምፓኝ ጥናት የ Knights እና Knaves እንቆቅልሾችን ልዩነት ይጠቅሳል።
ባህሪው ከዚያም ወደ ባለሁለት አቅጣጫዊ ረቂቅ እና ምስላዊ ምክንያት ይለወጣል. MIT ቴክኖሎጂ ሪቪው እንደዘገበው ሞዴሎች በኤአርሲ-ኤጂአይ እንቆቅልሾች ላይ ግሪዶች እንደ ቁጥራዊ ሕብረቁምፊዎች ሲቀርቡ እንደ ምስሎች ሳይሆን የሕዋስ ቀለሞችን በኮድ ይሳሉ። በተጨማሪም ሞዴሎች አንዳንድ ጊዜ ውስብስብ እና አጠቃላይ ባልሆኑ ህጎች ትክክለኛውን መልስ ሊያገኙ እንደሚችሉ በምርምር ደርሰውበታል፣ ነገር ግን ሰዎች በቀላል የእይታ ፅንሰ-ሀሳቦች ሊመኩ ይችላሉ። ጽሁፉ የSimpleBench ጥያቄዎችን፣ Knights እና Knaves ችግሮችን እና የ ARC-AGI ለውጥ እንቆቅልሽ እነዚህን ልዩነቶች ሊያጋልጡ የሚችሉ ተግባራትን እንደ ምሳሌ ያቀርባል።
ሰዎች ብዙ ጊዜ ፈጣን ነገር ግን የተሳሳቱ መልሶች የሚሰጡባቸውን የግንዛቤ ፈተናዎችን ለብቻው ይገልጻል፣ ሞዴሎች ግን ሆን ብለው ምላሽ ሊሰጡ ይችላሉ። አንድ ምሳሌ ዋሻ የሌሊት ወፍ ቁጥራቸው በየቀኑ በእጥፍ ሲጨምር ግማሽ ለመሙላት ምን ያህል ጊዜ እንደሚወስድ ይጠይቃል። ሌላ አንባቢዎች ከአሊስ ጋር የተያያዘ ጥቅስ እንዲለዩ ይጠይቃል።
በመጨረሻም፣ MIT ቴክኖሎጂ ሪቪው እንደዘገበው ችግሮች ይበልጥ እየተወሳሰቡ ሲሄዱ አፈፃፀሙ እየተበላሸ ይሄዳል። It cites an Apple study finding that language models could solve simple versions of Tower of Hanoi and river-crossing problems but began to falter when the number of disks or people reached six or more. በተጨማሪም በዋሽንግተን ዩኒቨርሲቲ፣ በስታንፎርድ ዩኒቨርሲቲ እና በአለን ኢንስቲትዩት ተመራማሪዎች በሎጂክ-ግሪድ እንቆቅልሾች ተመሳሳይ ችግሮች ሲያጋጥሟቸው የሰሩትን ስራ ጠቅሷል። ባህሪው አስተያየት ሰጪዎች እነዚህ ውጤቶች ለየት ያለ ማሽን መሰል የማመዛዘን ውስንነት ያሳያሉ ወይስ ሰዎች ውስብስብነት እየጨመረ በሄደ መጠን ብዙ ስህተቶችን እንደሚያደርጉ ጥያቄ እንደጠየቁ ይጠቅሳል። የወንዝ ማቋረጫ እና የአመክንዮ-ፍርግርግ ምሳሌዎች አንድ ሞዴል መልስ መስጠት ይችል እንደሆነ ብቻ ሳይሆን በበርካታ ተያያዥ ተቀናሾች ላይ ገደቦችን ማቆየት ይችል እንደሆነ ይሞክራሉ።
የምንጭ ዝርዝሮች: technologyreview.com ↗
ለምን አስፈላጊ ነው።
ባህሪው ስለ AI መረጃ ሰፋ ያለ የይገባኛል ጥያቄዎች ለምን አሳሳች ሊሆኑ እንደሚችሉ ያሳያል። አንድ ሞዴል ትንሽ የቃላት ለውጥ፣ የእይታ ለውጥ ወይም ብዙ ጥገኛ እርምጃዎችን የሚፈልግ ችግር ሲያቅተው በትሪቪያ ወይም በሚታወቅ ቤንችማርክ ላይ ጥሩ ውጤት ሊኖረው ይችላል። ስርዓቶች ከማሳያ ይልቅ ለውሳኔ ሲውሉ እነዚያ ልዩነቶች አስፈላጊ ናቸው።
ማዕከላዊው ትምህርት በአንድ የፈተና ክፍል ላይ አፈፃፀም እንደ አጠቃላይ የማሰብ ችሎታ መለኪያ ተደርጎ መታየት የለበትም። የ MIT ቴክኖሎጂ ክለሳ ምሳሌዎች ላዩን ቀላል የሚመስሉ ነገር ግን የተለያዩ ችሎታዎችን የሚጠይቁ ተግባራትን ያከናውናሉ፡ አንድን ነገር በአእምሮ ማሽከርከር፣ እውነትን እና ሀሰትን በአረፍተ ነገሮች ላይ መከታተል፣ ምስላዊ ህግን ማገናዘብ፣ አሳሳች ሀሳብን መቃወም ወይም በእገዳዎች ስር ቅደም ተከተል ማቀድ። ስርዓት በአንድ አካባቢ ከወትሮው በተለየ መልኩ ጠንካራ ሲሆን በሌላኛው ደግሞ የማይታመን ሊሆን ይችላል። ተጠቃሚው አቀላጥፎ መልስ ሲተረጉሙ ሞዴል ዋናውን ችግር መረዳቱን እንደ ማስረጃ ሲተረጉሙ ያ አለመመጣጠን ተገቢ ነው።
ጽሑፉ የግምገማ ችግርንም ያጎላል፡ የአንድ ተግባር ቅርጸት በውጤቱ ላይ በቁሳዊ መልኩ ሊጎዳ ይችላል። MIT ቴክኖሎጂ ሪቪው እንደዘገበው የARC-AGI አፈጻጸም የእይታ ፍርግርግ ወደ የቁጥር ውክልና ሲቀየር። ይህ የሚያሳየው ነጥብ የአምሳያው የማመዛዘን ችሎታን ብቻ ሳይሆን የችግሩን ኮድ የሚገለጽበት እና የሚቀርብበትን መንገድ ሊያንፀባርቅ ይችላል። ተመሳሳይ ስጋት ለታወቁ እንቆቅልሾችም ይሠራል። አንድ ሞዴል በስልጠና ወቅት የቅርብ ልዩነት ካጋጠመው፣ ትክክለኛው መልስ ደንቡን ከአዲስ ጉዳይ ጋር የማላመድ ችሎታን ሳይሆን ስርዓተ-ጥለት ማወቂያን ወይም ሰርስሮ ማውጣትን ሊያንፀባርቅ ይችላል። ሁለቱም ዘዴዎች በተዘረጉ ስርዓቶች ውስጥ ምን ያህል በተደጋጋሚ እንደሚከሰቱ ምንጩ አልገለጸም።
እነዚህ ገደቦች AIን በትምህርት፣ በሶፍትዌር፣ በምርምር፣ በአስተዳደር ወይም ሌሎች ያልተለመዱ ጉዳዮችን በሚያካትቱ ማንኛውም ሰው ላይ ተግባራዊ አንድምታ አላቸው። በተለመዱ ምሳሌዎች ላይ የተሳካ ሞዴል አሁንም የቃላት አወጣጥ ሲቀየር ሊወድቅ ይችላል፣ ብዙ ገደቦች ሲገናኙ ወይም ተዛማጅነት ያለው መረጃ ከጽሑፋዊ ይልቅ ምስላዊ ነው። The feature does not report a new product launch, a new model release, or a controlled assessment of a specific commercial system. እሴቱ ገላጭ ነው፡ ለምን ቤንችማርክ ግኝቶች እና የሰለጠነ ቋንቋ በራሳቸው ጠንካራ ምክንያት እንደማይመሰርቱ ለአንባቢዎች ተጨባጭ መንገዶችን ይሰጣል። ጽሑፉ አንድ አስፈላጊ መመዘኛም ይጠብቃል፡- ሰዎች የራሳቸው አድሎአዊ አመለካከት አላቸው እና በአንዳንድ ችግሮች ላይ ቀርፋፋ ወይም ያነሰ አስተማማኝ ሊሆኑ ይችላሉ።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
Which component of an AI application is the machine-learning model itself?
ቀጥሎ ምን እንደሚታይ
ወደፊት የሚደረጉ ግምገማዎች ከርዕስ ዜና ውጤቶች በላይ መሞከር ያስፈልጋቸዋል። ዋናዎቹ ጥያቄዎች ሞዴሎች ወደ ላልተለመዱ ችግሮች ማጠቃለያ ይችሉ እንደሆነ፣ ምላሻቸው በመረጃ ውክልና ላይ የተመሰረተ እንደሆነ፣ ውስብስብነት እየጨመረ በሄደ ቁጥር አፈፃፀሙ እንዴት እንደሚቀየር፣ እና ስኬት እንደገና ጥቅም ላይ ሊውል የሚችል ስትራቴጂን ወይም በቃል የያዙ ቅጦችን ያንፀባርቃል የሚለውን ያካትታሉ።
የሚቀጥለው ጠቃሚ ልማት በአምሳያዎች እና በተግባር ቅርፀቶች ላይ ሰፋ ያለ ፣ ሊባዛ የሚችል ሙከራ ነው። የ MIT ቴክኖሎጂ ክለሳ ባህሪ ሁሉንም ሰባት ፈተናዎች የሚሸፍን አንድ የውጤት ካርድ አይሰጥም እንዲሁም ምንጩ የሞዴል ስሞችን፣ ስሪቶችን፣ የናሙና መጠኖችን፣ የአስቀያሚ ሁኔታዎችን ወይም የስህተት መጠኖችን ለአብዛኛዎቹ ምሳሌዎች አይገልጽም። እነዚያ ዝርዝሮች ሪፖርት የተደረጉት ድክመቶች በስፋት፣በተለይ ሞዴል ቤተሰቦች ላይ ያተኮሩ ወይም ፈተናዎቹ እንዴት እንደሚሰጡ ለማወቅ ስሜታዊ መሆናቸውን ለማወቅ ያስፈልጋሉ።
ገለልተኛ ምዘናዎች የእይታ-አመለካከት ውድቀቶችን ከምክንያታዊ ውድቀቶች መለየት አለባቸው ከስር ያለውን እንቆቅልሽ በማቆየት ውክልናውን እየለዋወጡ። ተመራማሪዎች እና ገምጋሚዎች ሞዴሎቹ የሚሻሻሉትን በእውነተኛ አጠቃላይነት ወይም ለቤንችማርክ መሰል ነገሮች በመጋለጥ እንደሆነ መመልከት አለባቸው። የጽሁፉ ውይይት የግንኙነት እንቆቅልሾች እና የ Knights and Knaves ልዩነቶች ለምን ብክለት እና መተዋወቅ አስፈላጊ እንደሆኑ ያሳያል። በታተሙ ወይም በቅርበት ተዛማጅ ጥያቄዎች ላይ ጥሩ አፈጻጸም ያለው ሞዴል ተመሳሳይ መሰረታዊ መዋቅር ባላቸው አዲስ በተፈጠሩ ችግሮች ላይ እኩል ላይሆን ይችላል። ስለዚህ ሙከራው የተያዙ እንቆቅልሾችን፣ የተቀየሩ የቃላት አወጣጥን፣ የማይታወቁ የእይታ አቀማመጦችን እና አሳማኝ መልስ ትክክል ነው ብለው ሳያስቡ መካከለኛ ገደቦችን ማብራራት ወይም መፈተሽ የሚሹ ተግባራትን ማካተት አለበት።
ውስብስብነት እና የገሃዱ ዓለም ማስተላለፍ ክፍት ጥያቄዎች ሆነው ይቆያሉ። MIT ቴክኖሎጂ ሪቪው እንደዘገበው የንጥረ ነገሮች ብዛት ወይም አስፈላጊ እርምጃዎች ሲጨመሩ አፈፃፀሙ ሊበላሽ ይችላል ነገር ግን ምንጩ እነዚያ ግኝቶች በመሳሪያዎች ፣ መልሶ ማግኛ ፣ ውጫዊ ማህደረ ትውስታ ወይም በሰው ቁጥጥር ወደ ተግባራዊ ስርዓቶች እንዴት እንደሚተረጎሙ አላስቀመጠም። የወደፊት ሪፖርት ማድረግ እንደዚህ አይነት ተጨማሪዎች አስተማማኝነትን እንደሚያሻሽሉ፣ ሞዴሎችን በብቃት እንዲፈልጉ ማገዝ ወይም አዲስ የውድቀት ሁነታዎችን ማስተዋወቁን መከታተል አለበት። አንባቢዎችም የስትራቴጂውን ጥራት የሚለኩ ግምገማዎች የመጨረሻውን መልስ ብቻ ሳይሆን ሊከታተሉት ይገባል ምክንያቱም በተሰባበረ ወይም አጠቃላይ ሊደረግ በማይችል ደንብ የተገኘ ትክክለኛ ውጤት ከችግሩ ትንሽ ለውጥ ሊተርፍ አይችልምና።