ምን ተፈጠረ
የካርኔጊ ሜሎን፣ ኤምአይቲ እና ኮርኔል የምርምር ቡድን በነሀሴ 6 ላይ ሁለት የዘፈቀደ ጥናቶችን አውጥቷል አጫጭር AI ንግግሮች የሴራ እምነትን ይቃወማሉ እና ዋና ዋና ክስተቶች እውነታዎች አሁንም እየታዩ ነው።
ተመራማሪዎቹ በጁላይ 2024 ዶናልድ ትራምፕን ለመግደል ሙከራ ካደረጉ በኋላ የሴራ አስተያየቶችን የገለጹ 472 የአሜሪካ ጎልማሶችን እና በሴፕቴምበር 2025 የቻርሊ ኪርክ ግድያ በኋላ 1,035 ሰዎችን ተንትነዋል። ተሳታፊዎች በዘፈቀደ ለተስተካከለ የውይይት ንግግር፣ ያልተዛመደ AI ውይይት፣ ወይም የማይለዋወጥ ወቅታዊ እውነታዎች ዝርዝር ተመድበዋል።
የውይይት ቡድኖቹ ቢያንስ አምስት ልውውጦችን በGemini 1.5 Pro በመጀመሪያው ሙከራ እና Gemini 2.5 Pro በሁለተኛው ውስጥ አጠናቀዋል። ሁለቱም ሞዴሎች የተረጋገጠ መረጃን፣ የተሰረዙ የይገባኛል ጥያቄዎችን እና ያልተፈቱ ጥያቄዎችን የሚለያይ የተረጋገጠ የእውነታ መሰረት አግኝተዋል። ሁለተኛው ሞዴል ትክክለኛ መረጃን ለማረጋገጥ ብቻ ድሩን መፈለግ ይችላል።
በእያንዳንዱ ተሳታፊ የተገለጸው ፅንሰ-ሀሳብ ከ0 እስከ 100 ባለው የእምነት መለኪያ፣ የተጣጣሙ ንግግሮች በመጀመሪያው ሙከራ ውስጥ ከቻት ቁጥጥር አንፃር የ6.95 ነጥብ እና በሁለተኛው የ7.56 ነጥብ ቅናሽ አስገኝተዋል። ከስታቲካል መረጃ ሉህ ልዩነቶች 5.60 እና 6.56 ነጥብ ነበሩ። ወረቀቱ ለነዚያ ንጽጽሮች ከ 0.32 እስከ 0.38 የሚደርስ ደረጃውን የጠበቀ ተፅእኖዎችን ዘግቧል።
ሁለቱ የጉዳይ ጥናቶች የተነደፉት የእውነታው ዘገባ ገና እየዳበረ በነበረበት ወቅት ነው። የመጀመሪያው በጁላይ 2024 ዶናልድ ትራምፕን ለመግደል የተደረገውን ሙከራ ተከትሎ; ሁለተኛው በሴፕቴምበር 2025 የቻርሊ ኪርክን ግድያ ተከትሎ ነው። ተሳታፊዎች ለሴራ ወይም እርግጠኛ ላልሆኑ ትርጓሜዎች ተጣርተዋል፣ከዚያም የራሳቸውን የተገለጸ ንድፈ ሐሳብ፣ የማይዛመድ AI ውይይት፣ ወይም የማይንቀሳቀስ ወቅታዊ የእውነታ ወረቀት ለሚመለከት ውይይት ተመድበዋል። ሁለተኛው ጥናት አስቀድሞ ተመዝግቧል, የመጀመሪያው አልነበረም, ስለዚህ ማባዛቱ መረጃ ሰጭ ነው ነገር ግን ከሁለት ነጻ የማረጋገጫ ሙከራዎች ጋር እኩል አይደለም.
የምንጭ ዝርዝሮች: Costello and colleagues' research paper on arXiv ↗
ለምን አስፈላጊ ነው።
ውጤቱ እንደሚያመለክተው የውይይት ሥርዓት እርማትን ከመድገም የበለጠ ነገርን ሊያደርግ ይችላል፡- አንድ ሰው ለእምነቱ ከሚሰጠው የተለየ ምክንያት እውነታዎችን፣ ጥያቄዎችን እና እርግጠኛ አለመሆንን ማስተካከል ይችላል።
ይህ ልዩነት በፍጥነት በሚንቀሳቀሱ ክስተቶች ወቅት ጠቃሚ ነው፣ የተረጋገጡ ማስረጃዎች ያልተሟሉ ሲሆኑ እና አጠቃላይ የእውነታ ወረቀት አንድ ሰው አሳማኝ ሆኖ ያገኘውን የይገባኛል ጥያቄ ላይመለከት ይችላል። የወረቀቱ የስትራቴጂ ትንታኔ እንደሚያሳየው ሞዴሉ ይበልጥ ታማኝ በሆኑ ምንጮች ላይ፣ ክፍት ጥያቄዎች እና ብዙም በማይታወቅበት ጊዜ ጥንቃቄን እና ከዚያም ሁለተኛው ክስተት ትልቅ የመረጃ መዝገብ ሲኖረው የበለጠ ቀጥተኛ ማስረጃዎችን ተጠቅሟል።
ደራሲዎቹ በኋላ ላይ መፍሰስን በተመለከተ የተገደቡ ማስረጃዎችንም ሪፖርት አድርገዋል። ከመጀመሪያው ሙከራ ከሁለት ወራት በኋላ፣ ለንግግሩ የተመደቡ ተሳታፊዎች ለተከታዩ ክስተት ሁለት ሴራ ያላቸው ትርጓሜዎችን ለመደገፍ ከተቀናጁ ቁጥጥሮች ያነሱ ነበሩ። በሁለተኛው የክትትል ሂደት ውስጥ፣ ቀጥተኛ ህክምና ምደባ ስለ በኋላ መተኮስ እምነትን በከፍተኛ ሁኔታ አልቀነሰም ፣ ምንም እንኳን የተለየ አስቀድሞ የተመዘገበ የፅናት ትንተና እና ሰፋ ያለ የሴራ እርምጃ አነስተኛ ተሸካሚ ውጤቶችን ጠቁሟል።
ዲዛይኑ ማግባባት ሁል ጊዜ የሚፈለግ መሆኑን ሳያረጋግጥ ግንኙነቱ የማይለዋወጥ እርማት ለምን እንደሚበልጥ ያሳያል። Gemini 1.5 ፕሮ በመጀመሪያው ጥናት እና Gemini 2.5 Pro በሁለተኛው ጥናት የተረጋገጡ መረጃዎችን፣ የተጨፈጨፉ የይገባኛል ጥያቄዎችን እና ያልተፈቱ ጥያቄዎችን የሚለያዩ በተመራማሪዎች የተደገፉ እውነታዎችን ተቀብለዋል። ሞዴሉ ስለ ተሳታፊው የተለየ ምክንያት ሊጠይቅ እና በቀጥታ መልስ መስጠት፣ ታማኝ ማስረጃዎችን መጥቀስ ወይም እርግጠኛ አለመሆንን ሊመርጥ ይችላል። ያ መላመድ ለትምህርት ይጠቅማል፣ ነገር ግን ለስርአቱ የየትኞቹን የይገባኛል ጥያቄዎች እንደሚቃወሙ እና የትኞቹን ምንጮች አስቀድሞ እንደሚወስኑ ይወስናል።
ጥናቱ አሳማኝ ቦቶችን ወደ ህዝባዊ ንግግሮች በቀጥታ ማሰማራቱን አያጸድቅም። እምነትን ለመለወጥ የታዘዘ ሥርዓት ያልተለመደ ኃይል አለው፣ እና ደራሲዎቹ ተመሳሳይ ቴክኒኮች በሐሰት የይገባኛል ጥያቄዎች ላይ እምነትን እንደሚያሳድጉ አስተውለዋል። ማንኛውም እውነተኛ አገልግሎት ግልጽ ደራሲነት፣ አስተማማኝ ክስተት መሰረት ማድረግ፣ ከፖለቲካዊ ኢላማ ጥበቃዎች እና ነጻ የትክክለኛነት እና ያልተጠበቁ ውጤቶች መፈተሽ ያስፈልገዋል።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
Impossibility results in algorithmic fairness (e.g. Kleinberg et al., Chouldechova) show what?
ቀጥሎ ምን እንደሚታይ
ለአቻ ግምገማ፣ ከሁለት የአሜሪካ የፖለቲካ ቀውሶች በላይ መድገምን እና ሰዎች ለጥናት ሳይቀጠሩ እንደዚህ አይነት መሳሪያ ለመጠቀም ይመርጡ እንደሆነ የሚያሳዩ የመስክ ማስረጃዎችን ይመልከቱ።
ይህ በሁለት የጉዳይ ጥናቶች ዙሪያ የተገነባ አዲስ ቅድመ-ህትመት ነው። የመጀመሪያው ሙከራ አስቀድሞ አልተመዘገበም፣ ሁለተኛው ነበር፣ እና ሁለቱም በራስ ሪፖርት የተደረጉ እምነቶችን ከአጭር የኦንላይን መስተጋብር በኋላ ወዲያውኑ ይለካሉ፣ ይልቁንም የእውነተኛው ዓለም መጋራት ባህሪ፣ ድምጽ መስጠት ወይም የረጅም ጊዜ እምነት።
የተተነተኑት ናሙናዎች ክፍት ምላሾቻቸው በ GPT-4o ሴራ ወይም እርግጠኛ ያልሆኑ ተብለው የተከፋፈሉ ተሳታፊዎችን ብቻ ያካተቱ ናቸው፣ ምንም እንኳን ደራሲዎቹ በተለዋጭ የምደባ ህጎች ተመሳሳይ ንድፎችን ቢዘግቡም። ሁለቱም ጥናቶች የዩኤስ ጎልማሶችን በCloudResearch በመመልመል ግኝቶቹ ወደ ሌሎች አገሮች፣ ቋንቋዎች፣ ዝግጅቶች ወይም ህዝቦች ላይተላለፉ ይችላሉ።
ሞዴሎቹ ባልታገዘ ዕውቀት ላይ የተመሰረቱ አልነበሩም፡ ተመራማሪዎች በጥንቃቄ የተሰበሰቡ የእውነታ መሠረቶችን እና ግልጽ የማሳመን መመሪያዎችን አቅርበዋል። ወደፊት የሚሠራው ሥራ በጊዜ ገደብ ጫና ውስጥ እነዛን እውነታዎች ማን እንደሚያቆየው፣ ስህተቶቹ እንዴት እንደሚስተካከሉ፣ ተቃራኒ አመለካከቶች በቋሚነት እንደሚስተናገዱ፣ እና አንድ ሥርዓት ለማሳመን ከመሞከር ይልቅ እርግጠኛ አለመሆንን መቼ መጠበቅ እንዳለበት መፈተሽ አለበት።
የተገለጸውን እምነት በመቀየር እና የሰውን ግንዛቤ በማሻሻል መካከል የመለኪያ ልዩነትም አለ። ውጤቶቹ ከአጭር ጊዜ የመስመር ላይ ውይይቶች በኋላ የተሰበሰቡ በራስ ሪፖርት የተደረጉ ደረጃዎች ናቸው፣ የመጋራት ባህሪ፣ የምንጭ መፈተሽ፣ ድምጽ መስጠት ወይም በቀጥታ ቀውስ ወቅት የተደረጉ ውሳኔዎች ያልተስተዋሉ ናቸው። የወረቀቱ ክትትሎች ስለ ጽናት ቀደምት ማስረጃዎችን ይሰጣሉ፣ነገር ግን የተቀላቀሉት ውጤቶች ማለት በኋላ የተደረገ ጥናት የረዥም ጊዜ ውጤቶችን አስቀድሞ መመዝገብ፣የማሳየት ችሎታን መከታተል እና ተሳታፊዎች የአምሳያው መደምደሚያን በቀላሉ ከመድገም ይልቅ ማስረጃውን ራሳቸው ማብራራት ይችሉ እንደሆነ መፈተሽ አለበት።
ማባዛት የእውነታውን ዘገባ ምንጭ እና የህዝብ ብዛት ሊለያይ ይገባል። እነዚህ ሙከራዎች የተመራማሪዎችን የየራሳቸውን የእውነታ መሰረት ያቀረቡ እና የዩኤስ ጎልማሶችን በCloudResearch በኩል ቀጥረዋል፣ ይህም ማዋቀሩን ባልተለመደ ሁኔታ ቁጥጥር እንዲያደርጉት ያደርገዋል፣ነገር ግን ስለ ብዙ ቋንቋ ክስተቶች፣ ዝቅተኛ የግንኙነት ቅንብሮች እና ይፋዊ መረጃ የሚዘገይባቸው ወይም የሚከራከሩባቸውን ቀውሶች በተመለከተ ክፍት ጥያቄዎችን ይተዋል። ኃላፊነት የሚሰማው የመስክ ሙከራ የአምሳያው ደራሲነት እንዲታይ ያደርጋል፣ ተሳታፊዎች ጣልቃ መግባቱን ውድቅ ያደርጋሉ፣ የትኛው ማስረጃ እንደታየ ይመዝገቡ፣ እና ውይይቱ አዲስ ሳያስተዋውቅ የተሳሳተ ግንዛቤ እንዳስተካከለ ለማረጋገጥ ገለልተኛ ዳኞችን ይጠቀሙ። እምነትን፣ ስሜታዊ ምላሽን እና የይገባኛል ጥያቄዎችን ከእምነት ውጤቶች ጋር ለማጋራት ፈቃደኛነትን መለካት አለበት።