ምን ተፈጠረ
ተመራማሪዎች FaithSieve (FaithSive) አስተዋውቀዋል፣ በትላልቅ የቋንቋ ሞዴሎች የተዘጋጁ የተፈጥሮ ቋንቋ የሂሳብ ማረጋገጫዎችን ለመገምገም። ሰፋ ያለ የማረጋገጫ እርምጃዎችን ወደ አካባቢያዊ የማመዛዘን ክፍሎች ይከፋፍላል፣ የተተየቡ የማስረጃ ግዴታዎችን ያወጣል እና የትርጓሜ-አሰላለፍ ውጤት መደበኛ መግለጫው ዋናውን የይገባኛል ጥያቄ አውድ፣ እቃዎች እና አመክንዮአዊ ቅርፅ እንደሚጠብቅ በሚያሳይበት ጊዜ ሊን ላይ የተመሰረቱ መደበኛ ፍተሻዎችን ይጠቀማል። በሁለት ኤክስፐርት በተረጋገጡ የውሂብ ስብስቦች ላይ ደራሲዎቹ FaithSieve ትክክለኛውን የመጀመሪያ ስህተት ትርጉሙን በቀጥተኛ ዳኝነት መነሻ ላይ እንዳሻሻሉ ሪፖርት አድርገዋል።
በነሀሴ 26 ለarXiv የቀረበው ቅድመ ህትመት FaithSieveን ለአንድ የተወሰነ የግምገማ ችግር ምላሽ ይሰጣል፡ ትላልቅ የቋንቋ ሞዴሎች ረጅም ባለ ብዙ ደረጃ የሂሳብ ማረጋገጫዎችን ሊያመነጩ ይችላሉ፣ነገር ግን ገምጋሚዎች አመክንዮው ትክክል ያልሆነበትን የመጀመሪያ ነጥብ ለመለየት ይቸገራሉ። ደራሲዎቹ አሁን ያሉት አቀራረቦች በአምሳያ ላይ በተመሰረቱ የተፈጥሮ-ቋንቋ ፍርዶች ላይ እንደሚመሰረቱ ይከራከራሉ, ይህም ሰፊ ምቹ ግምገማን በሚሰጡበት ጊዜም እንኳ የአካባቢ ክፍተቶችን ሊያመልጥ ይችላል. ስለዚህ የተጠቀሰው አላማ ሙሉውን ማስረጃ ትክክል ወይም ስህተት ነው ብሎ ከመፍረድ የበለጠ ጠባብ ነው፡ የመነሻ ውድቀት ያለበትን ቦታ በማስረጃው ውስጥ በይበልጥ እንዲታይ ማድረግ ነው።
FaithSieve ግምታዊ የማረጋገጫ ደረጃዎችን ወደ ትናንሽ የማመዛዘን ክፍሎች ይሰብራል እና እነዚያን ክፍሎች ወደ የተተየቡ የማስረጃ ግዴታዎች ይቀይራቸዋል። ከዚያም የተፈጠሩትን ግዴታዎች ለማረጋገጥ መደበኛ የግምገማ ወኪል ከሊን ጋር ይጠቀማል፣ ቲዎረምን የሚያረጋግጥ ስርዓት። ማዕቀፉ የተሳካ የሊን ቼክ በራሱ በቂ አድርጎ አይመለከተውም። በምትኩ፣ መደበኛ ማረጋገጫው ዋናውን የማረጋገጫ አውድ፣ የሒሳብ ዕቃዎች እና አመክንዮአዊ ቅፅን እንደያዘ ለመወሰን በታሰበ የትርጉም-አሰላለፍ ነጥብ ነው። ያ ትዕዛዝ መደበኛ ግዴታን በመፈተሽ እና ግዴታው መደበኛ ያልሆነውን ክፍል በቂ ውክልና መሆኑን በመወሰን መካከል ያለውን ልዩነት ይጠብቃል።
ደራሲዎቹ በሁለት ኤክስፐርት በተረጋገጡ የውሂብ ስብስቦች ላይ ውጤቶችን ሪፖርት አድርገዋል፡- ፕሮፍሎክ-ኦሊምፒያድ 350 ችግሮችን ይዟል፣ ፕሮፍሎክ-ዩኒቨርስቲ ደግሞ 6 የላቁ ጎራዎችን የሚሸፍኑ 200 ችግሮች አሉት። በGPT-5.4 የጀርባ አጥንት፣ FaithSieve በኦሎምፒያድ ስብስብ ላይ የመጀመሪያውን ስህተት በማግኘቱ ረገድ 81.43% ትክክለኛ ትክክለኛነትን አግኝቷል፣ ከ72.29% ጋር ቀጥተኛ ዳኝነትን አሳይቷል። በዩኒቨርሲቲው ቤንችማርክ ላይ 84.5% ደርሷል, ከ 75.0% ጋር ሲነፃፀር ለቀጥታ ዳኛ. እነዚህ የቅድመ ህትመቱ የይገባኛል ጥያቄዎች እንጂ ራሳቸውን የቻሉ ውጤቶች አይደሉም። ንፅፅሩ እያንዳንዱ መሰረታዊ ማስረጃ ወይም መደበኛ አሰራር ትክክል ለመሆኑ ከማስረጃነት ይልቅ የአካባቢያዊነት ግምገማ ሆኖ ቀርቧል።
ለምን አስፈላጊ ነው።
ስራው የ AI አስተሳሰብን በመገምገም ላይ ያለውን ተግባራዊ ድክመትን ይመለከታል፡- ማስረጃው ቀደምት የአካባቢ ስህተት ሲይዝ አሳማኝ ሊመስል ይችላል፣ እና መደበኛ prover አንዳንድ ጊዜ ዋናውን መከራከሪያ በታማኝነት የማይወክል መግለጫን ማረጋገጥ ይችላል። ይበልጥ ትክክለኛ የሆነ ገምጋሚ ተመራማሪዎች፣ አስተማሪዎች እና ገንቢዎች በአንድ አጠቃላይ ትክክለኛነት ላይ ብቻ ከመተማመን ይልቅ የሂሳብ ማመዛዘን የት እንደወደቀ እንዲያውቁ ሊረዳቸው ይችላል። የተዘገበው ውጤቶቹ ተስፋ ሰጪ ናቸው ነገር ግን አዲስ ከተለጠፈ ቅድመ ህትመት የመጡ ናቸው እና በሁሉም የሂሳብ አጻጻፍ ወይም በተሰማሩ AI ስርዓቶች ላይ አፈጻጸምን አያሳዩም።
ማዕከላዊ ጠቀሜታ ዘዴያዊ ነው. አንድ ሙሉ ማስረጃ መደበኛ መሆን አለመሆኑን ማረጋገጥ እያንዳንዱ መደበኛ ያልሆነ እርምጃ ትክክል መሆኑን ከመወሰን ጋር አንድ አይነት አይደለም። አንድ መደበኛ ማረጋገጫ ከመጠን በላይ ሰፊ ኢላማን ሊያረጋግጥ ይችላል፣ ወይም በራስ-የተደራጀ መግለጫ ዋናው ማረጋገጫ ከተጠየቀው ሊርቅ ይችላል። የFaithSieve የአካባቢ መበስበስ እና የትርጉም ጋቲንግ ጥምረት እነዚያን ሁለቱን የውድቀት ሁነታዎች ለመቀነስ የተቀየሰ ነው። የታሰበው ጥቅም በማረጋገጫ ጽሑፍ እና እሱን ለመገምገም በሚጠቀሙት መደበኛ ቼኮች መካከል የበለጠ ጥንቃቄ የተሞላ ግንኙነት ነው።
ለሒሳብ AI ስርዓቶች ገንቢዎች፣ የመጀመሪያ ስህተት ትርጉሙ ከአንድ ማለፊያ ወይም ውድቀት ነጥብ የበለጠ ተግባራዊ ይሆናል። ክርክር መጀመሪያ የት እንደሚሰበር ማወቅ የታለመ ዳግም ማሰልጠንን፣ የተሻለ ማረም እና የበለጠ መረጃ ሰጭ ንፅፅርን በሞዴሎች መካከል ሊደግፍ ይችላል። እንዲሁም ግምገማዎችን ለኦዲት ቀላል ሊያደርግ ይችላል። ይህ የግለሰቦችን አለመግባባቶች ለመመርመር ቀላል ያደርገዋል ፣ ይህም ስለ ሙሉ ማስረጃው ሰፋ ያለ ፍርድን ይተዋል ።
በቀጥታ ዳኝነት ላይ የተዘገበው ክፍተት በነዚህ ፈተናዎች ውስጥ በተግባር ሊገለጽ የሚችል ትልቅ ነው፡ በኦሎምፒያድ ቤንችማርክ 9.14 በመቶ እና በዩኒቨርሲቲ ቤንችማርክ 9.5 ነጥብ። አሁንም ቢሆን, ማስረጃው በወረቀቱ በራሱ ሙከራዎች ብቻ የተገደበ ነው. ምንጩ የማብራሪያ ጥራትን፣ ስታቲስቲካዊ እርግጠኛ አለመሆንን፣ የውድቀት ጉዳዮችን፣ የስራ ጊዜን፣ ወጪን፣ ለ GPT-5.4 የጀርባ አጥንት ትብነት ወይም በሰው የሂሳብ ሊቃውንት ላይ ያለውን አፈጻጸም ለመገምገም በቂ መረጃ አይሰጥም። እነዚያ ግድፈቶች ጠቃሚ ናቸው ምክንያቱም የቁጥር ውጤቶቹ እንዴት እንደሚተረጎሙ እና ሌሎች እንዴት ንፅፅሩን በቀላሉ ሊደግሙት እንደሚችሉ ላይ ተጽዕኖ ስለሚያደርጉ።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
Which component of an AI application is the machine-learning model itself?
ቀጥሎ ምን እንደሚታይ
ዋናዎቹ ጥያቄዎች FaithSieve ከሁለቱ መመዘኛዎች በላይ ጠቅለል ያለ ነው ወይ፣ የትርጉም-አሰላለፍ በሩ ምን ያህል ጊዜ አሳሳች ፎርማላይዜሽን እንደማይቀበል እና የግምገማው ሂደት ምን ያህል የሰው እውቀት ወይም ስሌት እንደሚፈልግ ናቸው። ተጨማሪ ማጣራት የቤንችማርክ ግንባታ፣ የስህተት ምድቦች፣ የሞዴል እና የዳኛ መቼቶች እና ከሌሎች የማረጋገጫ ማረጋገጫ ዘዴዎች ጋር ማነፃፀርን መመርመር አለበት። ምንጩ FaithSieve መደበኛ ያልሆኑ ክርክሮችን እንደሚያረጋግጥ፣ የሒሳብ ሊቃውንትን እንደሚተካ ወይም ሁሉንም ዓይነት ቅዠቶች እንደሚከለክል አላረጋገጠም።
ለክትትል የመጀመሪያው ጉዳይ አጠቃላይ ነው. መመዘኛዎቹ በባለሙያ የተረጋገጠ እና የኦሎምፒያድ ችግሮችን እና ስድስት የላቁ የዩኒቨርሲቲ ደረጃ ጎራዎችን ይሸፍናሉ፣ ነገር ግን ምንጩ የሙሉ ጎራ ድብልቅን፣ የቋንቋ ዘይቤዎችን፣ የማስረጃ ቅርጸቶችን ወይም የስህተት ስርጭትን አይለይም። ውጤቶቹ ባነሰ የተዋቀሩ ማስረጃዎች፣ የተለያዩ የሂሳብ መስኮች፣ ደካማ ወይም ጠንካራ ሞዴሎች፣ ወይም በመደበኛው ስርአት ውስጥ በቀላሉ የማይወከሉ ትርጓሜዎች ላይ ለሚመሠረቱ ክርክሮች ሊለወጡ ይችላሉ። ያለው መግለጫ ስለዚህ የቤንችማርክ ውጤትን ይደግፋል, ነገር ግን በሁሉም መቼት ውስጥ ተመሳሳይ ባህሪ ይኖረዋል የሚለውን መደምደሚያ አይደለም.
ተመራማሪዎች የፍቺ-አሰላለፍ ደረጃን መመርመር አለባቸው። ዓላማው ወሳኝ ነው ምክንያቱም መደበኛ ማስረጃ ጠቃሚ የሚሆነው እየተገመገመ ካለው መደበኛ ያልሆነ የይገባኛል ጥያቄ ጋር ሲገናኝ ነው። ረቂቁ FaithSieve የአሰላለፍ ነጥብ እንደሚጠቀም ዘግቧል፣ ነገር ግን የውጤቱን መለኪያ፣ የመነሻ ደረጃ ምርጫ፣ የስህተት መጠን ወይም የአሰላለፍ ፍርዶች በሰዎች፣ በአምሳያዎች ወይም በሌላ አሰራር አይገልጽም። እነዚያ ዝርዝሮች ማዕቀፉ የተሳሳተውን ዓረፍተ ነገር ከማፅደቅ እንዴት እንደሚያስወግድ ይወስናሉ። እነዚያ መለኪያዎች ከሌሉ በሩ ጠቃሚ የተገለጸ አካል ነው ውጤታማነቱ ግልጽ የሆነ አሳማኝ ጥያቄ ሆኖ የሚቆይ።
በመጨረሻም, ተግባራዊ ማሰማራት ከትክክለኛው ትክክለኛነት በላይ ይወሰናል. ወደፊት የሚሠሩ ሥራዎች ማስረጃዎችን ለመበስበስ፣ መደበኛ ግዴታዎችን ለመፍጠር እና ሊን ቼኮችን ለማካሄድ ምን ያህል ጊዜ እና ስሌት እንደሚያስፈልግ እንዲሁም ስርዓቱ ያልተሳኩ ፎርማላይዜሽን እና አሻሚ ፕሮሴዎችን እንዴት እንደሚይዝ ሪፖርት ማድረግ አለበት። ምንጩ በተጨማሪም FaithSieve በእውነተኛ ትምህርታዊ ወይም በምርምር የስራ ፍሰቶች ውስጥ ያሉትን ማስረጃዎች መገምገም ይችል እንደሆነ፣ማስረጃው ስፔሻሊስቶች ላልሆኑ ሰዎች መረዳት የሚቻል ስለመሆኑ እና የቤንችማርክ ደራሲዎች፣ ሞዴሎች እና ገምጋሚዎች ሲቀየሩ መሻሻሎች ይቀጥላሉ የሚለውን የማይታወቅ ነገር አለ። እነዚህ ጥያቄዎች የማዕቀፉን ጠቃሚነት በተግባር ያሳስባሉ እና የተዘገበው የቤንችማርክ ንፅፅርን አይቀይሩም።