ምን ተፈጠረ
በነሀሴ 24 ለarXiv የቀረበው ቅድመ ህትመት Credal Large Language Models ወይም CLLMs ያስተዋውቃል፣ ይህም ከአንድ የይሆናል ስርጭት ይልቅ ምክንያታዊ ትንበያዎችን ለመወከል የLoRA አስማሚዎችን ስብስብ ይጠቀማሉ። ደራሲዎቹ የማስመሰያ ደረጃ እና የትርጉም ደረጃ የቁርጠኝነት ነጥቦችን ወስደዋል እና ለጥያቄ መልስ፣ መለካት፣ መራጭ ትንበያ፣ ቅዠት መለየት እና ማመዛዘን ይገመግማሉ።
ወረቀቱ በተለመደው የቋንቋ ሞዴሎች ጥርጣሬን የሚወክሉ ውስንነቶችን ይገልፃል፡- መደበኛ ሞዴል አንድ ነጠላ ትንበያ ስርጭትን ያዘጋጃል፣ ይህም ደራሲዎቹ ድንቁርናን ከእውነተኛ አሻሚነት ጋር ያዛምዳል ይላሉ። ያቀረቡት CLLM በምትኩ ወረቀቱ የእምነት ስብስብ ብሎ የሚጠራውን ለመፍጠር የLoRA አስማሚዎችን ስብስብ ይጠቀማል። በተግባራዊ አገላለጽ፣ ዘዴው አለመግባባቶችን ለመጠበቅ ወይም በአሳማኝ ትንበያ ስርጭቶች መካከል ለመሰራጨት የታለመ ነው ፣ ሁሉንም ጥርጣሬዎች ወደ አንድ የሶፍትሜክስ ውፅዓት ከመጨመቅ። ምንጩ ይህ ውክልና አንድን ሞዴል ትክክል ያደርገዋል አይልም; የአምሳያው የቁርጠኝነት ደረጃ የበለጠ መረጃ ሰጭ ሊያደርገው እንደሚችል ይናገራል።
ደራሲዎቹ ሁለት ተዛማጅ እርምጃዎችን ያስተዋውቃሉ. Credal Token ቁርጠኝነት ወይም ሲቲሲ፣ በቶከን ቦታ ላይ ይሰራል እና ዝቅተኛ-ታሰረ ድጋፍን፣ የክሪዳል ወርድ እና መጋጠሚያ ኢንትሮፒን ያጣምራል። አብስትራክቱ CTC ያለ ተጨማሪ ትውልድ ሊሰላ እንደሚችል ይናገራል፣ ይህም ተደጋጋሚ ናሙና መውሰድ መዘግየትን ወይም ወጪን ለሚጨምርባቸው ስርዓቶች ጠቃሚ ሊሆን ይችላል። የትርጉም ቁርጠኝነት ወጥነት፣ ወይም ኤስ.ሲ.ሲ፣ የናሙና ማጠናቀቂያዎችን በመጠቀም ሀሳቡን ወደ የትርጉም ቦታ ያራዝመዋል። ወረቀቱ በቶከን ደረጃ ድጋፍ እና በፍቺ ደረጃ ድጋፍ መካከል ያለውን አለመጣጣም ለመለካት SCC-Gapን ይገልጻል። እነዚህ ውጤቶች የአምሳያው የገጽታ ደረጃ መተማመን በሚቻልባቸው መልሶች ከተገለጹት የትርጉም ወሰን ጋር የማይጣጣም በሚሆንበት ጊዜ የመለየት መሣሪያ ሆነው ነው የቀረቡት።
ግምገማው Gemma-2-9B፣ Llama-3.1-8B እና Qwen2.5-7B በOpenBookQA፣ CoQA፣ TriviaQA እና ARC-Challenge ላይ ይሸፍናል። በአብስትራክት መሰረት፣ CLLM ተወዳዳሪ የሚጠበቀውን የካሊብሬሽን ስህተት እየጠበቀ ለጥያቄ-መልስ ትክክለኛነት ምርጡ አፈጻጸም ዘዴ ነው። በተጨማሪም CTC በአብዛኛዎቹ መቼቶች ውስጥ በተቀባዩ ኦፐሬቲንግ ባሕሪይ ከርቭ ስር ሲቲሲ በ1.5 በመቶ ነጥብ ውስጥ እንደሚመጣ ዘግበዋል። በተመረጠ ትንበያ በ80% ሽፋን፣ አብስትራክት በ OpenBookQA ላይ ለ CLLM ከኤስ.ሲ.ሲ ጋር 99.0% ትክክለኛነትን ያሳያል። ለ CLLM የ ARC-Challenge ውጤትን በሴም እምነት መግለጽ ይጀምራል ነገር ግን ውጤቱን ከመስጠቱ በፊት ተቆርጧል፣ ስለዚህ የይገባኛል ጥያቄው ከቀረበው ምንጭ ሊገመገም አይችልም።
ለምን አስፈላጊ ነው።
የቋንቋ ሞዴሎች ተገቢ ባልሆነ እምነት አቀላጥፈው መልስ ሊሰጡ ይችላሉ። ሪፖርት የተደረገው ውጤት ከቀጠለ፣ በበርካታ አሳማኝ ትንበያ ስርጭቶች ላይ እርግጠኛ አለመሆንን መለካት ሲስተሞች ማረጋገጫ፣ መታቀብ ወይም የሰዎች ግምገማ የሚያስፈልጋቸውን መልሶች ለይተው እንዲያውቁ ያግዛቸዋል፣ ብዙ ጊዜ ተጨማሪ ትውልድ ሳያስፈልግ።
ማዕከላዊው ተግባራዊ ጉዳይ የቋንቋ ሞዴል ለጥያቄው መልስ መስጠት አለመቻል ብቻ ሳይሆን እውቀትን ከጥርጣሬ መለየት ይችላል ወይ የሚለው ነው። አቀላጥፎ ግን የተሳሳተ መልስ ተጠቃሚዎች በራስ መተማመንን እንደ ማስረጃ ሲቆጥሩ ከግልጽ እምቢተኝነት የበለጠ አደገኛ ሊሆን ይችላል። የወረቀቱ የእምነት መግለጫ ውክልና በአፕታር ላይ በተመሰረቱ ትንበያዎች መካከል አለመግባባቶችን በማቆየት ችግሩን ይቀርፋል። ዘዴው አጠቃላይ ከሆነ፣ መቼ በቀጥታ መልስ እንደሚሰጥ፣ ማረጋገጫ ለመጠየቅ፣ ጥያቄን ወደ ሌላ ሥርዓት ለማምራት ወይም ሰውን የሚያሳትፍበትን ጊዜ ለመወሰን ለገንቢዎች ሞዴል-ጎን ምልክት ሊሰጥ ይችላል።
የተዘገበው የመራጭ-ትንበያ ውጤት በተለይ ከመሰማራት ጋር የተያያዘ ነው ምክንያቱም የተመረጡ ስርዓቶች እያንዳንዱን ጥያቄ መመለስ አያስፈልጋቸውም። በበቂ ሁኔታ ተደግፈዋል ብሎ የገመተባቸውን ጉዳዮች ብቻ እየሸፈነ ከፍተኛ ትክክለኛነትን የሚይዝ ስርዓት ስህተቶች ትርጉም ያለው ወጪ በሚሸከሙባቸው ቅንብሮች ውስጥ የበለጠ ጠቃሚ ሊሆን ይችላል። በOpenBookQA ላይ በ80% ሽፋን ላይ የተዘገበው የ99.0% ትክክለኛነት በዚያ የውሂብ ስብስብ እና ውቅር ውስጥ አበረታች ነው፣ነገር ግን የተዘረጋው ስርዓት ተመሳሳይ አፈፃፀም እንደሚያስገኝ ከማስረጃ ይልቅ እንደ ወረቀት ውጤት መረዳት አለበት። ማጠቃለያው የምሳሌዎችን ብዛት፣ የንጽጽር ዘዴዎችን ወይም የሽፋን ኦፕሬሽን ፍቺን አይገልጽም።
ለሲቲሲ ያለ ተጨማሪ-ትውልድ የይገባኛል ጥያቄ ለግንዛቤ ንድፍም አስፈላጊ ሊሆን ይችላል። ብዙ ያልተረጋገጡ ቴክኒኮች ብዙ ማጠናቀቂያዎችን በማምረት ላይ ይመረኮዛሉ, ይህም ስሌትን እና መዘግየትን ይጨምራል. ምንጩ CTC ያለ ተጨማሪ ትውልድ ብዙ እርግጠኛ ያልሆኑትን መጠን ያዋህዳል ይላል፣ ኤስ.ሲ.ሲ ደግሞ ናሙና የተደረገ ማጠናቀቂያዎችን በግልፅ ይጠቀማል። ያ ልዩነት ለወረቀቱ የኮንክሪት ምህንድስና አንግል ይሰጣል፡ አንድ ነጥብ ለማመልከት ርካሽ ሊሆን ይችላል፣ ሌላኛው ደግሞ የትርጉም አለመግባባቶችን በቀጥታ ይይዛል። ማጠቃለያው የሎራ ስብስብ ወጪውን በቁጥር አይገልጽም፣ ነገር ግን አጠቃላይ የሽያጭ ልውውጥ የማይታወቅ ሆኖ ይቆያል።
በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ
ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።
What is a common training objective for an autoregressive language model?
ቀጥሎ ምን እንደሚታይ
ውጤቱ በአሁኑ ጊዜ በደራሲ የተዘገበ የቅድመ ህትመት ግምገማ እንጂ ራሱን የቻለ የአፈጻጸም ግኝት አይደለም። ሙሉ የARC-ተግዳሮት ውጤት፣ ትክክለኛ መነሻዎች፣ የስሌት ክፍያ እና ዘዴው ከተሞከሩት ሞዴሎች እና የውሂብ ስብስቦች ምን ያህል እንደሚያስተላልፍ በቀረበው ረቂቅ ውስጥ አስፈላጊ ዝርዝሮች አይገኙም።
የመጀመሪያው ጥያቄ የተዘገበው ትርፍ ራሱን የቻለ ማባዛት ይተርፋል ወይ የሚለው ነው። ምንጩ በኦገስት 24፣ 2026 የገባው የarXiv ቅድመ ህትመት ነው፣ እና የቀረበው ቁሳቁስ አብስትራክት ብቻ ነው። ውጤቶቹ ስለዚህ የይገባኛል ጥያቄዎች በጸሃፊዎች እንጂ በግል የተረጋገጡ እውነታዎች አይደሉም። የክትትል ፍተሻ ሙሉ ሠንጠረዦችን፣ የመነሻ መስመሮችን፣ የመተማመንን ትርጓሜዎችን፣ ስታቲስቲካዊ ልዩነቶችን እና የተዘገበው ጥቅማጥቅሞች በአራቱም የመረጃ ስብስቦች እና በሶስቱም ሞዴል ቤተሰቦች ላይ ወጥነት ያለው መሆኑን መመርመር አለበት።
የአብስትራክት ARC-Challenge ዓረፍተ ነገር ያልተሟላ ነው፡ CLLM በCsem በራስ መተማመን ውጤት እንደሚያስገኝ ይናገራል ነገር ግን ዋጋውን አይሰጥም። ያ የጎደለው መረጃ ከተሟላ የOpenBookQA የይገባኛል ጥያቄ ጋር ንፅፅርን ይገድባል እና የስልቱን የማመዛዘን አፈጻጸም ሙሉ ግምገማ ይከለክላል። ወረቀቱ በአብዛኛዎቹ መቼቶች ከምርጥ AUROC በ1.5 በመቶ ነጥብ ውስጥ መሆንን በተመለከተ የቅዠት ማወቂያ ውጤትን ዘግቧል፣ ነገር ግን የቀረበው ምንጭ ፍጹም ውጤቶችን፣ ምርጥ ተፎካካሪ ዘዴዎችን እና ልዩ ሁኔታዎችን አይለይም።
የማሰማራት ጥያቄዎችም እንዲሁ አስፈላጊ ናቸው። ወረቀቱ የLoRA አስማሚዎችን ስብስብ ይጠቀማል እና አብስትራክቱ ምን ያህል አስማሚዎች እንደሚያስፈልጉ፣ እንዴት እንደሚሰለጥኑ ወይም ምን ያህል የማስታወስ እና የማጣቀሻ ጊዜ እንደሚጨምሩ አይገልጽም። እንዲሁም ሶስት የተሰየሙ የቋንቋ ሞዴሎችን እና አራት የጥያቄ መልስ የውሂብ ስብስቦችን ብቻ ይገመግማል። ውጤቶቹ ለረጅም ንግግሮች፣ ክፍት ትውልድ፣ ባለብዙ ቋንቋ ግብአቶች፣ ጎራ-ተኮር ተግባራት፣ ወይም ሞዴሎች ከተሞከረው መጠን እና የስነ-ህንፃ ክልል ውጭ ይሰሩ እንደሆነ ያልታወቀ ነገር የለም። እነዚያ ጥያቄዎች እስኪመለሱ ድረስ፣ CLLM ከፍተኛ ጠቀሜታ ላለው ጥቅም ከተረጋገጠ ጥበቃ ይልቅ እርግጠኛ አለመሆንን ለመለካት እንደ ተስፋ ሰጭ የምርምር ዘዴ ተደርጎ ይቆጠራል።