ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

ቅድመ ህትመት አለመረጋጋትን ለማጋለጥ እና ቅዠቶችን ለመለየት የእምነት ቋንቋ ሞዴሎችን ያቀርባል

አዲስ ቅድመ-ህትመት የቋንቋ ሞዴሎች ምን ያህል ጠንከር ብለው መልስ ለመስጠት እንደሚተጉ፣ በሶስት ክፍት ሞዴሎች እና በአራት የጥያቄ-መልስ ዳታ ስብስቦች ውስጥ የውድድር ልኬት እና የቅዠት ማወቂያ ውጤቶችን የሚመዘን በስብስብ ላይ የተመሰረተ አቀራረብን ያቀርባል።

5 min readRead the primary source
Source-page capture accompanying Preprint proposes credal language models to expose uncertainty and detect hallucinations
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.23244
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

LoRA (ዝቅተኛ-ደረጃ መላመድ)
ዝቅተኛ ደረጃ አስማሚ ማትሪክቶችን የሚጨምር ፓራሜትር-ውጤታማ ጥሩ ማስተካከያ ዘዴ።
ማህደረ ትውስታ (ወኪል ማህደረ ትውስታ)
የተከማቸ አውድ የኤ ወኪል ቀጣይነትን ለማሻሻል በሁሉም ደረጃዎች ወይም ክፍለ ጊዜዎች ይጠቀማል።
ቅዠት
አንድ ሞዴል አቀላጥፎ ግን ሐሰት ወይም የማይደገፍ መረጃ ሲያመነጭ።
እራስህን ፈትን።ChatGPT እና LLMs ጥያቄዎች

ምን ተፈጠረ

በነሀሴ 24 ለarXiv የቀረበው ቅድመ ህትመት Credal Large Language Models ወይም CLLMs ያስተዋውቃል፣ ይህም ከአንድ የይሆናል ስርጭት ይልቅ ምክንያታዊ ትንበያዎችን ለመወከል የLoRA አስማሚዎችን ስብስብ ይጠቀማሉ። ደራሲዎቹ የማስመሰያ ደረጃ እና የትርጉም ደረጃ የቁርጠኝነት ነጥቦችን ወስደዋል እና ለጥያቄ መልስ፣ መለካት፣ መራጭ ትንበያ፣ ቅዠት መለየት እና ማመዛዘን ይገመግማሉ።

ወረቀቱ በተለመደው የቋንቋ ሞዴሎች ጥርጣሬን የሚወክሉ ውስንነቶችን ይገልፃል፡- መደበኛ ሞዴል አንድ ነጠላ ትንበያ ስርጭትን ያዘጋጃል፣ ይህም ደራሲዎቹ ድንቁርናን ከእውነተኛ አሻሚነት ጋር ያዛምዳል ይላሉ። ያቀረቡት CLLM በምትኩ ወረቀቱ የእምነት ስብስብ ብሎ የሚጠራውን ለመፍጠር የLoRA አስማሚዎችን ስብስብ ይጠቀማል። በተግባራዊ አገላለጽ፣ ዘዴው አለመግባባቶችን ለመጠበቅ ወይም በአሳማኝ ትንበያ ስርጭቶች መካከል ለመሰራጨት የታለመ ነው ፣ ሁሉንም ጥርጣሬዎች ወደ አንድ የሶፍትሜክስ ውፅዓት ከመጨመቅ። ምንጩ ይህ ውክልና አንድን ሞዴል ትክክል ያደርገዋል አይልም; የአምሳያው የቁርጠኝነት ደረጃ የበለጠ መረጃ ሰጭ ሊያደርገው እንደሚችል ይናገራል።

ደራሲዎቹ ሁለት ተዛማጅ እርምጃዎችን ያስተዋውቃሉ. Credal Token ቁርጠኝነት ወይም ሲቲሲ፣ በቶከን ቦታ ላይ ይሰራል እና ዝቅተኛ-ታሰረ ድጋፍን፣ የክሪዳል ወርድ እና መጋጠሚያ ኢንትሮፒን ያጣምራል። አብስትራክቱ CTC ያለ ተጨማሪ ትውልድ ሊሰላ እንደሚችል ይናገራል፣ ይህም ተደጋጋሚ ናሙና መውሰድ መዘግየትን ወይም ወጪን ለሚጨምርባቸው ስርዓቶች ጠቃሚ ሊሆን ይችላል። የትርጉም ቁርጠኝነት ወጥነት፣ ወይም ኤስ.ሲ.ሲ፣ የናሙና ማጠናቀቂያዎችን በመጠቀም ሀሳቡን ወደ የትርጉም ቦታ ያራዝመዋል። ወረቀቱ በቶከን ደረጃ ድጋፍ እና በፍቺ ደረጃ ድጋፍ መካከል ያለውን አለመጣጣም ለመለካት SCC-Gapን ይገልጻል። እነዚህ ውጤቶች የአምሳያው የገጽታ ደረጃ መተማመን በሚቻልባቸው መልሶች ከተገለጹት የትርጉም ወሰን ጋር የማይጣጣም በሚሆንበት ጊዜ የመለየት መሣሪያ ሆነው ነው የቀረቡት።

ግምገማው Gemma-2-9B፣ Llama-3.1-8B እና Qwen2.5-7B በOpenBookQA፣ CoQA፣ TriviaQA እና ARC-Challenge ላይ ይሸፍናል። በአብስትራክት መሰረት፣ CLLM ተወዳዳሪ የሚጠበቀውን የካሊብሬሽን ስህተት እየጠበቀ ለጥያቄ-መልስ ትክክለኛነት ምርጡ አፈጻጸም ዘዴ ነው። በተጨማሪም CTC በአብዛኛዎቹ መቼቶች ውስጥ በተቀባዩ ኦፐሬቲንግ ባሕሪይ ከርቭ ስር ሲቲሲ በ1.5 በመቶ ነጥብ ውስጥ እንደሚመጣ ዘግበዋል። በተመረጠ ትንበያ በ80% ሽፋን፣ አብስትራክት በ OpenBookQA ላይ ለ CLLM ከኤስ.ሲ.ሲ ጋር 99.0% ትክክለኛነትን ያሳያል። ለ CLLM የ ARC-Challenge ውጤትን በሴም እምነት መግለጽ ይጀምራል ነገር ግን ውጤቱን ከመስጠቱ በፊት ተቆርጧል፣ ስለዚህ የይገባኛል ጥያቄው ከቀረበው ምንጭ ሊገመገም አይችልም።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

የቋንቋ ሞዴሎች ተገቢ ባልሆነ እምነት አቀላጥፈው መልስ ሊሰጡ ይችላሉ። ሪፖርት የተደረገው ውጤት ከቀጠለ፣ በበርካታ አሳማኝ ትንበያ ስርጭቶች ላይ እርግጠኛ አለመሆንን መለካት ሲስተሞች ማረጋገጫ፣ መታቀብ ወይም የሰዎች ግምገማ የሚያስፈልጋቸውን መልሶች ለይተው እንዲያውቁ ያግዛቸዋል፣ ብዙ ጊዜ ተጨማሪ ትውልድ ሳያስፈልግ።

ማዕከላዊው ተግባራዊ ጉዳይ የቋንቋ ሞዴል ለጥያቄው መልስ መስጠት አለመቻል ብቻ ሳይሆን እውቀትን ከጥርጣሬ መለየት ይችላል ወይ የሚለው ነው። አቀላጥፎ ግን የተሳሳተ መልስ ተጠቃሚዎች በራስ መተማመንን እንደ ማስረጃ ሲቆጥሩ ከግልጽ እምቢተኝነት የበለጠ አደገኛ ሊሆን ይችላል። የወረቀቱ የእምነት መግለጫ ውክልና በአፕታር ላይ በተመሰረቱ ትንበያዎች መካከል አለመግባባቶችን በማቆየት ችግሩን ይቀርፋል። ዘዴው አጠቃላይ ከሆነ፣ መቼ በቀጥታ መልስ እንደሚሰጥ፣ ማረጋገጫ ለመጠየቅ፣ ጥያቄን ወደ ሌላ ሥርዓት ለማምራት ወይም ሰውን የሚያሳትፍበትን ጊዜ ለመወሰን ለገንቢዎች ሞዴል-ጎን ምልክት ሊሰጥ ይችላል።

የተዘገበው የመራጭ-ትንበያ ውጤት በተለይ ከመሰማራት ጋር የተያያዘ ነው ምክንያቱም የተመረጡ ስርዓቶች እያንዳንዱን ጥያቄ መመለስ አያስፈልጋቸውም። በበቂ ሁኔታ ተደግፈዋል ብሎ የገመተባቸውን ጉዳዮች ብቻ እየሸፈነ ከፍተኛ ትክክለኛነትን የሚይዝ ስርዓት ስህተቶች ትርጉም ያለው ወጪ በሚሸከሙባቸው ቅንብሮች ውስጥ የበለጠ ጠቃሚ ሊሆን ይችላል። በOpenBookQA ላይ በ80% ሽፋን ላይ የተዘገበው የ99.0% ትክክለኛነት በዚያ የውሂብ ስብስብ እና ውቅር ውስጥ አበረታች ነው፣ነገር ግን የተዘረጋው ስርዓት ተመሳሳይ አፈፃፀም እንደሚያስገኝ ከማስረጃ ይልቅ እንደ ወረቀት ውጤት መረዳት አለበት። ማጠቃለያው የምሳሌዎችን ብዛት፣ የንጽጽር ዘዴዎችን ወይም የሽፋን ኦፕሬሽን ፍቺን አይገልጽም።

ለሲቲሲ ያለ ተጨማሪ-ትውልድ የይገባኛል ጥያቄ ለግንዛቤ ንድፍም አስፈላጊ ሊሆን ይችላል። ብዙ ያልተረጋገጡ ቴክኒኮች ብዙ ማጠናቀቂያዎችን በማምረት ላይ ይመረኮዛሉ, ይህም ስሌትን እና መዘግየትን ይጨምራል. ምንጩ CTC ያለ ተጨማሪ ትውልድ ብዙ እርግጠኛ ያልሆኑትን መጠን ያዋህዳል ይላል፣ ኤስ.ሲ.ሲ ደግሞ ናሙና የተደረገ ማጠናቀቂያዎችን በግልፅ ይጠቀማል። ያ ልዩነት ለወረቀቱ የኮንክሪት ምህንድስና አንግል ይሰጣል፡ አንድ ነጥብ ለማመልከት ርካሽ ሊሆን ይችላል፣ ሌላኛው ደግሞ የትርጉም አለመግባባቶችን በቀጥታ ይይዛል። ማጠቃለያው የሎራ ስብስብ ወጪውን በቁጥር አይገልጽም፣ ነገር ግን አጠቃላይ የሽያጭ ልውውጥ የማይታወቅ ሆኖ ይቆያል።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

ቀጥሎ ምን እንደሚታይ

ውጤቱ በአሁኑ ጊዜ በደራሲ የተዘገበ የቅድመ ህትመት ግምገማ እንጂ ራሱን የቻለ የአፈጻጸም ግኝት አይደለም። ሙሉ የARC-ተግዳሮት ውጤት፣ ትክክለኛ መነሻዎች፣ የስሌት ክፍያ እና ዘዴው ከተሞከሩት ሞዴሎች እና የውሂብ ስብስቦች ምን ያህል እንደሚያስተላልፍ በቀረበው ረቂቅ ውስጥ አስፈላጊ ዝርዝሮች አይገኙም።

የመጀመሪያው ጥያቄ የተዘገበው ትርፍ ራሱን የቻለ ማባዛት ይተርፋል ወይ የሚለው ነው። ምንጩ በኦገስት 24፣ 2026 የገባው የarXiv ቅድመ ህትመት ነው፣ እና የቀረበው ቁሳቁስ አብስትራክት ብቻ ነው። ውጤቶቹ ስለዚህ የይገባኛል ጥያቄዎች በጸሃፊዎች እንጂ በግል የተረጋገጡ እውነታዎች አይደሉም። የክትትል ፍተሻ ሙሉ ሠንጠረዦችን፣ የመነሻ መስመሮችን፣ የመተማመንን ትርጓሜዎችን፣ ስታቲስቲካዊ ልዩነቶችን እና የተዘገበው ጥቅማጥቅሞች በአራቱም የመረጃ ስብስቦች እና በሶስቱም ሞዴል ቤተሰቦች ላይ ወጥነት ያለው መሆኑን መመርመር አለበት።

የአብስትራክት ARC-Challenge ዓረፍተ ነገር ያልተሟላ ነው፡ CLLM በCsem በራስ መተማመን ውጤት እንደሚያስገኝ ይናገራል ነገር ግን ዋጋውን አይሰጥም። ያ የጎደለው መረጃ ከተሟላ የOpenBookQA የይገባኛል ጥያቄ ጋር ንፅፅርን ይገድባል እና የስልቱን የማመዛዘን አፈጻጸም ሙሉ ግምገማ ይከለክላል። ወረቀቱ በአብዛኛዎቹ መቼቶች ከምርጥ AUROC በ1.5 በመቶ ነጥብ ውስጥ መሆንን በተመለከተ የቅዠት ማወቂያ ውጤትን ዘግቧል፣ ነገር ግን የቀረበው ምንጭ ፍጹም ውጤቶችን፣ ምርጥ ተፎካካሪ ዘዴዎችን እና ልዩ ሁኔታዎችን አይለይም።

የማሰማራት ጥያቄዎችም እንዲሁ አስፈላጊ ናቸው። ወረቀቱ የLoRA አስማሚዎችን ስብስብ ይጠቀማል እና አብስትራክቱ ምን ያህል አስማሚዎች እንደሚያስፈልጉ፣ እንዴት እንደሚሰለጥኑ ወይም ምን ያህል የማስታወስ እና የማጣቀሻ ጊዜ እንደሚጨምሩ አይገልጽም። እንዲሁም ሶስት የተሰየሙ የቋንቋ ሞዴሎችን እና አራት የጥያቄ መልስ የውሂብ ስብስቦችን ብቻ ይገመግማል። ውጤቶቹ ለረጅም ንግግሮች፣ ክፍት ትውልድ፣ ባለብዙ ቋንቋ ግብአቶች፣ ጎራ-ተኮር ተግባራት፣ ወይም ሞዴሎች ከተሞከረው መጠን እና የስነ-ህንፃ ክልል ውጭ ይሰሩ እንደሆነ ያልታወቀ ነገር የለም። እነዚያ ጥያቄዎች እስኪመለሱ ድረስ፣ CLLM ከፍተኛ ጠቀሜታ ላለው ጥቅም ከተረጋገጠ ጥበቃ ይልቅ እርግጠኛ አለመሆንን ለመለካት እንደ ተስፋ ሰጭ የምርምር ዘዴ ተደርጎ ይቆጠራል።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

ChatGPT እና LLMsAI ሞዴሎች ተብራርተዋልየAI ሥነ ምግባርAI ስልጠናየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?