ወደ ዜና ተመለስ
ፈጠራAI Understanding አጭር መግለጫ

ቅድመ-ህትመት ለፋይናንስ-ተኮር የኤልኤልኤም ትንታኔዎች ኦዲት የሚቻል ማዕቀፍ ያቀርባል

አዲስ የ arXiv ቅድመ ህትመት ትላልቅ የቋንቋ ሞዴሎችን የሚጠቀሙ የድርጅት ፋይናንስ ሥርዓቶች በመልስ ትክክለኛነት ብቻ ሳይሆን እያንዳንዱ የይገባኛል ጥያቄ ወደ ስልጣን ማስረጃ ሊመጣ ይችላል ወይ በሚለው ጭምር ሊመዘን ይገባል ሲል ይከራከራል። ያቀደው ማዕቀፍ በ145-ጥያቄ ግምገማ ውስጥ የጥቅስ ፍለጋን አሻሽሏል፣ እያመረተ ሳለ…

5 min readRead the primary source
Source-page capture accompanying Preprint proposes an auditable framework for finance-focused LLM analytics
ዋና-ምንጭ ሰነድምንጭ ተመዝግቧል
አታሚ
arxiv.org
ምንጭ አገናኝ
arxiv.orghttps://arxiv.org/abs/2608.20661
የምንጭ ዓይነት
ዋና ሰነድ - ኦፊሴላዊ ማስታወቂያ ፣ ወረቀት ፣ ፋይል ወይም የመጀመሪያ ወገን ገጽ በቀጥታ እናነባለን።
አውድይህንን በ60 ሰከንድ ውስጥ ይረዱት።

እዚ ጀምር

ቁልፍ ቃላት

ትልቅ የቋንቋ ሞዴል (LLM)
ጽሑፍን ለማፍለቅ እና ለመተንተን በትልቅ ጽሑፍ ኮርፖራ ላይ የሰለጠነ የቋንቋ ሞዴል።
RAG (እንደገና የተሻሻለ ትውልድ)
ውጫዊ እውቀትን ሰርስሮ ወደ ትውልድ የሚያስገባ ዘዴ።
የመተማመን ክፍተት
የሚለካው የሞዴል ሜትሪክ ትክክለኛ ዋጋ ሊይዝ የሚችል የስታቲስቲካዊ ክልል።
እራስህን ፈትን።ChatGPT እና LLMs ጥያቄዎች

ምን ተፈጠረ

አዲስ የarXiv ቅድመ ህትመት በድርጅት ፋይናንስ ውስጥ ትልቅ የቋንቋ ሞዴል ትንታኔዎችን በቀላሉ ለኦዲት ለማድረግ በእውቀት ላይ የተመሰረተ የትንታኔ መዋቅርን በእውቀት ላይ የተመሰረተ ትንታኔ ያቀርባል። ስርዓቱ የግንኙነት ዓይነቶችን፣ የመተማመን መረጃን እና የመነሻ መስመርን ከተገኙት እውነታዎች ጋር ያያይዘዋል።

በነሀሴ 21 ለarXiv የቀረበው ወረቀት በድርጅት ፋይናንስ ውስጥ መልሶ ለማግኘት የተሻሻለ ትውልድን በእውቀት የሚመራ ትንታኔ ማዕቀፍ ወይም KDAF ይገልጻል። የተገለጸው ትኩረት የፋይናንሺያል እቅድ እና ትንተና እና ሌሎች የተደነገጉ የስራ ሂደቶች ተጠቃሚዎች ከእውነታው በኋላ መልስ ከየት እንደመጣ ማረጋገጥ አለባቸው። ማዕቀፉ በኦንቶሎጂ የሚመራ የእውቀት ስርዓት በስድስት ተደጋጋሚ ደረጃዎች ይገነባል እና አውድ-አዋው አግባብነት ፕሮፓጋንዳ ወይም CARP የተባለ የመልሶ ማግኛ ዘዴ ይጠቀማል።

በወረቀቱ መሰረት እያንዳንዱ የተገኘ እውነታ ሶስት አይነት መረጃዎችን ይይዛል፡የግንኙነቱ አይነት፣የመተማመን እሴት እና የመነሻ መስመር። ዓላማው የተገኙ ምንባቦችን እንደ ያልተለየ የአውድ መስኮት ከመመልከት ይልቅ የማስረጃውን መዋቅር ግልጽ ማድረግ ነው። ወረቀቱ በተጨማሪም ደራሲዎቹ አወቃቀሮችን፣ የኦንቶሎጂ ንድፍን፣ ጥያቄዎችን፣ የኦዲት ሪፖርቶችን እና የመልሶ ግንባታ ስክሪፕቶችን አስቀምጠዋል፣ ምንም እንኳን እዚህ የቀረበው ምንጭ ቅርሱን በራሱ ባያረጋግጥም ወይም አጠቃቀሙን ባይገልጽም።

ግምገማው ከፋይናንሺያል ቤንች 145 ጥያቄዎችን ተጠቅሟል እና KDAFን ከዜሮ-አውድ ፍንጭ፣ BM25 ሰርስሮ ማውጣት፣ ጽንሰ-ሃሳብ-ክብደት ያለው የቃላት መልሶ ማግኛ እና ያልተመሰረተ የግራፍ መሻገርን አነጻጽሯል። ወረቀቱ እንደዘገበው የዜሮ-አውድ ድምዳሜ 4.1% ትክክለኛነትን ሲያገኝ፣ የመመለሻ-የተጨመሩ ሁኔታዎች ከ10% እስከ 12% ገደማ መድረሱን ዘግቧል። ይህ ለዚህ ፈተና ማስረጃ ማምጣት አስፈላጊ ነው የሚለውን ጠባብ ድምዳሜ ይደግፋል፣ ነገር ግን KDAF ለእያንዳንዱ የፋይናንስ ተግባር በሰፊው የላቀ መሆኑን አያረጋግጥም።

ዋናው ውጤት በመልሱ ትክክለኛነት እና ኦዲትነት መካከል ያለው ልዩነት ነው. ወረቀቱ KDAF እና BM25 በመልሱ ትክክለኛነት ላይ በስታቲስቲክስ ሊለዩ የማይችሉ እንደነበሩ ዘግቧል፣ በ -0.007 ልዩነት እና 95% የመተማመን ልዩነት ከ -0.021 እስከ 0.000። በጥቅስ ፍለጋ F1 ላይ ግን፣ KDAF 0.515 አስመዝግቧል፣ ይህም ከመሬት በታች የሚደረግ ሽግግርን በ0.027 እና BM25 በ0.052 ብልጫ፣ በራስ የመተማመን ክፍተቶች ዜሮን አያካትትም። ወረቀቱ በመቀጠል እንደዘገበው ከ426 በግራፍ የተዋቀሩ የማምረቻ እቃዎች ከጥያቄው ርዕሰ ጉዳይ ውጭ ከ16.8% እና 20.2% ጋር ሲነጻጸር ከጥያቄው ርዕሰ ጉዳይ ውጭ አልመጣም እና እያንዳንዱ የተመረጠ ንጥል ነገር ወደ ሙሉ የፕሮቬንቴንስ ሰንሰለት መፍትሄ አግኝቷል።

የምንጭ ዝርዝሮች: arxiv.org ↗

ለምን አስፈላጊ ነው።

ወረቀቱ የቋንቋ ሞዴሎችን በፋይናንሺያል እቅድ እና ትንተና እና ሌሎች በተደነገጉ የስራ ሂደቶች ለመጠቀም ተግባራዊ እንቅፋትን ያብራራል፡ መልሱ አቀላጥፎ ግን ጥቅም ላይ ሊውል የማይችል ማስረጃው እንደገና መገንባት ካልተቻለ ነው። ውጤቶቹ እንደሚጠቁሙት የመልሱ ትክክለኛነት ባይሆንም ኦዲትነት ሊሻሻል ይችላል።

ተግባራዊ ችግሩ የቋንቋ ሞዴሎችን ለሚሞክሩ ድርጅቶች ጠንቅቆ ያውቃል፡- ሥርዓት ለኦዲተር ወደ ታችኛው መዝገቦች የሚመለስ አስተማማኝ መንገድ ሳይሰጥ አሳማኝ የሆነ የፋይናንስ ማብራሪያ ሊሰጥ ይችላል። ቁጥጥር በሚደረግበት ወይም በፋይናንሺያል ሥራ ውስጥ፣ ድክመቱ በግምገማ፣ በስህተት እርማት፣ በተጠያቂነት እና አንድ ውጤት እንዴት እንደተመረተ የማብራራት ችሎታን ይነካል። ስለዚህ ወረቀቱ የተሻለ መልሶ ማግኘት በራስ-ሰር የተሻሉ መልሶች ማለት ነው ብሎ ከመገመት ይልቅ መከታተያነትን እንደ የተለየ የሥርዓት ንብረት ይመለከታል።

ሪፖርት የተደረገው ግኝቶች የጋራ የግምገማ አቋራጭን ይቃወማሉ። ስርዓቶች በዋነኛነት በመልስ ትክክለኛነት ከተነፃፀሩ፣ በዚህ ጽሑፍ ውስጥ ያለው የተዋቀረው ዘዴ በተፈተነው ቤንችማርክ ላይ ያለውን ተጨማሪ ውስብስብነት በግልፅ አያረጋግጥም። የተዘገበው ትክክለኛነት በስታቲስቲክስ ከ BM25 ጋር ይመሳሰላል፣ ቀለል ያለ የቃላት መልሶ ማግኛ ዘዴ። የተጠየቀው ጥቅም ከማስረጃው ዱካ ላይ ነው፡የህጋዊ አካላት ግንኙነቶችን መጠበቅ እና ውጤቶቹ ይበልጥ ትክክለኛ ባያደርጋቸውም እንኳ የበለጠ መፈተሽ እንዲችሉ ሊያደርግ ይችላል።

ይህ ልዩነት በድርጅት AI ዙሪያ ምን ያህል መሠረተ ልማት እንደሚገነባ ለሚወስኑ ቡድኖች አስፈላጊ ሊሆን ይችላል። ለፕሮቬንሽን ተብሎ የተነደፈ የማገገሚያ ስርዓት ገምጋሚዎች የይገባኛል ጥያቄውን ምንጭ እና ወሰን እንዲለዩ ፣የተሳሳተ አካል የሆኑ ማስረጃዎችን እንዲያውቁ እና በአምሳያው ጥቅም ላይ የዋሉ ቁሳቁሶችን እንደገና እንዲገነቡ ሊረዳቸው ይችላል። እነዚያ ችሎታዎች በፋይናንስ ውስጥ ጠቃሚ ሊሆኑ ይችላሉ፣ ነገር ግን ምንጩ KDAF የፋይናንስ ኪሳራዎችን እንደቀነሰ፣ ኦዲት እንዳሳጠረ፣ የተሻሻሉ ውሳኔዎችን ወይም መደበኛ የታዛዥነት ግምገማ እንዳሳለፈ አላሳየም።

ወረቀቱ የተዋቀረ መልሶ ማግኘትን እንደ ሁለንተናዊ ትክክለኛነት መፍትሄ አድርጎ ከመመልከት ጠቃሚ ማስጠንቀቂያ ይሰጣል። የራሱ አሉታዊ ውጤት ኦንቶሎጂ grounding ሪፖርት ዋጋ አግኝቷል ኦዲትability ዘንግ ላይ, መልስ ትክክለኛነት ላይ አይደለም ይላል. ያ ምርምሩን ከግዥ እና የአስተዳደር ውሳኔዎች ጋር አግባብነት ያለው ያደርገዋል፡ ድርጅቶች ሊረጋገጡ በማይችሉ ውጤቶች ውጤቶች ላይ በመመስረት ስርአቶችን መምረጥ ሊያስፈልጋቸው ይችላል፣ በተናጥል የእውነታ አፈጻጸምን፣ ሽፋንን፣ መዘግየትን፣ የጥገና መስፈርቶችን እና አጠቃላይ ወጪን እየሞከሩ ነው።

Interactive Mechanism

በይነተገናኝ ሜካኒዝም፡ በትክክል እንዴት እንደሚሰራ

ከዚህ ልማት በስተጀርባ ያለውን ቴክኖሎጂ በይነተገናኝ ያስሱ።

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
በይነተገናኝ ጽንሰ-ሐሳብ ቼክ+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

ቀጥሎ ምን እንደሚታይ

ስራው በደራሲ የተዘገበ የቅድመ ህትመት ግምገማ ነው, የምርት ማሰማራት ወይም የቁጥጥር ተቀባይነት ማረጋገጫ አይደለም. የክትትል ሙከራ ትላልቅ እና የተለያዩ የፋይናንሺያል ዳታሴቶችን፣ የምንጭ ሰነዶችን መለወጥ፣ የእውነተኛ ተጠቃሚ የስራ ፍሰት፣ የስራ ማስኬጃ ወጪዎች እና የሰው ኦዲተሮች የተረጋገጠውን መረጃ በአስተማማኝ ሁኔታ መጠቀም ይችሉ እንደሆነ መመርመር አለበት።

አፋጣኝ ጥያቄው ሪፖርት የተደረገው የመከታተያ ጥቅም ከ145-ጥያቄ የፋይናንስ ቤንች ግምገማ ውጭ ይኖራል ወይ የሚለው ነው። የወደፊት ሥራ ተጨማሪ ኩባንያዎችን ፣ የሪፖርት ማቅረቢያ ጊዜዎችን ፣ የሂሳብ ሁኔታዎችን ፣ የሰነድ ቅርጸቶችን እና የጥያቄ ዓይነቶችን ፣ አሻሚ አካላትን ወይም ያልተሟሉ መዝገቦችን የሚያካትቱ ጥያቄዎችን መፈተሽ አለበት። ምንጩ የ KDAF የስልጣን ምንጮች ካልተስማሙ፣ ስህተቶችን ሲይዙ ወይም መልስ ከተፈጠረ በኋላ ሲቀየሩ እንዴት እንደሚሰራ አላስቀመጠም።

የቅርስ ማስቀመጫው ስራውን እንደገና ለማባዛት ቀላል ያደርገዋል፣ ነገር ግን ተግባራዊ ጠቀሜታው ከቀረበው ምንጭ የማይታወቅ ነው። የመልሶ ግንባታው ስክሪፕቶች በተለመደው የድርጅት አከባቢዎች ውስጥ እንደሚሰሩ፣ ምን ያህል በእጅ ኦንቶሎጂ ግንባታ እንደሚያስፈልግ ወይም የእውቀት ስርዓቱ በየስንት ጊዜው መዘመን እንዳለበት ግልጽ አይደለም። እነዚህ ዝርዝሮች ዘዴው ለፋይናንስ ቡድኖች ሊጠቅም የሚችል ቁጥጥር ወይም በዋናነት የጥናት ምሳሌ መሆኑን ይወስናሉ።

የክዋኔ ሽግግሮችም መለኪያ ያስፈልጋቸዋል. ምንጩ የማሰማራት ወጪዎችን፣ የምላሽ ጊዜዎችን፣ የማከማቻ መስፈርቶችን፣ የሞዴል ዝርዝሮችን፣ የሰው ሃይል ፍላጎቶችን ወይም ከሌሎች የፕሮቬንሽን-ተጠብቆ የማውጫ ስርዓቶች ጋር ማነፃፀርን አያቀርብም። እንዲሁም ሪፖርት የተደረጉት የመተማመን እሴቶች የተስተካከሉ መሆናቸውን፣ ተጠቃሚዎች በትክክል ተረድተዋቸዋል ወይም የተሟላ የፕሮቬንሽን ሰንሰለት የተጠቀሰው ማስረጃ በእውነቱ የተፈጠረውን የይገባኛል ጥያቄ የሚደግፍ መሆኑን አያሳይም።

በመጨረሻም፣ ወረቀቱ ቅድመ ህትመት ሲሆን በራሱ ደራሲዎች ግምገማ የተገኙ ውጤቶችን ያቀርባል። በገለልተኛ ማባዛት፣ የምርት ጉዲፈቻ፣ የቁጥጥር ድጋፍ ወይም የተሻሻለ የገሃዱ ዓለም የፋይናንስ ውጤቶች ምንጭ ላይ ምንም ማስረጃ የለም። በጣም ጠቃሚው ቀጣይ ማስረጃዎች በመረጃ ላይ ቁጥጥር የተደረገባቸው ለውጦች ፣የሰው ኦዲት ጥናቶች እና የተረጋገጠ መረጃ ገምጋሚዎች የተሳሳቱ ፣ያልተሟሉ ወይም አካላት-ያልተዛመደ የሞዴል ውጤቶች እንዲይዙ የሚረዳ ከሆነ ገለልተኛ ሙከራ ነው።

ተዛማጅ መመሪያዎች እና ጥያቄዎች

ChatGPT እና LLMsAI ሞዴሎች ተብራርተዋልየAI ሥነ ምግባርAI ስልጠናየሚያውቁትን ይሞክሩ - ነፃ የ AI ጥያቄዎችን ይሞክሩበእኛ የቃላት መፍቻ ውስጥ የ AI ቃልን ይፈልጉየ AI ሞዴል መልቀቂያ መከታተያ ይከተሉ
ይህ ጠቃሚ ሆኖ ተገኝቷል?