সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

প্রিপ্রিন্ট অর্থ-কেন্দ্রিক এলএলএম বিশ্লেষণের জন্য একটি নিরীক্ষণযোগ্য কাঠামোর প্রস্তাব করে

একটি নতুন arXiv প্রিপ্রিন্ট যুক্তি দেয় যে বৃহৎ ভাষার মডেল ব্যবহার করে এন্টারপ্রাইজ ফাইন্যান্স সিস্টেমগুলি শুধুমাত্র উত্তরের নির্ভুলতা দ্বারা নয় বরং প্রতিটি দাবিকে প্রামাণিক প্রমাণের জন্য চিহ্নিত করা যায় কিনা তা দ্বারা বিচার করা উচিত। এটির প্রস্তাবিত কাঠামোটি 145-প্রশ্নের মূল্যায়নে উদ্ধৃতি সনাক্তকরণের উন্নতি করেছে, উৎপাদন করার সময়...

5 min readRead the primary source
Source-page capture accompanying Preprint proposes an auditable framework for finance-focused LLM analytics
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.20661
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
RAG (পুনরুদ্ধার-অগমেন্টেড জেনারেশন)
একটি পদ্ধতি যা বাহ্যিক জ্ঞান পুনরুদ্ধার করে এবং অনুমান সময়ে প্রজন্মের মধ্যে এটি খাওয়ায়।
আত্মবিশ্বাসের ব্যবধান
একটি পরিসংখ্যানগত পরিসর যা সম্ভবত একটি পরিমাপিত মডেল মেট্রিকের প্রকৃত মান ধারণ করে।
নিজেকে পরীক্ষা করুনChatGPT এবং LLM কুইজ

কি হয়েছে

একটি নতুন arXiv প্রিপ্রিন্ট নলেজ-ড্রিভেন অ্যানালিটিক্স ফ্রেমওয়ার্ক উপস্থাপন করে, এন্টারপ্রাইজ ফাইন্যান্সে বৃহৎ ভাষা মডেল বিশ্লেষণকে অডিট করা সহজ করার জন্য একটি অন্টোলজি-ভিত্তিক পদ্ধতি। সিস্টেমটি সম্পর্কের ধরন, আত্মবিশ্বাসের তথ্য এবং উৎসের বংশকে পুনরুদ্ধার করা তথ্যের সাথে সংযুক্ত করে।

21 অগাস্ট arXiv-এ জমা দেওয়া কাগজটি এন্টারপ্রাইজ ফাইন্যান্সে পুনরুদ্ধার-বর্ধিত প্রজন্মের জন্য জ্ঞান-চালিত অ্যানালিটিক্স ফ্রেমওয়ার্ক বা KDAF বর্ণনা করে। এর বিবৃত ফোকাস হল আর্থিক পরিকল্পনা এবং বিশ্লেষণ এবং অন্যান্য নিয়ন্ত্রিত কর্মপ্রবাহ যেখানে ব্যবহারকারীদের নিশ্চিত করতে হবে যে সত্যের পরে একটি উত্তর কোথা থেকে এসেছে। কাঠামোটি ছয়টি পুনরাবৃত্তিমূলক পর্যায়ের মাধ্যমে একটি অন্টোলজি-চালিত জ্ঞান সিস্টেম তৈরি করে এবং প্রসঙ্গ-সচেতন প্রাসঙ্গিক প্রচার বা CARP নামে একটি পুনরুদ্ধার পদ্ধতি ব্যবহার করে।

কাগজ অনুসারে, প্রতিটি পুনরুদ্ধার করা তথ্য তিন ধরণের তথ্য বহন করে: এর সম্পর্কের ধরন, একটি আস্থার মান এবং একটি উত্স বংশ। উদ্দেশ্য হল পুনরুদ্ধার করা প্যাসেজগুলিকে একটি আলাদা প্রসঙ্গ উইন্ডো হিসাবে বিবেচনা করার পরিবর্তে প্রমাণ কাঠামোকে সুস্পষ্ট করা। কাগজে আরও বলা হয়েছে যে লেখকরা কনফিগারেশন, একটি অন্টোলজি স্কিমা, প্রম্পট, অডিট রিপোর্ট এবং পুনর্গঠন স্ক্রিপ্ট জমা দিয়েছেন, যদিও এখানে দেওয়া উৎসটি স্বাধীনভাবে আর্টিফ্যাক্টটি যাচাই করে না বা এর ব্যবহারযোগ্যতা বর্ণনা করে না।

মূল্যায়নে FinanceBench থেকে 145টি প্রশ্ন ব্যবহার করা হয়েছে এবং KDAF-কে শূন্য-প্রসঙ্গ অনুমান, BM25 পুনরুদ্ধার, ধারণা-ভারিত আভিধানিক পুনরুদ্ধার এবং ভিত্তিহীন গ্রাফ ট্রাভার্সালের সাথে তুলনা করা হয়েছে। কাগজটি রিপোর্ট করেছে যে শূন্য-প্রসঙ্গ অনুমান 4.1% সঠিকতা অর্জন করেছে, যখন পুনরুদ্ধার-বর্ধিত শর্তগুলি প্রায় 10% থেকে 12% পর্যন্ত পৌঁছেছে। এটি সংকীর্ণ উপসংহারকে সমর্থন করে যে প্রমাণ পুনরুদ্ধার করা এই পরীক্ষার জন্য গুরুত্বপূর্ণ ছিল, তবে এটি প্রতিষ্ঠিত করে না যে KDAF প্রতিটি আর্থিক কাজের জন্য বিস্তৃতভাবে উচ্চতর।

মূল ফলাফল হল উত্তরের সঠিকতা এবং নিরীক্ষাযোগ্যতার মধ্যে একটি বিচ্ছেদ। কাগজটি রিপোর্ট করেছে যে KDAF এবং BM25 উত্তরের সঠিকতার ক্ষেত্রে পরিসংখ্যানগতভাবে আলাদা করা যায় না, -0.007 এর রিপোর্ট করা পার্থক্য এবং -0.021 থেকে 0.000 পর্যন্ত একটি 95% আত্মবিশ্বাসের ব্যবধান। উদ্ধৃতি ট্র্যাসেবিলিটি এফ1-এ, তবে, KDAF 0.515 স্কোর করেছে, 0.027 এবং BM25 0.052 দ্বারা অগ্রাউন্ডেড ট্রাভার্সাল অতিক্রম করেছে, আত্মবিশ্বাসের ব্যবধান শূন্য বাদ দিয়ে। গবেষণাপত্রটি আরও রিপোর্ট করে যে 426 গ্রাফ-গঠিত পুনরুদ্ধার আইটেমগুলির মধ্যে কোনটিই প্রশ্নের বিষয় সত্তার বাইরে থেকে আসেনি, যেখানে আভিধানিক বেসলাইনের জন্য 16.8% এবং 20.2% এর তুলনায়, এবং প্রতিটি নির্বাচিত আইটেম একটি সম্পূর্ণ মূল শৃঙ্খলে সমাধান করেছে।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাগজটি আর্থিক পরিকল্পনা এবং বিশ্লেষণ এবং অন্যান্য নিয়ন্ত্রিত কর্মপ্রবাহে ভাষার মডেলগুলি ব্যবহার করার ক্ষেত্রে একটি ব্যবহারিক বাধাকে সম্বোধন করে: একটি উত্তর সাবলীল হলেও অব্যবহারযোগ্য হতে পারে যদি এর প্রমাণ পুনর্গঠন করা না যায়। ফলাফলগুলি পরামর্শ দেয় যে উত্তরের নির্ভুলতা না থাকলেও নিরীক্ষাযোগ্যতা উন্নত হতে পারে।

ব্যবহারিক সমস্যাটি ভাষা মডেলগুলির সাথে পরীক্ষা করা সংস্থাগুলির সাথে পরিচিত: একটি সিস্টেম অডিটরকে অন্তর্নিহিত রেকর্ডগুলিতে ফিরে আসার একটি নির্ভরযোগ্য পথ না দিয়ে একটি যুক্তিসঙ্গত আর্থিক ব্যাখ্যা তৈরি করতে পারে। নিয়ন্ত্রিত বা আর্থিকভাবে ফলপ্রসূ কাজের ক্ষেত্রে, সেই দুর্বলতা পর্যালোচনা, ত্রুটি সংশোধন, জবাবদিহিতা এবং কীভাবে একটি আউটপুট উত্পাদিত হয়েছিল তা ব্যাখ্যা করার ক্ষমতাকে প্রভাবিত করে। কাগজটি তাই ট্রেসেবিলিটিকে একটি স্বতন্ত্র সিস্টেমের সম্পত্তি হিসাবে বিবেচনা করে যে আরও ভাল পুনরুদ্ধারের অর্থ স্বয়ংক্রিয়ভাবে আরও ভাল উত্তর।

রিপোর্ট করা ফলাফলগুলি একটি সাধারণ মূল্যায়ন শর্টকাটকে চ্যালেঞ্জ করে। যদি সিস্টেমগুলিকে প্রধানত উত্তরের নির্ভুলতার সাথে তুলনা করা হয়, তবে এই কাগজের কাঠামোগত পদ্ধতিটি পরীক্ষিত বেঞ্চমার্কে এর অতিরিক্ত জটিলতাকে স্পষ্টভাবে সমর্থন করবে না। এর রিপোর্ট করা নির্ভুলতা পরিসংখ্যানগতভাবে BM25 এর মতো, একটি সহজ আভিধানিক পুনরুদ্ধার পদ্ধতি। দাবিকৃত সুবিধাটি প্রমাণের পথের পরিবর্তে নিহিত: সত্তার সম্পর্ক এবং উত্স সংরক্ষণ করা আউটপুটগুলিকে আরও পরিদর্শনযোগ্য করে তুলতে পারে এমনকি যখন এটি তাদের আরও বাস্তবগতভাবে সঠিক করে না।

এন্টারপ্রাইজ AI এর চারপাশে কত পরিকাঠামো তৈরি করতে হবে তা সিদ্ধান্ত নেওয়া দলগুলির জন্য এই পার্থক্যটি গুরুত্বপূর্ণ হতে পারে। উদ্ভবের জন্য পরিকল্পিত একটি পুনরুদ্ধার ব্যবস্থা পর্যালোচকদের একটি দাবির উত্স এবং সুযোগ সনাক্ত করতে, ভুল সত্তার অন্তর্গত প্রমাণ সনাক্ত করতে এবং একটি মডেল দ্বারা ব্যবহৃত উপকরণগুলি পুনর্গঠন করতে সহায়তা করতে পারে। এই ক্ষমতাগুলি অর্থের ক্ষেত্রে মূল্যবান হতে পারে, কিন্তু উত্সটি দেখায় না যে KDAF আর্থিক ক্ষতি হ্রাস করেছে, অডিট সংক্ষিপ্ত করেছে, উন্নত সিদ্ধান্ত নিয়েছে বা একটি আনুষ্ঠানিক সম্মতি মূল্যায়ন পাস করেছে।

কাগজটি একটি সার্বজনীন নির্ভুলতা সমাধান হিসাবে কাঠামোগত পুনরুদ্ধারকে চিকিত্সা করার বিরুদ্ধে একটি দরকারী সতর্কতা প্রদান করে। এর নিজস্ব নেতিবাচক ফলাফল বলে যে অন্টোলজি গ্রাউন্ডিং উত্তরের সঠিকতার উপর নয়, অডিটবিলিটি অক্ষের উপর তার রিপোর্ট করা খরচ অর্জন করেছে। এটি গবেষণাকে ক্রয় এবং পরিচালনার সিদ্ধান্তগুলির সাথে প্রাসঙ্গিক করে তোলে: সংস্থাগুলিকে যাচাইযোগ্য আউটপুটগুলির ফলাফলের উপর ভিত্তি করে সিস্টেমগুলি বেছে নেওয়ার প্রয়োজন হতে পারে, পৃথকভাবে বাস্তব কার্যকারিতা, কভারেজ, বিলম্ব, রক্ষণাবেক্ষণের প্রয়োজনীয়তা এবং মোট খরচ পরীক্ষা করার সময়।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Document Size:128K tokens
Needle Placement Depth (Location in document):50% into text
Attention Context Buffer Map:
Target Fact (50%)
Equivalent Pages~320Standard book pages
Retrieval Accuracy99.9%Needle recall score
RAM / KV Cache5.1 GBMemory overhead
Prompt CachingActive~80% discount on reuse
Core takeaway: Million-token context windows allow querying whole codebases or legal archives in one prompt. However, KV cache memory scales with context length, making prompt caching crucial for real-time production.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
ChatGPT & LLMs Quiz

What is a common training objective for an autoregressive language model?

পরবর্তী কি দেখতে

কাজটি একটি লেখক-প্রতিবেদিত প্রিপ্রিন্ট মূল্যায়ন, উৎপাদন স্থাপনার বা নিয়ন্ত্রক গ্রহণযোগ্যতার প্রমাণ নয়। ফলো-আপ টেস্টিং বৃহত্তর এবং আরও বৈচিত্রপূর্ণ আর্থিক ডেটাসেট, উৎস নথি পরিবর্তন, প্রকৃত ব্যবহারকারীর কর্মপ্রবাহ, কর্মক্ষম খরচ এবং মানব নিরীক্ষকরা নির্ভরযোগ্যভাবে মূল তথ্য ব্যবহার করতে পারে কিনা তা পরীক্ষা করা উচিত।

তাৎক্ষণিক প্রশ্ন হল রিপোর্ট ট্রেসেবিলিটি সুবিধা 145-প্রশ্নের ফাইন্যান্সবেঞ্চ মূল্যায়নের বাইরে টিকে আছে কিনা। ভবিষ্যত কাজ আরও কোম্পানি পরীক্ষা করা উচিত, রিপোর্টিং সময়কাল, অ্যাকাউন্টিং প্রসঙ্গ, নথি বিন্যাস এবং প্রশ্নের ধরন, অস্পষ্ট সত্তা বা অসম্পূর্ণ রেকর্ড জড়িত প্রশ্ন সহ। উত্সটি প্রতিষ্ঠিত করে না যে KDAF কিভাবে কার্য সম্পাদন করে যখন প্রামাণিক উত্সগুলি একমত না হয়, ত্রুটি থাকে বা উত্তর তৈরি হওয়ার পরে পরিবর্তন হয়।

আর্টিফ্যাক্ট ডিপোজিট কাজটিকে পুনরুত্পাদন করা সহজ করে তুলতে পারে, তবে সরবরাহকৃত উত্স থেকে এর ব্যবহারিক মূল্য অজানা থেকে যায়। পুনর্গঠন স্ক্রিপ্টগুলি সাধারণ এন্টারপ্রাইজ পরিবেশে চলে কিনা, কতটা ম্যানুয়াল অন্টোলজি নির্মাণের প্রয়োজন, বা কত ঘন ঘন জ্ঞান সিস্টেম আপডেট করা আবশ্যক তা স্পষ্ট নয়। এই বিবরণগুলি নির্ধারণ করবে যে পদ্ধতিটি অর্থ দলগুলির জন্য একটি ব্যবহারযোগ্য নিয়ন্ত্রণ নাকি প্রধানত একটি গবেষণা প্রোটোটাইপ।

অপারেশনাল ট্রেডঅফেরও পরিমাপ প্রয়োজন। উৎসটি স্থাপনার খরচ, প্রতিক্রিয়ার সময়, স্টোরেজ প্রয়োজনীয়তা, মডেলের বিশদ বিবরণ, কর্মীদের প্রয়োজন বা অন্যান্য উদ্ভব-সংরক্ষণকারী পুনরুদ্ধার সিস্টেমের সাথে তুলনা প্রদান করে না। এটাও দেখায় না যে রিপোর্ট করা আত্মবিশ্বাসের মানগুলি ক্যালিব্রেট করা হয়েছে কিনা, ব্যবহারকারীরা সেগুলি সঠিকভাবে বোঝে কিনা বা একটি সম্পূর্ণ প্রোভেনেন্স চেইন গ্যারান্টি দেয় যে উদ্ধৃত প্রমাণগুলি আসলে উত্পন্ন দাবিকে সমর্থন করে।

অবশেষে, কাগজটি একটি প্রিপ্রিন্ট এবং এটির লেখকদের নিজস্ব মূল্যায়ন থেকে ফলাফল উপস্থাপন করে। স্বাধীন প্রতিলিপি, উৎপাদন গ্রহণ, নিয়ন্ত্রক অনুমোদন বা উন্নত বাস্তব-বিশ্বের আর্থিক ফলাফলের উৎসের কোন প্রমাণ নেই। সবচেয়ে অর্থবহ পরবর্তী প্রমাণ হবে উৎস ডেটাতে নিয়ন্ত্রিত পরিবর্তন, মানব নিরীক্ষা অধ্যয়ন এবং মূল তথ্য পর্যালোচনাকারীদের ভুল, অসম্পূর্ণ বা সত্তা-অমিল মডেল আউটপুট ধরতে সাহায্য করে কিনা তার মূল্যায়ন সহ স্বাধীন পরীক্ষা।

সম্পর্কিত গাইড এবং কুইজ

ChatGPT ও এলএলএমএআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রএআই প্রশিক্ষণআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?