কি হয়েছে
একটি নতুন arXiv প্রিপ্রিন্ট নলেজ-ড্রিভেন অ্যানালিটিক্স ফ্রেমওয়ার্ক উপস্থাপন করে, এন্টারপ্রাইজ ফাইন্যান্সে বৃহৎ ভাষা মডেল বিশ্লেষণকে অডিট করা সহজ করার জন্য একটি অন্টোলজি-ভিত্তিক পদ্ধতি। সিস্টেমটি সম্পর্কের ধরন, আত্মবিশ্বাসের তথ্য এবং উৎসের বংশকে পুনরুদ্ধার করা তথ্যের সাথে সংযুক্ত করে।
21 অগাস্ট arXiv-এ জমা দেওয়া কাগজটি এন্টারপ্রাইজ ফাইন্যান্সে পুনরুদ্ধার-বর্ধিত প্রজন্মের জন্য জ্ঞান-চালিত অ্যানালিটিক্স ফ্রেমওয়ার্ক বা KDAF বর্ণনা করে। এর বিবৃত ফোকাস হল আর্থিক পরিকল্পনা এবং বিশ্লেষণ এবং অন্যান্য নিয়ন্ত্রিত কর্মপ্রবাহ যেখানে ব্যবহারকারীদের নিশ্চিত করতে হবে যে সত্যের পরে একটি উত্তর কোথা থেকে এসেছে। কাঠামোটি ছয়টি পুনরাবৃত্তিমূলক পর্যায়ের মাধ্যমে একটি অন্টোলজি-চালিত জ্ঞান সিস্টেম তৈরি করে এবং প্রসঙ্গ-সচেতন প্রাসঙ্গিক প্রচার বা CARP নামে একটি পুনরুদ্ধার পদ্ধতি ব্যবহার করে।
কাগজ অনুসারে, প্রতিটি পুনরুদ্ধার করা তথ্য তিন ধরণের তথ্য বহন করে: এর সম্পর্কের ধরন, একটি আস্থার মান এবং একটি উত্স বংশ। উদ্দেশ্য হল পুনরুদ্ধার করা প্যাসেজগুলিকে একটি আলাদা প্রসঙ্গ উইন্ডো হিসাবে বিবেচনা করার পরিবর্তে প্রমাণ কাঠামোকে সুস্পষ্ট করা। কাগজে আরও বলা হয়েছে যে লেখকরা কনফিগারেশন, একটি অন্টোলজি স্কিমা, প্রম্পট, অডিট রিপোর্ট এবং পুনর্গঠন স্ক্রিপ্ট জমা দিয়েছেন, যদিও এখানে দেওয়া উৎসটি স্বাধীনভাবে আর্টিফ্যাক্টটি যাচাই করে না বা এর ব্যবহারযোগ্যতা বর্ণনা করে না।
মূল্যায়নে FinanceBench থেকে 145টি প্রশ্ন ব্যবহার করা হয়েছে এবং KDAF-কে শূন্য-প্রসঙ্গ অনুমান, BM25 পুনরুদ্ধার, ধারণা-ভারিত আভিধানিক পুনরুদ্ধার এবং ভিত্তিহীন গ্রাফ ট্রাভার্সালের সাথে তুলনা করা হয়েছে। কাগজটি রিপোর্ট করেছে যে শূন্য-প্রসঙ্গ অনুমান 4.1% সঠিকতা অর্জন করেছে, যখন পুনরুদ্ধার-বর্ধিত শর্তগুলি প্রায় 10% থেকে 12% পর্যন্ত পৌঁছেছে। এটি সংকীর্ণ উপসংহারকে সমর্থন করে যে প্রমাণ পুনরুদ্ধার করা এই পরীক্ষার জন্য গুরুত্বপূর্ণ ছিল, তবে এটি প্রতিষ্ঠিত করে না যে KDAF প্রতিটি আর্থিক কাজের জন্য বিস্তৃতভাবে উচ্চতর।
মূল ফলাফল হল উত্তরের সঠিকতা এবং নিরীক্ষাযোগ্যতার মধ্যে একটি বিচ্ছেদ। কাগজটি রিপোর্ট করেছে যে KDAF এবং BM25 উত্তরের সঠিকতার ক্ষেত্রে পরিসংখ্যানগতভাবে আলাদা করা যায় না, -0.007 এর রিপোর্ট করা পার্থক্য এবং -0.021 থেকে 0.000 পর্যন্ত একটি 95% আত্মবিশ্বাসের ব্যবধান। উদ্ধৃতি ট্র্যাসেবিলিটি এফ1-এ, তবে, KDAF 0.515 স্কোর করেছে, 0.027 এবং BM25 0.052 দ্বারা অগ্রাউন্ডেড ট্রাভার্সাল অতিক্রম করেছে, আত্মবিশ্বাসের ব্যবধান শূন্য বাদ দিয়ে। গবেষণাপত্রটি আরও রিপোর্ট করে যে 426 গ্রাফ-গঠিত পুনরুদ্ধার আইটেমগুলির মধ্যে কোনটিই প্রশ্নের বিষয় সত্তার বাইরে থেকে আসেনি, যেখানে আভিধানিক বেসলাইনের জন্য 16.8% এবং 20.2% এর তুলনায়, এবং প্রতিটি নির্বাচিত আইটেম একটি সম্পূর্ণ মূল শৃঙ্খলে সমাধান করেছে।
কেন এটা গুরুত্বপূর্ণ
কাগজটি আর্থিক পরিকল্পনা এবং বিশ্লেষণ এবং অন্যান্য নিয়ন্ত্রিত কর্মপ্রবাহে ভাষার মডেলগুলি ব্যবহার করার ক্ষেত্রে একটি ব্যবহারিক বাধাকে সম্বোধন করে: একটি উত্তর সাবলীল হলেও অব্যবহারযোগ্য হতে পারে যদি এর প্রমাণ পুনর্গঠন করা না যায়। ফলাফলগুলি পরামর্শ দেয় যে উত্তরের নির্ভুলতা না থাকলেও নিরীক্ষাযোগ্যতা উন্নত হতে পারে।
ব্যবহারিক সমস্যাটি ভাষা মডেলগুলির সাথে পরীক্ষা করা সংস্থাগুলির সাথে পরিচিত: একটি সিস্টেম অডিটরকে অন্তর্নিহিত রেকর্ডগুলিতে ফিরে আসার একটি নির্ভরযোগ্য পথ না দিয়ে একটি যুক্তিসঙ্গত আর্থিক ব্যাখ্যা তৈরি করতে পারে। নিয়ন্ত্রিত বা আর্থিকভাবে ফলপ্রসূ কাজের ক্ষেত্রে, সেই দুর্বলতা পর্যালোচনা, ত্রুটি সংশোধন, জবাবদিহিতা এবং কীভাবে একটি আউটপুট উত্পাদিত হয়েছিল তা ব্যাখ্যা করার ক্ষমতাকে প্রভাবিত করে। কাগজটি তাই ট্রেসেবিলিটিকে একটি স্বতন্ত্র সিস্টেমের সম্পত্তি হিসাবে বিবেচনা করে যে আরও ভাল পুনরুদ্ধারের অর্থ স্বয়ংক্রিয়ভাবে আরও ভাল উত্তর।
রিপোর্ট করা ফলাফলগুলি একটি সাধারণ মূল্যায়ন শর্টকাটকে চ্যালেঞ্জ করে। যদি সিস্টেমগুলিকে প্রধানত উত্তরের নির্ভুলতার সাথে তুলনা করা হয়, তবে এই কাগজের কাঠামোগত পদ্ধতিটি পরীক্ষিত বেঞ্চমার্কে এর অতিরিক্ত জটিলতাকে স্পষ্টভাবে সমর্থন করবে না। এর রিপোর্ট করা নির্ভুলতা পরিসংখ্যানগতভাবে BM25 এর মতো, একটি সহজ আভিধানিক পুনরুদ্ধার পদ্ধতি। দাবিকৃত সুবিধাটি প্রমাণের পথের পরিবর্তে নিহিত: সত্তার সম্পর্ক এবং উত্স সংরক্ষণ করা আউটপুটগুলিকে আরও পরিদর্শনযোগ্য করে তুলতে পারে এমনকি যখন এটি তাদের আরও বাস্তবগতভাবে সঠিক করে না।
এন্টারপ্রাইজ AI এর চারপাশে কত পরিকাঠামো তৈরি করতে হবে তা সিদ্ধান্ত নেওয়া দলগুলির জন্য এই পার্থক্যটি গুরুত্বপূর্ণ হতে পারে। উদ্ভবের জন্য পরিকল্পিত একটি পুনরুদ্ধার ব্যবস্থা পর্যালোচকদের একটি দাবির উত্স এবং সুযোগ সনাক্ত করতে, ভুল সত্তার অন্তর্গত প্রমাণ সনাক্ত করতে এবং একটি মডেল দ্বারা ব্যবহৃত উপকরণগুলি পুনর্গঠন করতে সহায়তা করতে পারে। এই ক্ষমতাগুলি অর্থের ক্ষেত্রে মূল্যবান হতে পারে, কিন্তু উত্সটি দেখায় না যে KDAF আর্থিক ক্ষতি হ্রাস করেছে, অডিট সংক্ষিপ্ত করেছে, উন্নত সিদ্ধান্ত নিয়েছে বা একটি আনুষ্ঠানিক সম্মতি মূল্যায়ন পাস করেছে।
কাগজটি একটি সার্বজনীন নির্ভুলতা সমাধান হিসাবে কাঠামোগত পুনরুদ্ধারকে চিকিত্সা করার বিরুদ্ধে একটি দরকারী সতর্কতা প্রদান করে। এর নিজস্ব নেতিবাচক ফলাফল বলে যে অন্টোলজি গ্রাউন্ডিং উত্তরের সঠিকতার উপর নয়, অডিটবিলিটি অক্ষের উপর তার রিপোর্ট করা খরচ অর্জন করেছে। এটি গবেষণাকে ক্রয় এবং পরিচালনার সিদ্ধান্তগুলির সাথে প্রাসঙ্গিক করে তোলে: সংস্থাগুলিকে যাচাইযোগ্য আউটপুটগুলির ফলাফলের উপর ভিত্তি করে সিস্টেমগুলি বেছে নেওয়ার প্রয়োজন হতে পারে, পৃথকভাবে বাস্তব কার্যকারিতা, কভারেজ, বিলম্ব, রক্ষণাবেক্ষণের প্রয়োজনীয়তা এবং মোট খরচ পরীক্ষা করার সময়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
What is a common training objective for an autoregressive language model?
পরবর্তী কি দেখতে
কাজটি একটি লেখক-প্রতিবেদিত প্রিপ্রিন্ট মূল্যায়ন, উৎপাদন স্থাপনার বা নিয়ন্ত্রক গ্রহণযোগ্যতার প্রমাণ নয়। ফলো-আপ টেস্টিং বৃহত্তর এবং আরও বৈচিত্রপূর্ণ আর্থিক ডেটাসেট, উৎস নথি পরিবর্তন, প্রকৃত ব্যবহারকারীর কর্মপ্রবাহ, কর্মক্ষম খরচ এবং মানব নিরীক্ষকরা নির্ভরযোগ্যভাবে মূল তথ্য ব্যবহার করতে পারে কিনা তা পরীক্ষা করা উচিত।
তাৎক্ষণিক প্রশ্ন হল রিপোর্ট ট্রেসেবিলিটি সুবিধা 145-প্রশ্নের ফাইন্যান্সবেঞ্চ মূল্যায়নের বাইরে টিকে আছে কিনা। ভবিষ্যত কাজ আরও কোম্পানি পরীক্ষা করা উচিত, রিপোর্টিং সময়কাল, অ্যাকাউন্টিং প্রসঙ্গ, নথি বিন্যাস এবং প্রশ্নের ধরন, অস্পষ্ট সত্তা বা অসম্পূর্ণ রেকর্ড জড়িত প্রশ্ন সহ। উত্সটি প্রতিষ্ঠিত করে না যে KDAF কিভাবে কার্য সম্পাদন করে যখন প্রামাণিক উত্সগুলি একমত না হয়, ত্রুটি থাকে বা উত্তর তৈরি হওয়ার পরে পরিবর্তন হয়।
আর্টিফ্যাক্ট ডিপোজিট কাজটিকে পুনরুত্পাদন করা সহজ করে তুলতে পারে, তবে সরবরাহকৃত উত্স থেকে এর ব্যবহারিক মূল্য অজানা থেকে যায়। পুনর্গঠন স্ক্রিপ্টগুলি সাধারণ এন্টারপ্রাইজ পরিবেশে চলে কিনা, কতটা ম্যানুয়াল অন্টোলজি নির্মাণের প্রয়োজন, বা কত ঘন ঘন জ্ঞান সিস্টেম আপডেট করা আবশ্যক তা স্পষ্ট নয়। এই বিবরণগুলি নির্ধারণ করবে যে পদ্ধতিটি অর্থ দলগুলির জন্য একটি ব্যবহারযোগ্য নিয়ন্ত্রণ নাকি প্রধানত একটি গবেষণা প্রোটোটাইপ।
অপারেশনাল ট্রেডঅফেরও পরিমাপ প্রয়োজন। উৎসটি স্থাপনার খরচ, প্রতিক্রিয়ার সময়, স্টোরেজ প্রয়োজনীয়তা, মডেলের বিশদ বিবরণ, কর্মীদের প্রয়োজন বা অন্যান্য উদ্ভব-সংরক্ষণকারী পুনরুদ্ধার সিস্টেমের সাথে তুলনা প্রদান করে না। এটাও দেখায় না যে রিপোর্ট করা আত্মবিশ্বাসের মানগুলি ক্যালিব্রেট করা হয়েছে কিনা, ব্যবহারকারীরা সেগুলি সঠিকভাবে বোঝে কিনা বা একটি সম্পূর্ণ প্রোভেনেন্স চেইন গ্যারান্টি দেয় যে উদ্ধৃত প্রমাণগুলি আসলে উত্পন্ন দাবিকে সমর্থন করে।
অবশেষে, কাগজটি একটি প্রিপ্রিন্ট এবং এটির লেখকদের নিজস্ব মূল্যায়ন থেকে ফলাফল উপস্থাপন করে। স্বাধীন প্রতিলিপি, উৎপাদন গ্রহণ, নিয়ন্ত্রক অনুমোদন বা উন্নত বাস্তব-বিশ্বের আর্থিক ফলাফলের উৎসের কোন প্রমাণ নেই। সবচেয়ে অর্থবহ পরবর্তী প্রমাণ হবে উৎস ডেটাতে নিয়ন্ত্রিত পরিবর্তন, মানব নিরীক্ষা অধ্যয়ন এবং মূল তথ্য পর্যালোচনাকারীদের ভুল, অসম্পূর্ণ বা সত্তা-অমিল মডেল আউটপুট ধরতে সাহায্য করে কিনা তার মূল্যায়ন সহ স্বাধীন পরীক্ষা।