সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

সম্ভাব্য অধ্যয়ন দেখায় যে LLM নির্ভুলতা অস্পষ্ট ক্লিনিকাল রেজিস্ট্রি প্রশ্নগুলিতে তীব্রভাবে পড়ে

একটি মাল্টি-সাইট সম্ভাব্য সমীক্ষা রিপোর্ট করে যে একটি বৃহৎ ভাষা মডেল 87% মানব-সম্মত উত্তরের সাথে মিলেছে যখন প্রক্রিয়াবিহীন মেডিকেল রেকর্ড থেকে তথ্য বের করা হয়েছে, কিন্তু ইভেন্টের সময় এবং বৃহত্তর ক্লিনিকাল যুক্তির প্রয়োজনের প্রশ্নগুলির ক্ষেত্রে সঠিকতা 62%-এ নেমে এসেছে।

5 min readRead the primary source
Source-page capture accompanying Prospective study finds LLM accuracy falls sharply on ambiguous clinical registry questions
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.20373
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
স্থল সত্য
মডেল আউটপুট প্রশিক্ষণ বা মূল্যায়ন করতে ব্যবহৃত বিশ্বস্ত রেফারেন্স লেবেল।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা দুটি আমেরিকান কলেজ অফ কার্ডিওলজি ন্যাশনাল কার্ডিওভাসকুলার ডেটা রেজিস্ট্রি সেটিংস থেকে প্রক্রিয়াবিহীন ইলেকট্রনিক মেডিকেল রেকর্ড ডেটা ব্যবহার করে ক্লিনিকাল রেজিস্ট্রি বিমূর্তকরণের উপর একটি বড় ভাষা মডেল মূল্যায়ন করেছেন। গবেষণাটি অস্পষ্টতা এবং তাদের উত্তর দেওয়ার জন্য প্রয়োজনীয় ক্লিনিকাল যুক্তির ভিত্তিতে রেজিস্ট্রি প্রশ্নগুলিকে ছয়টি বিভাগে সংগঠিত করেছিল।

কাগজটি, 25 আগস্ট arXiv-এ সংশোধিত হয়েছে, আমেরিকান কলেজ অফ কার্ডিওলজির ন্যাশনাল কার্ডিওভাসকুলার ডেটা রেজিস্ট্রি থেকে ক্লিনিকাল রেজিস্ট্রি প্রশ্ন জড়িত একটি পাইলট এবং একটি বৈধতা অধ্যয়নের প্রতিবেদন করেছে৷ একটি একাডেমিক মেডিকেল সেন্টারে পাইলটে, মডেলটি প্রতিটি রেজিস্ট্রি প্রশ্নের জন্য প্রার্থীর ডেটা উত্স চিহ্নিত করেছে। অভিজ্ঞ বিমূর্তকারীরা তারপর সেই ফলাফলগুলিকে প্রশ্ন-নির্দিষ্ট নথি সেটগুলিকে সংজ্ঞায়িত করতে ব্যবহার করেছিল। একটি দ্বিতীয় কেন্দ্রে বৈধতা গবেষণায়, একটি দ্বিতীয় ACC NCDR রেজিস্ট্রি ব্যবহার করে, মডেলটি সেই সেটগুলির প্রশ্নের উত্তর দিয়েছে। এই নকশাটি একটি সরলীকৃত, পূর্বনির্বাচিত ডেটা টেবিলের পরিবর্তে বিদ্যমান মেডিকেল-রেকর্ড উপাদান থেকে তথ্য আহরণ এবং ব্যাখ্যা করার উপর মূল্যায়নকে কেন্দ্রীভূত করেছে।

মডেল আউটপুট পর্যালোচনা করার আগে, দুটি বিমূর্তকারী স্বাধীনভাবে গ্রাউন্ড ট্রুথ প্রতিষ্ঠা করেছে এবং প্রতিটি প্রশ্ন ছয়টি বিভাগের একটিতে বরাদ্দ করেছে: ওষুধ/ইভেন্ট ফ্ল্যাগ, বাইনারি ক্লিনিকাল উপস্থিতি, প্রশাসনিক, পরিমাণগত পরীক্ষাগার/শারীরবৃত্তীয়, ক্লিনিকাল ব্যাখ্যা, এবং ইভেন্ট টাইমিং। বিভাগগুলি প্রতিটি প্রশ্নের সমাধান করার জন্য প্রয়োজনীয় অস্পষ্টতা এবং ক্লিনিকাল যুক্তি দ্বারা আদেশ করা হয়েছিল। কাগজটি 501টি পাইলট উত্তর এবং 4,214টি বৈধতা উত্তর সহ 9,430টি বিমূর্ত উত্তর 4,715টি ঐক্যমত্য উত্তরের সাথে মিলিত হয়েছে বলে প্রতিবেদন করেছে। পাইলটে, প্রার্থীর ডেটা উত্সের গড় সংখ্যা জনসংখ্যার জন্য 14.6 থেকে ইতিহাস এবং ঝুঁকির কারণগুলির জন্য 89.2 পর্যন্ত ছিল, রিপোর্ট করা স্ট্যান্ডার্ড বিচ্যুতিতে যথেষ্ট পার্থক্য প্রতিফলিত হয়।

বৈধতার ক্ষেত্রে, সমীক্ষা অনুসারে, মানুষের আন্তঃ-রেটার চুক্তি প্রায় 98% ছিল। 87% ক্ষেত্রে LLM-এর উত্তরগুলি সর্বসম্মতভাবে মিলেছে, 2%-এ আংশিক মিল হিসাবে শ্রেণীবদ্ধ করা হয়েছে, এবং 9%-এ মেলেনি। কাগজটি 157 টি প্রশ্ন জুড়ে 13.4% এর আদর্শ বিচ্যুতি সহ 91.5% এর গড় প্রশ্ন-স্তরের নির্ভুলতা রিপোর্ট করে যার প্রতিটিতে কমপক্ষে 20টি উত্তর ছিল। অস্পষ্টতা বিভাগ দ্বারা নির্ভুলতা পরিবর্তিত হয়, ওষুধ/ইভেন্ট ফ্ল্যাগ প্রশ্নগুলির জন্য 96% থেকে ইভেন্ট টাইমিং প্রশ্নগুলির জন্য 62% থেকে হ্রাস পেয়েছে৷ উত্সটি অধ্যয়নটিকে একটি প্রিপ্রিন্ট হিসাবে চিহ্নিত করে এবং বিমূর্তটিতে মূল্যায়ন করা মডেলটির নাম দেয় না।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

ফলাফলগুলি পরামর্শ দেয় যে গড় নির্ভুলতা স্বাস্থ্যসেবা AI-তে গুরুত্বপূর্ণ দুর্বলতাগুলি লুকিয়ে রাখতে পারে। মডেলটি তুলনামূলকভাবে সরাসরি ওষুধ এবং ইভেন্ট-পতাকা প্রশ্নে সর্বোত্তম পারফর্ম করেছে এবং সবচেয়ে খারাপ যখন এটিকে ক্লিনিকাল প্রেক্ষাপট ব্যাখ্যা করতে হয়েছিল বা কখন একটি ঘটনা ঘটেছে তা নির্ধারণ করতে হয়েছিল।

কেন্দ্রীয় অনুসন্ধানটি কেবল এই নয় যে একটি এলএলএম ত্রুটি করেছে। এটি হল যে কর্মক্ষমতা একটি কাঠামোগত উপায়ে হ্রাস পেয়েছে কারণ প্রশ্নগুলি আরও অস্পষ্ট হয়ে উঠেছে এবং আরও ক্লিনিকাল যুক্তি দাবি করেছে। 91.5% এর একটি একক সামগ্রিক নির্ভুলতা তাই অপারেশনাল ঝুঁকির একটি অসম্পূর্ণ চিত্র দিতে পারে। অনেক সহজবোধ্য ক্ষেত্র সমন্বিত একটি রেজিস্ট্রি ওয়ার্কফ্লো নির্ভরযোগ্য বলে মনে হতে পারে যখন এখনও প্রশ্নগুলির একটি ছোট সেটে খারাপভাবে কাজ করে যার জন্য প্রেক্ষাপট পুনর্গঠন, ক্লিনিকাল প্রমাণ ব্যাখ্যা করা বা সময়মতো একটি ইভেন্ট স্থাপন করা প্রয়োজন।

ক্লিনিকাল রেজিস্ট্রিগুলি গবেষণা, গুণমান পরিমাপ, বেঞ্চমার্কিং এবং অন্যান্য ধরণের স্বাস্থ্যসেবা রিপোর্টিং সমর্থন করে। বিমূর্তকরণে ত্রুটিগুলি সেই ডাউনস্ট্রিম রেকর্ডগুলির গুণমানকে প্রভাবিত করতে পারে এমনকি যখন সিস্টেমটি একটি রোগ নির্ণয় বা চিকিত্সার সুপারিশ করছে না। আনুমানিক 98% মানব চুক্তি এবং মডেলের নিম্ন সঠিক-ম্যাচ রেট এর মধ্যে রিপোর্ট করা ব্যবধান নির্দেশ করে যে এই কাজের জন্য মানব পর্যালোচনা গুরুত্বপূর্ণ রয়ে গেছে, বিশেষ করে যেখানে উত্তরটি একাধিক নথির উপর বা ঘটনাগুলির ক্রম ব্যাখ্যা করার উপর নির্ভর করে।

অধ্যয়নটি স্বাস্থ্যসেবা ভাষার মডেলগুলিকে মূল্যায়ন করার জন্য একটি ব্যবহারিক উপায়ও অফার করে: সমস্ত নিষ্কাশন কাজকে সমতুল্য হিসাবে বিবেচনা করার পরিবর্তে তাদের মধ্যে থাকা অস্পষ্টতার ধরণ অনুসারে প্রশ্নগুলিকে ভাগ করুন। এই পদ্ধতিটি সংস্থাগুলিকে সনাক্ত করতে সাহায্য করতে পারে কোন ক্ষেত্রগুলি সহায়তার জন্য উপযুক্ত এবং কোনটি ঘনিষ্ঠ পর্যালোচনার প্রয়োজন৷ উত্সটি দেখায় না যে মডেলটি রোগীর ক্ষতি করেছে, রেজিস্ট্রি ক্রিয়াকলাপ উন্নত করেছে, ব্যয় হ্রাস করেছে বা নিয়মিত যত্নে নিযুক্ত করা হয়েছিল। সেই ফলাফলগুলি অপ্রতিষ্ঠিত থাকে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

গবেষণায় ফলাফলগুলি অন্যান্য মডেল, হাসপাতাল, চিকিৎসা বিশেষত্ব, রেজিস্ট্রি বা ক্লিনিকাল সিদ্ধান্ত গ্রহণের জন্য সাধারণ করা হয় কিনা তা প্রতিষ্ঠিত করে না। আরও কাজের বৃহত্তর সেটিংস পরীক্ষা করা উচিত, মডেল সংস্করণগুলির তুলনা করা উচিত, আংশিক ত্রুটির ফলাফলগুলি পরীক্ষা করা উচিত এবং মানুষের পর্যালোচনা নির্ভরযোগ্যভাবে কঠিনতম ভুলগুলি ধরতে পারে কিনা তা মূল্যায়ন করা উচিত।

একটি কী অজানা হল ফলাফল কতটা ব্যাপকভাবে প্রযোজ্য। উত্সটি একটি একাডেমিক মেডিকেল সেন্টারে একজন পাইলট এবং অন্য একটি এসিসি এনসিডিআর রেজিস্ট্রি ব্যবহার করে একটি দ্বিতীয় কেন্দ্রে বৈধতা বর্ণনা করে, তবে এটি কমিউনিটি হাসপাতাল, অন্যান্য বিশেষত্ব, বিভিন্ন রেকর্ড সিস্টেম বা অন্যান্য রেজিস্ট্রি ডিজাইন সম্পর্কে বিমূর্ত প্রমাণ প্রদান করে না। মূল্যায়ন করা মডেলটিও বিমূর্তটিতে চিহ্নিত করা হয়নি। সাধারণত এলএলএম পারফরম্যান্স সম্পর্কে সিদ্ধান্ত নেওয়ার আগে মডেল এবং মডেল সংস্করণ জুড়ে তুলনা করা প্রয়োজন।

ভবিষ্যত মূল্যায়নের মোট সঠিক-মিল নির্ভুলতার চেয়ে বেশি রিপোর্ট করা উচিত। গুরুত্বপূর্ণ প্রশ্নগুলির মধ্যে রয়েছে আংশিক উত্তরগুলি চিকিত্সাগতভাবে ব্যবহারযোগ্য কিনা, কোন ধরনের ভুলগুলি সবচেয়ে সাধারণ, কতবার ত্রুটিগুলি তারিখ বা বিপরীত রেকর্ডগুলি জড়িত এবং পর্যালোচকরা ধারাবাহিকভাবে মডেলের ভুলগুলি সনাক্ত করতে পারে কিনা। অধ্যয়নের বিভাগ-স্তরের ফলাফলগুলি ইভেন্ট টাইমিংকে ফলো-আপের জন্য একটি বিশেষ গুরুত্বপূর্ণ ক্ষেত্র তৈরি করে, কিন্তু উত্সটি পৃথক প্রশ্ন, ত্রুটির উদাহরণ, বা ভুল উত্তরগুলির তীব্রতা নির্দিষ্ট করে না।

এটিও অজানা যে পাইলটে মডেলের প্রার্থী-উৎস নির্বাচন পরবর্তী বৈধতা কর্মপ্রবাহকে প্রভাবিত করেছে বা যখন নথি সেটগুলি অভিজ্ঞ বিমূর্তকারীদের দ্বারা কিউরেট করা হয় না তখন অনুরূপ কার্যকারিতা ঘটবে কিনা। আরও অধ্যয়ন সম্পূর্ণরূপে অপ্রক্রিয়াজাত রেকর্ড, মানব সহায়তার বিভিন্ন স্তর এবং বাস্তব রেজিস্ট্রি ক্রিয়াকলাপে সম্ভাব্য পর্যবেক্ষণ পরীক্ষা করতে পারে। যতক্ষণ না এই ধরনের প্রমাণ পাওয়া যায়, LLMগুলি ক্লিনিকাল অ্যাবস্ট্রাক্টরগুলিকে প্রতিস্থাপন করতে প্রস্তুত এমন একটি উপসংহারের পরিবর্তে অস্পষ্ট বিমূর্ত কাজের জন্য লক্ষ্যবস্তু মানব তত্ত্বাবধানকে সমর্থন করে। উৎসটি তাই খোলা রেখে দেয় যখন নথি নির্বাচন অভিজ্ঞ বিমূর্তকারীদের দ্বারা পরিচালিত না হয়, যখন রেকর্ডে বিভিন্ন স্তরের কাঠামো থাকে, বা যখন পর্যালোচকরা বিভিন্ন পয়েন্টে প্রক্রিয়ায় প্রবেশ করে তখন একই পদ্ধতির কার্যকারিতা কেমন হবে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রএআই প্রশিক্ষণChatGPT ও এলএলএমআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?