কি হয়েছে
গবেষকরা দুটি আমেরিকান কলেজ অফ কার্ডিওলজি ন্যাশনাল কার্ডিওভাসকুলার ডেটা রেজিস্ট্রি সেটিংস থেকে প্রক্রিয়াবিহীন ইলেকট্রনিক মেডিকেল রেকর্ড ডেটা ব্যবহার করে ক্লিনিকাল রেজিস্ট্রি বিমূর্তকরণের উপর একটি বড় ভাষা মডেল মূল্যায়ন করেছেন। গবেষণাটি অস্পষ্টতা এবং তাদের উত্তর দেওয়ার জন্য প্রয়োজনীয় ক্লিনিকাল যুক্তির ভিত্তিতে রেজিস্ট্রি প্রশ্নগুলিকে ছয়টি বিভাগে সংগঠিত করেছিল।
কাগজটি, 25 আগস্ট arXiv-এ সংশোধিত হয়েছে, আমেরিকান কলেজ অফ কার্ডিওলজির ন্যাশনাল কার্ডিওভাসকুলার ডেটা রেজিস্ট্রি থেকে ক্লিনিকাল রেজিস্ট্রি প্রশ্ন জড়িত একটি পাইলট এবং একটি বৈধতা অধ্যয়নের প্রতিবেদন করেছে৷ একটি একাডেমিক মেডিকেল সেন্টারে পাইলটে, মডেলটি প্রতিটি রেজিস্ট্রি প্রশ্নের জন্য প্রার্থীর ডেটা উত্স চিহ্নিত করেছে। অভিজ্ঞ বিমূর্তকারীরা তারপর সেই ফলাফলগুলিকে প্রশ্ন-নির্দিষ্ট নথি সেটগুলিকে সংজ্ঞায়িত করতে ব্যবহার করেছিল। একটি দ্বিতীয় কেন্দ্রে বৈধতা গবেষণায়, একটি দ্বিতীয় ACC NCDR রেজিস্ট্রি ব্যবহার করে, মডেলটি সেই সেটগুলির প্রশ্নের উত্তর দিয়েছে। এই নকশাটি একটি সরলীকৃত, পূর্বনির্বাচিত ডেটা টেবিলের পরিবর্তে বিদ্যমান মেডিকেল-রেকর্ড উপাদান থেকে তথ্য আহরণ এবং ব্যাখ্যা করার উপর মূল্যায়নকে কেন্দ্রীভূত করেছে।
মডেল আউটপুট পর্যালোচনা করার আগে, দুটি বিমূর্তকারী স্বাধীনভাবে গ্রাউন্ড ট্রুথ প্রতিষ্ঠা করেছে এবং প্রতিটি প্রশ্ন ছয়টি বিভাগের একটিতে বরাদ্দ করেছে: ওষুধ/ইভেন্ট ফ্ল্যাগ, বাইনারি ক্লিনিকাল উপস্থিতি, প্রশাসনিক, পরিমাণগত পরীক্ষাগার/শারীরবৃত্তীয়, ক্লিনিকাল ব্যাখ্যা, এবং ইভেন্ট টাইমিং। বিভাগগুলি প্রতিটি প্রশ্নের সমাধান করার জন্য প্রয়োজনীয় অস্পষ্টতা এবং ক্লিনিকাল যুক্তি দ্বারা আদেশ করা হয়েছিল। কাগজটি 501টি পাইলট উত্তর এবং 4,214টি বৈধতা উত্তর সহ 9,430টি বিমূর্ত উত্তর 4,715টি ঐক্যমত্য উত্তরের সাথে মিলিত হয়েছে বলে প্রতিবেদন করেছে। পাইলটে, প্রার্থীর ডেটা উত্সের গড় সংখ্যা জনসংখ্যার জন্য 14.6 থেকে ইতিহাস এবং ঝুঁকির কারণগুলির জন্য 89.2 পর্যন্ত ছিল, রিপোর্ট করা স্ট্যান্ডার্ড বিচ্যুতিতে যথেষ্ট পার্থক্য প্রতিফলিত হয়।
বৈধতার ক্ষেত্রে, সমীক্ষা অনুসারে, মানুষের আন্তঃ-রেটার চুক্তি প্রায় 98% ছিল। 87% ক্ষেত্রে LLM-এর উত্তরগুলি সর্বসম্মতভাবে মিলেছে, 2%-এ আংশিক মিল হিসাবে শ্রেণীবদ্ধ করা হয়েছে, এবং 9%-এ মেলেনি। কাগজটি 157 টি প্রশ্ন জুড়ে 13.4% এর আদর্শ বিচ্যুতি সহ 91.5% এর গড় প্রশ্ন-স্তরের নির্ভুলতা রিপোর্ট করে যার প্রতিটিতে কমপক্ষে 20টি উত্তর ছিল। অস্পষ্টতা বিভাগ দ্বারা নির্ভুলতা পরিবর্তিত হয়, ওষুধ/ইভেন্ট ফ্ল্যাগ প্রশ্নগুলির জন্য 96% থেকে ইভেন্ট টাইমিং প্রশ্নগুলির জন্য 62% থেকে হ্রাস পেয়েছে৷ উত্সটি অধ্যয়নটিকে একটি প্রিপ্রিন্ট হিসাবে চিহ্নিত করে এবং বিমূর্তটিতে মূল্যায়ন করা মডেলটির নাম দেয় না।
কেন এটা গুরুত্বপূর্ণ
ফলাফলগুলি পরামর্শ দেয় যে গড় নির্ভুলতা স্বাস্থ্যসেবা AI-তে গুরুত্বপূর্ণ দুর্বলতাগুলি লুকিয়ে রাখতে পারে। মডেলটি তুলনামূলকভাবে সরাসরি ওষুধ এবং ইভেন্ট-পতাকা প্রশ্নে সর্বোত্তম পারফর্ম করেছে এবং সবচেয়ে খারাপ যখন এটিকে ক্লিনিকাল প্রেক্ষাপট ব্যাখ্যা করতে হয়েছিল বা কখন একটি ঘটনা ঘটেছে তা নির্ধারণ করতে হয়েছিল।
কেন্দ্রীয় অনুসন্ধানটি কেবল এই নয় যে একটি এলএলএম ত্রুটি করেছে। এটি হল যে কর্মক্ষমতা একটি কাঠামোগত উপায়ে হ্রাস পেয়েছে কারণ প্রশ্নগুলি আরও অস্পষ্ট হয়ে উঠেছে এবং আরও ক্লিনিকাল যুক্তি দাবি করেছে। 91.5% এর একটি একক সামগ্রিক নির্ভুলতা তাই অপারেশনাল ঝুঁকির একটি অসম্পূর্ণ চিত্র দিতে পারে। অনেক সহজবোধ্য ক্ষেত্র সমন্বিত একটি রেজিস্ট্রি ওয়ার্কফ্লো নির্ভরযোগ্য বলে মনে হতে পারে যখন এখনও প্রশ্নগুলির একটি ছোট সেটে খারাপভাবে কাজ করে যার জন্য প্রেক্ষাপট পুনর্গঠন, ক্লিনিকাল প্রমাণ ব্যাখ্যা করা বা সময়মতো একটি ইভেন্ট স্থাপন করা প্রয়োজন।
ক্লিনিকাল রেজিস্ট্রিগুলি গবেষণা, গুণমান পরিমাপ, বেঞ্চমার্কিং এবং অন্যান্য ধরণের স্বাস্থ্যসেবা রিপোর্টিং সমর্থন করে। বিমূর্তকরণে ত্রুটিগুলি সেই ডাউনস্ট্রিম রেকর্ডগুলির গুণমানকে প্রভাবিত করতে পারে এমনকি যখন সিস্টেমটি একটি রোগ নির্ণয় বা চিকিত্সার সুপারিশ করছে না। আনুমানিক 98% মানব চুক্তি এবং মডেলের নিম্ন সঠিক-ম্যাচ রেট এর মধ্যে রিপোর্ট করা ব্যবধান নির্দেশ করে যে এই কাজের জন্য মানব পর্যালোচনা গুরুত্বপূর্ণ রয়ে গেছে, বিশেষ করে যেখানে উত্তরটি একাধিক নথির উপর বা ঘটনাগুলির ক্রম ব্যাখ্যা করার উপর নির্ভর করে।
অধ্যয়নটি স্বাস্থ্যসেবা ভাষার মডেলগুলিকে মূল্যায়ন করার জন্য একটি ব্যবহারিক উপায়ও অফার করে: সমস্ত নিষ্কাশন কাজকে সমতুল্য হিসাবে বিবেচনা করার পরিবর্তে তাদের মধ্যে থাকা অস্পষ্টতার ধরণ অনুসারে প্রশ্নগুলিকে ভাগ করুন। এই পদ্ধতিটি সংস্থাগুলিকে সনাক্ত করতে সাহায্য করতে পারে কোন ক্ষেত্রগুলি সহায়তার জন্য উপযুক্ত এবং কোনটি ঘনিষ্ঠ পর্যালোচনার প্রয়োজন৷ উত্সটি দেখায় না যে মডেলটি রোগীর ক্ষতি করেছে, রেজিস্ট্রি ক্রিয়াকলাপ উন্নত করেছে, ব্যয় হ্রাস করেছে বা নিয়মিত যত্নে নিযুক্ত করা হয়েছিল। সেই ফলাফলগুলি অপ্রতিষ্ঠিত থাকে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
গবেষণায় ফলাফলগুলি অন্যান্য মডেল, হাসপাতাল, চিকিৎসা বিশেষত্ব, রেজিস্ট্রি বা ক্লিনিকাল সিদ্ধান্ত গ্রহণের জন্য সাধারণ করা হয় কিনা তা প্রতিষ্ঠিত করে না। আরও কাজের বৃহত্তর সেটিংস পরীক্ষা করা উচিত, মডেল সংস্করণগুলির তুলনা করা উচিত, আংশিক ত্রুটির ফলাফলগুলি পরীক্ষা করা উচিত এবং মানুষের পর্যালোচনা নির্ভরযোগ্যভাবে কঠিনতম ভুলগুলি ধরতে পারে কিনা তা মূল্যায়ন করা উচিত।
একটি কী অজানা হল ফলাফল কতটা ব্যাপকভাবে প্রযোজ্য। উত্সটি একটি একাডেমিক মেডিকেল সেন্টারে একজন পাইলট এবং অন্য একটি এসিসি এনসিডিআর রেজিস্ট্রি ব্যবহার করে একটি দ্বিতীয় কেন্দ্রে বৈধতা বর্ণনা করে, তবে এটি কমিউনিটি হাসপাতাল, অন্যান্য বিশেষত্ব, বিভিন্ন রেকর্ড সিস্টেম বা অন্যান্য রেজিস্ট্রি ডিজাইন সম্পর্কে বিমূর্ত প্রমাণ প্রদান করে না। মূল্যায়ন করা মডেলটিও বিমূর্তটিতে চিহ্নিত করা হয়নি। সাধারণত এলএলএম পারফরম্যান্স সম্পর্কে সিদ্ধান্ত নেওয়ার আগে মডেল এবং মডেল সংস্করণ জুড়ে তুলনা করা প্রয়োজন।
ভবিষ্যত মূল্যায়নের মোট সঠিক-মিল নির্ভুলতার চেয়ে বেশি রিপোর্ট করা উচিত। গুরুত্বপূর্ণ প্রশ্নগুলির মধ্যে রয়েছে আংশিক উত্তরগুলি চিকিত্সাগতভাবে ব্যবহারযোগ্য কিনা, কোন ধরনের ভুলগুলি সবচেয়ে সাধারণ, কতবার ত্রুটিগুলি তারিখ বা বিপরীত রেকর্ডগুলি জড়িত এবং পর্যালোচকরা ধারাবাহিকভাবে মডেলের ভুলগুলি সনাক্ত করতে পারে কিনা। অধ্যয়নের বিভাগ-স্তরের ফলাফলগুলি ইভেন্ট টাইমিংকে ফলো-আপের জন্য একটি বিশেষ গুরুত্বপূর্ণ ক্ষেত্র তৈরি করে, কিন্তু উত্সটি পৃথক প্রশ্ন, ত্রুটির উদাহরণ, বা ভুল উত্তরগুলির তীব্রতা নির্দিষ্ট করে না।
এটিও অজানা যে পাইলটে মডেলের প্রার্থী-উৎস নির্বাচন পরবর্তী বৈধতা কর্মপ্রবাহকে প্রভাবিত করেছে বা যখন নথি সেটগুলি অভিজ্ঞ বিমূর্তকারীদের দ্বারা কিউরেট করা হয় না তখন অনুরূপ কার্যকারিতা ঘটবে কিনা। আরও অধ্যয়ন সম্পূর্ণরূপে অপ্রক্রিয়াজাত রেকর্ড, মানব সহায়তার বিভিন্ন স্তর এবং বাস্তব রেজিস্ট্রি ক্রিয়াকলাপে সম্ভাব্য পর্যবেক্ষণ পরীক্ষা করতে পারে। যতক্ষণ না এই ধরনের প্রমাণ পাওয়া যায়, LLMগুলি ক্লিনিকাল অ্যাবস্ট্রাক্টরগুলিকে প্রতিস্থাপন করতে প্রস্তুত এমন একটি উপসংহারের পরিবর্তে অস্পষ্ট বিমূর্ত কাজের জন্য লক্ষ্যবস্তু মানব তত্ত্বাবধানকে সমর্থন করে। উৎসটি তাই খোলা রেখে দেয় যখন নথি নির্বাচন অভিজ্ঞ বিমূর্তকারীদের দ্বারা পরিচালিত না হয়, যখন রেকর্ডে বিভিন্ন স্তরের কাঠামো থাকে, বা যখন পর্যালোচকরা বিভিন্ন পয়েন্টে প্রক্রিয়ায় প্রবেশ করে তখন একই পদ্ধতির কার্যকারিতা কেমন হবে।