কি হয়েছে
গবেষকরা বুট-এন্ড-ফিডব্যাক বা BooF প্রস্তাব করেছেন, একটি কাঠামো যেখানে একটি মাল্টিমডাল বৃহৎ ভাষা মডেল স্তন আল্ট্রাসাউন্ড অনুসন্ধানের ডোমেন-নির্দেশিত বিবরণ তৈরি করে এবং একজন দৃষ্টি বিশেষজ্ঞ ভিজ্যুয়াল বৈশিষ্ট্যগুলির পাশাপাশি সেই প্রতিক্রিয়াটি ব্যবহার করে। কাগজটি রিপোর্ট করে যে BooF একাধিক স্তন-আল্ট্রাসাউন্ড ডেটাসেটে বিদ্যমান পদ্ধতিগুলিকে ছাড়িয়ে গেছে, যদিও সরবরাহকৃত উত্স সংখ্যাসূচক ফলাফল প্রদান করে না।
উত্সটি স্তন-ক্যান্সার নির্ণয়ের জন্য স্তন আল্ট্রাসাউন্ডকে ব্যাপকভাবে ব্যবহৃত হিসাবে বর্ণনা করে তবে অপারেটর-নির্ভর। এটি সাম্প্রতিক মাল্টিমোডাল বৃহৎ ভাষার মডেলগুলির একটি নির্দিষ্ট দুর্বলতা চিহ্নিত করে: তারা জাল বর্ণনা তৈরি করতে পারে কারণ তাদের যথেষ্ট ডোমেন জ্ঞান নেই। কাগজের মতে, এই বিবরণগুলি ডাউনস্ট্রিম বিশেষজ্ঞ মডেলগুলিকে বিভ্রান্ত করতে পারে এবং ক্লিনিকাল বৈধতাকে হ্রাস করতে পারে। এটি মেডিকেল ইমেজিং বা অটোমেশনের সাধারণ আলোচনার পরিবর্তে AI সিস্টেমকেই কাজের কেন্দ্রীয় বিষয় করে তোলে। কাগজটি arXiv-এ 25 অগাস্ট, 2026-এ জমা দেওয়া হিসাবে তালিকাভুক্ত করা হয়েছে এবং ICASSP 2026-কে এর প্রকাশনা স্থান হিসেবে চিহ্নিত করেছে।
উত্সটিতে একটি বিমূর্ত এবং গ্রন্থপঞ্জী তথ্য রয়েছে, তবে রিপোর্ট করা প্রভাবের আকারগুলি স্বাধীনভাবে মূল্যায়ন করার জন্য সম্পূর্ণ পরীক্ষামূলক টেবিল বা পদ্ধতিগুলি নেই। প্রস্তাবিত কাঠামোর দুটি নাম করা ধাপ রয়েছে। বুট পর্যায়ে, মাল্টিমোডাল ভাষা মডেল BI-RADS অভিধান দ্বারা পরিচালিত হয়, একটি প্রমিত শব্দভাণ্ডার যা স্তন-ইমেজিং ফলাফলগুলিকে বর্ণনা করতে ব্যবহৃত হয়, পাশাপাশি একজন দৃষ্টি বিশেষজ্ঞের প্রাথমিক সৌম্য-বনাম-ম্যালিগন্যান্ট ভবিষ্যদ্বাণীগুলির সাথে। উল্লিখিত উদ্দেশ্য হল সাধারণ-উদ্দেশ্য মডেলটিকে তার যুক্তির ক্ষমতাকে স্তন-আল্ট্রাসাউন্ড বিশ্লেষণে স্থানান্তর করতে সাহায্য করা এবং হ্যালুসিনেটেড বা অসমর্থিত বর্ণনাগুলি হ্রাস করা। বিমূর্ত এটি একটি নকশা উদ্দেশ্য এবং একটি রিপোর্ট প্রক্রিয়া হিসাবে উপস্থাপন; এটি প্রতিষ্ঠিত করে না যে প্রতিটি উত্পন্ন বিবরণ চিকিৎসাগতভাবে সঠিক বা হ্যালুসিনেশন দূর করা হয়েছে। ফিডব্যাক স্টেজে, মডেলের বর্ণনাগুলিকে চাক্ষুষ বৈশিষ্ট্যের সাথে একত্রিত করা হয় যাকে লেখকরা একটি লাইটওয়েট অ্যাটেনশন-গেটেড ক্রস-মোডালিটি ফিউশন মডিউল বলে। বিশেষজ্ঞ মডেলটি অভিযোজিতভাবে শব্দ ফিল্টার করার সময় পাঠ্য প্রতিক্রিয়া ব্যবহার করার উদ্দেশ্যে করা হয়েছে। ব্যবহারিক পরিভাষায়, সিস্টেমটিকে একটি ভাষা মডেলের সাথে চিত্র-ভিত্তিক বিশেষজ্ঞের প্রতিস্থাপন হিসাবে বর্ণনা করা হয় না। পরিবর্তে, এটি একটি মঞ্চস্থ মিথস্ক্রিয়া তৈরি করে যেখানে একটি সাধারণবাদী মডেল কাঠামোগত ভাষা সরবরাহ করে এবং একটি বিশেষজ্ঞ মডেল সিদ্ধান্ত নেয় যে চিত্রের প্রমাণের সাথে কতটা তথ্য অন্তর্ভুক্ত করা হবে। উত্সটি মডেলের নাম, প্রশিক্ষণ-ডেটা উত্স, হার্ডওয়্যার, অনুমান সময় বা স্থাপনের প্রয়োজনীয়তাগুলি উল্লেখ করে না।
লেখকরা রিপোর্ট করেছেন যে একাধিক স্তন-আল্ট্রাসাউন্ড ডেটাসেটের ব্যাপক পরীক্ষাগুলি দেখায় যে BooF নির্ণয়ের সঠিকতা এবং ব্যাখ্যাযোগ্যতার ক্ষেত্রে অত্যাধুনিক পদ্ধতিগুলিকে উল্লেখযোগ্যভাবে ছাড়িয়ে যাচ্ছে। এগুলি কাগজের দ্বারা করা দাবি, সরবরাহকৃত উপাদানে স্বাধীনভাবে প্রতিষ্ঠিত ফলাফল নয়। কোন সংখ্যাগত নির্ভুলতা, সংবেদনশীলতা, নির্দিষ্টতা, বক্ররেখার অধীনে এলাকা, ব্যাখ্যাযোগ্যতা পরিমাপ, আত্মবিশ্বাসের ব্যবধান বা বেসলাইন তালিকা অন্তর্ভুক্ত করা হয় না। ডেটাসেটগুলি পূর্ববর্তী ছিল কিনা, কীভাবে লেবেলগুলি বরাদ্দ করা হয়েছিল, ছবিগুলি বিভিন্ন প্রতিষ্ঠান থেকে এসেছে কিনা, বা ক্লিনিকাল অনুশীলনে সম্ভাব্যভাবে কোনও মূল্যায়ন করা হয়েছিল কিনা তাও বিমূর্তটি বলে না। তাৎক্ষণিক তাৎপর্য হল যে কাজটি মেডিকেল এআই-তে একটি কংক্রিট ব্যর্থতার মোডকে লক্ষ্য করে: একটি সিস্টেম দৃশ্যমান ফলাফলগুলি বর্ণনা করার সময় স্পষ্টভাবে প্রদর্শিত হতে পারে যা আসলে উপস্থিত নয়। স্তনের আল্ট্রাসাউন্ডে, যেখানে ছবির গুণমান, অপারেটর কৌশল এবং ক্ষতের চেহারা পরিবর্তিত হতে পারে, অসমর্থিত ভাষা একজন চিকিত্সকের মনোযোগ বা আত্মবিশ্বাসকে বিকৃত করতে পারে। কাগজের স্থাপত্যটি ভাষা উপাদানটিকে ইতিমধ্যেই টাস্কের সাথে আবদ্ধ দুটি সীমাবদ্ধতার জন্য জবাবদিহি করার চেষ্টা করে: একটি ডোমেন অভিধান এবং একটি দৃষ্টি মডেল থেকে প্রাথমিক ভবিষ্যদ্বাণী। এটি একটি ইমেজিং ওয়ার্কফ্লোতে একটি চ্যাটবট যোগ করার চেয়ে আরও নির্দিষ্ট হস্তক্ষেপ।
কাঠামোটি মাল্টিমোডাল মেডিকেল এআই-এর জন্য একটি বিস্তৃত নকশা প্রশ্নও প্রতিফলিত করে: কীভাবে সাধারণ-উদ্দেশ্য যুক্তি সংকীর্ণ, কার্য-নির্দিষ্ট দক্ষতার সাথে মিলিত হওয়া উচিত? BooF দুটি উপাদানে বিভিন্ন ফাংশন বরাদ্দ করে। মাল্টিমোডাল ভাষা মডেলটি বর্ণনা তৈরি করতে এবং সাধারণ যুক্তি স্থানান্তর করতে ব্যবহৃত হয়, যখন বিশেষজ্ঞ মডেলটি ভিজ্যুয়াল বৈশিষ্ট্যের সাথে সংযুক্ত থাকে এবং পাঠ্য সংকেত গেট করতে পারে। যদি রিপোর্ট করা আচরণটি পুনরুত্পাদনযোগ্য হয়, তবে এটি অন্তর্নিহিত চিত্র প্রমাণের উপর আধিপত্য তৈরি করা পাঠ্যকে অনুমতি না দিয়ে পাঠ্য ব্যাখ্যার সাথে যুক্ত কিছু ব্যাখ্যাযোগ্যতা অর্জনের একটি উপায় সরবরাহ করতে পারে। তবুও, উত্সটি দেখায় না যে একটি ব্যাখ্যা মডেলের প্রকৃত সিদ্ধান্ত প্রক্রিয়ার প্রতি বিশ্বস্ত বা রেডিওলজিস্টের জন্য দরকারী। ব্যাখ্যাযোগ্যতা শব্দটি বিশেষজ্ঞের বর্ণনার সাথে চুক্তি, ফলাফলের স্থানীয়করণ, পাঠক অধ্যয়নে উপযোগিতা বা বিভ্রান্তির অধীনে ধারাবাহিকতা সহ বিভিন্ন পরিমাপকে নির্দেশ করতে পারে। কাগজের সংজ্ঞা এবং মূল্যায়ন প্রোটোকল ছাড়া, রিপোর্ট করা উন্নতি একটি নির্দিষ্ট ক্লিনিকাল সুবিধার মধ্যে অনুবাদ করা যাবে না। একই সীমাবদ্ধতা নির্ভুলতার ক্ষেত্রে প্রযোজ্য: একটি বেঞ্চমার্ক উন্নতি কম মিস করা ক্যান্সার, কম অপ্রয়োজনীয় বায়োপসি বা রুটিন কেয়ারে আরও ভাল সিদ্ধান্ত বোঝাতে পারে না। যদি পদ্ধতিটি শেষ পর্যন্ত তার মূল ডেটাসেটের বাইরে যাচাই করা হয়, তবে এটি স্তন-আল্ট্রাসাউন্ড ব্যাখ্যার জন্য এআই সহায়তা মূল্যায়নকারী হাসপাতালের জন্য প্রাসঙ্গিক হতে পারে। সীমাবদ্ধ পাঠ্য যুক্তির সাথে চিত্র প্রমাণকে একত্রিত করে এমন একটি সিস্টেম কাঠামোগত পর্যালোচনা, দ্বিতীয় পাঠ বা শিক্ষাগত প্রতিক্রিয়া সমর্থন করতে পারে। কিন্তু এই ব্যবহারের জন্য মিথ্যা নেতিবাচক, মিথ্যা ইতিবাচক, ক্রমাঙ্কন, উপগোষ্ঠীর কর্মক্ষমতা এবং ক্লিনিশিয়ানের আচরণের উপর প্রভাব সম্পর্কে প্রমাণের প্রয়োজন হবে। চূড়ান্ত সিদ্ধান্তের জন্য তাদের স্পষ্ট দায়িত্বও প্রয়োজন। সরবরাহকৃত উত্সটি সেই প্রমাণগুলির কোনটিই প্রদান করে না, তাই বর্তমানে এর জনসাধারণের প্রভাব একটি প্রদর্শিত ক্লিনিকাল স্থাপনার পরিবর্তে একটি গবেষণা ফলাফল হিসাবে।
পরবর্তী গুরুত্বপূর্ণ প্রমাণ হল সম্পূর্ণ ICASSP কাগজ এবং এর পরীক্ষামূলক বিবরণ। পাঠকদের ডেটাসেটের নাম, নমুনা গণনা, রোগী-স্তরের ট্রেন-পরীক্ষা বিচ্ছেদ, বাহ্যিক বৈধতা, শ্রেণির ভারসাম্য, প্রিপ্রসেসিং, তুলনা বেসলাইন এবং উল্লেখযোগ্য উন্নতির দাবির পিছনে সঠিক মেট্রিকগুলি সন্ধান করা উচিত। প্রশিক্ষণের সময় প্রতিনিধিত্ব করা হয়নি এমন প্রতিষ্ঠান বা ডিভাইস থেকে আল্ট্রাসাউন্ড চিত্রগুলিতে মডেলটি মূল্যায়ন করা হয়েছিল কিনা তাও গুরুত্বপূর্ণ। যদি একাধিক ডেটাসেট শুধুমাত্র অভ্যন্তরীণ পরীক্ষার জন্য ব্যবহার করা হয় বা অনুরূপ উত্স ভাগ করা হয়, তাহলে আপাত সাধারণীকরণ বিমূর্ত প্রস্তাবের চেয়ে সংকীর্ণ হতে পারে। স্বাধীন প্রতিলিপির পরীক্ষা করা উচিত যে লাভগুলি বুট-এবং-ফিডব্যাক ডিজাইন থেকে এসেছে নাকি প্রশিক্ষণ, প্রম্পট, ডেটা পরিষ্কার বা মূল্যায়নের পার্থক্য থেকে এসেছে। দরকারী অধ্যয়নগুলি BI-RADS নির্দেশিকা, প্রাথমিক বিশেষজ্ঞের ভবিষ্যদ্বাণী, প্রতিক্রিয়া মডিউল বা ভাষা মডেলকে সরিয়ে দেয় এমন সংস্করণগুলির সাথে সম্পূর্ণ সিস্টেমের তুলনা করবে। তাদেরও পরিমাপ করা উচিত কখন ভাষা মডেলটি ভুল, কত ঘন ঘন বিশেষজ্ঞ গেট তার প্রতিক্রিয়া প্রত্যাখ্যান করে এবং উভয় উপাদান একই ত্রুটি ভাগ করলে সিস্টেমটি অতিরিক্ত আত্মবিশ্বাসী হয়ে ওঠে কিনা। একটি পাঠক অধ্যয়ন মূল্যায়ন করতে পারে যে ব্যাখ্যাগুলি ডায়গনিস্টিক সিদ্ধান্তগুলিকে উন্নত করে নাকি আউটপুটগুলিকে আরও প্ররোচিত করে তোলে। ক্লিনিকাল মূল্যায়ন পূর্ববর্তী বেঞ্চমার্ক নির্ভুলতার বাইরে যেতে হবে। সম্ভাব্য অধ্যয়নগুলি অপারেটর, হাসপাতাল, আল্ট্রাসাউন্ড সরঞ্জাম এবং রোগীর জনসংখ্যার জুড়ে কর্মক্ষমতা পরীক্ষা করতে পারে, কর্মপ্রবাহের সময় এবং চিকিত্সকদের সাথে মতবিরোধ পর্যবেক্ষণ করার সময়। বিশেষ মনোযোগ বিরল বা অস্পষ্ট অনুসন্ধানে যাওয়া উচিত, যেখানে একটি সাবলীল কিন্তু ভুল বর্ণনা বিশেষত ক্ষতিকারক হতে পারে। উত্সটি নিয়ন্ত্রক অবস্থা, স্থাপনার পরিকল্পনা, রোগীর ফলাফল, গোপনীয়তা সুরক্ষা বা প্রাপ্যতা সম্পর্কে রিপোর্ট করে না, তাই কনফারেন্সের কার্যপ্রণালী প্রসঙ্গে কাগজের প্রকাশনা থেকে সেগুলির কোনওটিই অনুমান করা উচিত নয়। মেডিকেল-ইমেজিং সিস্টেমগুলি কীভাবে অনিশ্চয়তাকে সংজ্ঞায়িত করে এবং যোগাযোগ করে তাও দেখার মতো। BooF শোরগোল পাঠ্য প্রতিক্রিয়া ফিল্টার করার জন্য ডিজাইন করা হয়েছে, তবে বিমূর্তটি বলে না যে এটি এড়িয়ে যেতে পারে, মানুষের পর্যালোচনার অনুরোধ করতে পারে বা মডেলের অনিশ্চয়তা থেকে চিত্রের সীমাবদ্ধতাগুলিকে আলাদা করতে পারে। ভবিষ্যত রিপোর্টিং সেই আচরণগুলিকে দৃশ্যমান করে তুলবে এবং ডিস্ট্রিবিউশন শিফটের অধীনে তাদের পরীক্ষা করবে। যতক্ষণ না এই ধরনের প্রমাণ পাওয়া যায়, BooF একটি গবেষণা পত্রে রিপোর্ট করা একটি প্রতিশ্রুতিশীল আর্কিটেকচার হিসাবে ভালভাবে বোঝা যায়, একটি ক্লিনিক্যালি যাচাইকৃত ডায়াগনস্টিক পণ্য হিসাবে নয়।
কেন এটা গুরুত্বপূর্ণ
স্তন আল্ট্রাসাউন্ড ব্যাখ্যা অপারেটরের অভিজ্ঞতার সাথে পরিবর্তিত হতে পারে, এবং AI সিস্টেম যা অসমর্থিত বর্ণনা তৈরি করে অতিরিক্ত ক্লিনিকাল ঝুঁকি তৈরি করতে পারে। BooF BI-RADS অভিধান এবং প্রাথমিক বিশেষজ্ঞের ভবিষ্যদ্বাণীগুলির সাথে ভাষা-মডেল আউটপুটকে সীমাবদ্ধ করে উভয় সমস্যার সমাধান করে, তারপর এটি নির্ণয়কে প্রভাবিত করার আগে ফলাফলের পাঠ্য প্রতিক্রিয়া ফিল্টার করে।
অপারেটরের অভিজ্ঞতা স্তন-আল্ট্রাসাউন্ড ব্যাখ্যাকে প্রভাবিত করতে পারে, যখন অসমর্থিত AI বিবরণ ক্লিনিকাল ঝুঁকি যোগ করতে পারে।
BooF BI-RADS এবং প্রাথমিক বিশেষজ্ঞের পূর্বাভাস দিয়ে আউটপুট সীমাবদ্ধ করে, তারপর নির্ণয়ের আগে পাঠ্য প্রতিক্রিয়া ফিল্টার করে।
উত্সটি ক্লিনিকাল সুবিধা, বিশ্বস্ত ব্যাখ্যা, কম মিস করা ক্যান্সার বা কম অপ্রয়োজনীয় বায়োপসি স্থাপন করে না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
মূল প্রশ্নগুলি হল রিপোর্ট করা লাভগুলি হাসপাতাল, ডিভাইস, রোগীর জনসংখ্যা এবং চিকিত্সক জুড়ে রয়েছে কিনা এবং সিস্টেমটি কেবল বেঞ্চমার্ক স্কোরের পরিবর্তে সিদ্ধান্তগুলিকে উন্নত করে কিনা। উত্সটি সম্ভাব্য ক্লিনিকাল সুবিধা, নিয়ন্ত্রক ছাড়পত্র, স্থাপনা, রোগীর ফলাফল বা মূল্যায়ন করা ডেটাসেটের আকার এবং গঠন স্থাপন করে না।
ডেটাসেটের নাম, নমুনা গণনা, রোগী-স্তরের বিচ্ছেদ, বাহ্যিক বৈধতা, শ্রেণির ভারসাম্য, বেসলাইন এবং সঠিক মেট্রিক্স পর্যালোচনা করুন।
পরীক্ষা হাসপাতাল, ডিভাইস, রোগীর জনসংখ্যা এবং চিকিত্সক সহ, অস্পষ্ট অনুসন্ধান এবং মডেল ভুল যেখানে মামলা.
উত্সটি নিয়ন্ত্রক অবস্থা, স্থাপনার পরিকল্পনা, রোগীর ফলাফল, গোপনীয়তা সুরক্ষা, প্রাপ্যতা বা অনিশ্চয়তা আচরণের প্রতিবেদন করে না।