সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

স্তন আল্ট্রাসাউন্ড নির্ণয়ের জন্য BooF ফ্রেমওয়ার্ক জোড়া জেনারেলিস্ট এবং বিশেষজ্ঞ এআই মডেল

একটি কাগজ একটি দ্বি-পর্যায়ের AI সহযোগিতা কাঠামোর প্রতিবেদন করে যা একটি মাল্টিমডাল ভাষা মডেল এবং স্তনের আল্ট্রাসাউন্ড চিত্রগুলি বিশ্লেষণ করার জন্য একজন দৃষ্টি বিশেষজ্ঞ ব্যবহার করে, লেখকরা একাধিক ডেটাসেট জুড়ে উন্নত ডায়গনিস্টিক নির্ভুলতা এবং ব্যাখ্যাযোগ্যতার প্রতিবেদন করে।

7 min readRead the primary source
Primary-source image accompanying BooF framework pairs generalist and expert AI models for breast ultrasound diagnosis
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.23974
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
আত্মবিশ্বাসের ব্যবধান
একটি পরিসংখ্যানগত পরিসর যা সম্ভবত একটি পরিমাপিত মডেল মেট্রিকের প্রকৃত মান ধারণ করে।
সাধারণীকরণ
প্রশিক্ষণ সেটের বাইরে একটি মডেল নতুন, অদেখা ডেটাতে কতটা ভালো পারফর্ম করে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা বুট-এন্ড-ফিডব্যাক বা BooF প্রস্তাব করেছেন, একটি কাঠামো যেখানে একটি মাল্টিমডাল বৃহৎ ভাষা মডেল স্তন আল্ট্রাসাউন্ড অনুসন্ধানের ডোমেন-নির্দেশিত বিবরণ তৈরি করে এবং একজন দৃষ্টি বিশেষজ্ঞ ভিজ্যুয়াল বৈশিষ্ট্যগুলির পাশাপাশি সেই প্রতিক্রিয়াটি ব্যবহার করে। কাগজটি রিপোর্ট করে যে BooF একাধিক স্তন-আল্ট্রাসাউন্ড ডেটাসেটে বিদ্যমান পদ্ধতিগুলিকে ছাড়িয়ে গেছে, যদিও সরবরাহকৃত উত্স সংখ্যাসূচক ফলাফল প্রদান করে না।

উত্সটি স্তন-ক্যান্সার নির্ণয়ের জন্য স্তন আল্ট্রাসাউন্ডকে ব্যাপকভাবে ব্যবহৃত হিসাবে বর্ণনা করে তবে অপারেটর-নির্ভর। এটি সাম্প্রতিক মাল্টিমোডাল বৃহৎ ভাষার মডেলগুলির একটি নির্দিষ্ট দুর্বলতা চিহ্নিত করে: তারা জাল বর্ণনা তৈরি করতে পারে কারণ তাদের যথেষ্ট ডোমেন জ্ঞান নেই। কাগজের মতে, এই বিবরণগুলি ডাউনস্ট্রিম বিশেষজ্ঞ মডেলগুলিকে বিভ্রান্ত করতে পারে এবং ক্লিনিকাল বৈধতাকে হ্রাস করতে পারে। এটি মেডিকেল ইমেজিং বা অটোমেশনের সাধারণ আলোচনার পরিবর্তে AI সিস্টেমকেই কাজের কেন্দ্রীয় বিষয় করে তোলে। কাগজটি arXiv-এ 25 অগাস্ট, 2026-এ জমা দেওয়া হিসাবে তালিকাভুক্ত করা হয়েছে এবং ICASSP 2026-কে এর প্রকাশনা স্থান হিসেবে চিহ্নিত করেছে।

উত্সটিতে একটি বিমূর্ত এবং গ্রন্থপঞ্জী তথ্য রয়েছে, তবে রিপোর্ট করা প্রভাবের আকারগুলি স্বাধীনভাবে মূল্যায়ন করার জন্য সম্পূর্ণ পরীক্ষামূলক টেবিল বা পদ্ধতিগুলি নেই। প্রস্তাবিত কাঠামোর দুটি নাম করা ধাপ রয়েছে। বুট পর্যায়ে, মাল্টিমোডাল ভাষা মডেল BI-RADS অভিধান দ্বারা পরিচালিত হয়, একটি প্রমিত শব্দভাণ্ডার যা স্তন-ইমেজিং ফলাফলগুলিকে বর্ণনা করতে ব্যবহৃত হয়, পাশাপাশি একজন দৃষ্টি বিশেষজ্ঞের প্রাথমিক সৌম্য-বনাম-ম্যালিগন্যান্ট ভবিষ্যদ্বাণীগুলির সাথে। উল্লিখিত উদ্দেশ্য হল সাধারণ-উদ্দেশ্য মডেলটিকে তার যুক্তির ক্ষমতাকে স্তন-আল্ট্রাসাউন্ড বিশ্লেষণে স্থানান্তর করতে সাহায্য করা এবং হ্যালুসিনেটেড বা অসমর্থিত বর্ণনাগুলি হ্রাস করা। বিমূর্ত এটি একটি নকশা উদ্দেশ্য এবং একটি রিপোর্ট প্রক্রিয়া হিসাবে উপস্থাপন; এটি প্রতিষ্ঠিত করে না যে প্রতিটি উত্পন্ন বিবরণ চিকিৎসাগতভাবে সঠিক বা হ্যালুসিনেশন দূর করা হয়েছে। ফিডব্যাক স্টেজে, মডেলের বর্ণনাগুলিকে চাক্ষুষ বৈশিষ্ট্যের সাথে একত্রিত করা হয় যাকে লেখকরা একটি লাইটওয়েট অ্যাটেনশন-গেটেড ক্রস-মোডালিটি ফিউশন মডিউল বলে। বিশেষজ্ঞ মডেলটি অভিযোজিতভাবে শব্দ ফিল্টার করার সময় পাঠ্য প্রতিক্রিয়া ব্যবহার করার উদ্দেশ্যে করা হয়েছে। ব্যবহারিক পরিভাষায়, সিস্টেমটিকে একটি ভাষা মডেলের সাথে চিত্র-ভিত্তিক বিশেষজ্ঞের প্রতিস্থাপন হিসাবে বর্ণনা করা হয় না। পরিবর্তে, এটি একটি মঞ্চস্থ মিথস্ক্রিয়া তৈরি করে যেখানে একটি সাধারণবাদী মডেল কাঠামোগত ভাষা সরবরাহ করে এবং একটি বিশেষজ্ঞ মডেল সিদ্ধান্ত নেয় যে চিত্রের প্রমাণের সাথে কতটা তথ্য অন্তর্ভুক্ত করা হবে। উত্সটি মডেলের নাম, প্রশিক্ষণ-ডেটা উত্স, হার্ডওয়্যার, অনুমান সময় বা স্থাপনের প্রয়োজনীয়তাগুলি উল্লেখ করে না।

লেখকরা রিপোর্ট করেছেন যে একাধিক স্তন-আল্ট্রাসাউন্ড ডেটাসেটের ব্যাপক পরীক্ষাগুলি দেখায় যে BooF নির্ণয়ের সঠিকতা এবং ব্যাখ্যাযোগ্যতার ক্ষেত্রে অত্যাধুনিক পদ্ধতিগুলিকে উল্লেখযোগ্যভাবে ছাড়িয়ে যাচ্ছে। এগুলি কাগজের দ্বারা করা দাবি, সরবরাহকৃত উপাদানে স্বাধীনভাবে প্রতিষ্ঠিত ফলাফল নয়। কোন সংখ্যাগত নির্ভুলতা, সংবেদনশীলতা, নির্দিষ্টতা, বক্ররেখার অধীনে এলাকা, ব্যাখ্যাযোগ্যতা পরিমাপ, আত্মবিশ্বাসের ব্যবধান বা বেসলাইন তালিকা অন্তর্ভুক্ত করা হয় না। ডেটাসেটগুলি পূর্ববর্তী ছিল কিনা, কীভাবে লেবেলগুলি বরাদ্দ করা হয়েছিল, ছবিগুলি বিভিন্ন প্রতিষ্ঠান থেকে এসেছে কিনা, বা ক্লিনিকাল অনুশীলনে সম্ভাব্যভাবে কোনও মূল্যায়ন করা হয়েছিল কিনা তাও বিমূর্তটি বলে না। তাৎক্ষণিক তাৎপর্য হল যে কাজটি মেডিকেল এআই-তে একটি কংক্রিট ব্যর্থতার মোডকে লক্ষ্য করে: একটি সিস্টেম দৃশ্যমান ফলাফলগুলি বর্ণনা করার সময় স্পষ্টভাবে প্রদর্শিত হতে পারে যা আসলে উপস্থিত নয়। স্তনের আল্ট্রাসাউন্ডে, যেখানে ছবির গুণমান, অপারেটর কৌশল এবং ক্ষতের চেহারা পরিবর্তিত হতে পারে, অসমর্থিত ভাষা একজন চিকিত্সকের মনোযোগ বা আত্মবিশ্বাসকে বিকৃত করতে পারে। কাগজের স্থাপত্যটি ভাষা উপাদানটিকে ইতিমধ্যেই টাস্কের সাথে আবদ্ধ দুটি সীমাবদ্ধতার জন্য জবাবদিহি করার চেষ্টা করে: একটি ডোমেন অভিধান এবং একটি দৃষ্টি মডেল থেকে প্রাথমিক ভবিষ্যদ্বাণী। এটি একটি ইমেজিং ওয়ার্কফ্লোতে একটি চ্যাটবট যোগ করার চেয়ে আরও নির্দিষ্ট হস্তক্ষেপ।

কাঠামোটি মাল্টিমোডাল মেডিকেল এআই-এর জন্য একটি বিস্তৃত নকশা প্রশ্নও প্রতিফলিত করে: কীভাবে সাধারণ-উদ্দেশ্য যুক্তি সংকীর্ণ, কার্য-নির্দিষ্ট দক্ষতার সাথে মিলিত হওয়া উচিত? BooF দুটি উপাদানে বিভিন্ন ফাংশন বরাদ্দ করে। মাল্টিমোডাল ভাষা মডেলটি বর্ণনা তৈরি করতে এবং সাধারণ যুক্তি স্থানান্তর করতে ব্যবহৃত হয়, যখন বিশেষজ্ঞ মডেলটি ভিজ্যুয়াল বৈশিষ্ট্যের সাথে সংযুক্ত থাকে এবং পাঠ্য সংকেত গেট করতে পারে। যদি রিপোর্ট করা আচরণটি পুনরুত্পাদনযোগ্য হয়, তবে এটি অন্তর্নিহিত চিত্র প্রমাণের উপর আধিপত্য তৈরি করা পাঠ্যকে অনুমতি না দিয়ে পাঠ্য ব্যাখ্যার সাথে যুক্ত কিছু ব্যাখ্যাযোগ্যতা অর্জনের একটি উপায় সরবরাহ করতে পারে। তবুও, উত্সটি দেখায় না যে একটি ব্যাখ্যা মডেলের প্রকৃত সিদ্ধান্ত প্রক্রিয়ার প্রতি বিশ্বস্ত বা রেডিওলজিস্টের জন্য দরকারী। ব্যাখ্যাযোগ্যতা শব্দটি বিশেষজ্ঞের বর্ণনার সাথে চুক্তি, ফলাফলের স্থানীয়করণ, পাঠক অধ্যয়নে উপযোগিতা বা বিভ্রান্তির অধীনে ধারাবাহিকতা সহ বিভিন্ন পরিমাপকে নির্দেশ করতে পারে। কাগজের সংজ্ঞা এবং মূল্যায়ন প্রোটোকল ছাড়া, রিপোর্ট করা উন্নতি একটি নির্দিষ্ট ক্লিনিকাল সুবিধার মধ্যে অনুবাদ করা যাবে না। একই সীমাবদ্ধতা নির্ভুলতার ক্ষেত্রে প্রযোজ্য: একটি বেঞ্চমার্ক উন্নতি কম মিস করা ক্যান্সার, কম অপ্রয়োজনীয় বায়োপসি বা রুটিন কেয়ারে আরও ভাল সিদ্ধান্ত বোঝাতে পারে না। যদি পদ্ধতিটি শেষ পর্যন্ত তার মূল ডেটাসেটের বাইরে যাচাই করা হয়, তবে এটি স্তন-আল্ট্রাসাউন্ড ব্যাখ্যার জন্য এআই সহায়তা মূল্যায়নকারী হাসপাতালের জন্য প্রাসঙ্গিক হতে পারে। সীমাবদ্ধ পাঠ্য যুক্তির সাথে চিত্র প্রমাণকে একত্রিত করে এমন একটি সিস্টেম কাঠামোগত পর্যালোচনা, দ্বিতীয় পাঠ বা শিক্ষাগত প্রতিক্রিয়া সমর্থন করতে পারে। কিন্তু এই ব্যবহারের জন্য মিথ্যা নেতিবাচক, মিথ্যা ইতিবাচক, ক্রমাঙ্কন, উপগোষ্ঠীর কর্মক্ষমতা এবং ক্লিনিশিয়ানের আচরণের উপর প্রভাব সম্পর্কে প্রমাণের প্রয়োজন হবে। চূড়ান্ত সিদ্ধান্তের জন্য তাদের স্পষ্ট দায়িত্বও প্রয়োজন। সরবরাহকৃত উত্সটি সেই প্রমাণগুলির কোনটিই প্রদান করে না, তাই বর্তমানে এর জনসাধারণের প্রভাব একটি প্রদর্শিত ক্লিনিকাল স্থাপনার পরিবর্তে একটি গবেষণা ফলাফল হিসাবে।

পরবর্তী গুরুত্বপূর্ণ প্রমাণ হল সম্পূর্ণ ICASSP কাগজ এবং এর পরীক্ষামূলক বিবরণ। পাঠকদের ডেটাসেটের নাম, নমুনা গণনা, রোগী-স্তরের ট্রেন-পরীক্ষা বিচ্ছেদ, বাহ্যিক বৈধতা, শ্রেণির ভারসাম্য, প্রিপ্রসেসিং, তুলনা বেসলাইন এবং উল্লেখযোগ্য উন্নতির দাবির পিছনে সঠিক মেট্রিকগুলি সন্ধান করা উচিত। প্রশিক্ষণের সময় প্রতিনিধিত্ব করা হয়নি এমন প্রতিষ্ঠান বা ডিভাইস থেকে আল্ট্রাসাউন্ড চিত্রগুলিতে মডেলটি মূল্যায়ন করা হয়েছিল কিনা তাও গুরুত্বপূর্ণ। যদি একাধিক ডেটাসেট শুধুমাত্র অভ্যন্তরীণ পরীক্ষার জন্য ব্যবহার করা হয় বা অনুরূপ উত্স ভাগ করা হয়, তাহলে আপাত সাধারণীকরণ বিমূর্ত প্রস্তাবের চেয়ে সংকীর্ণ হতে পারে। স্বাধীন প্রতিলিপির পরীক্ষা করা উচিত যে লাভগুলি বুট-এবং-ফিডব্যাক ডিজাইন থেকে এসেছে নাকি প্রশিক্ষণ, প্রম্পট, ডেটা পরিষ্কার বা মূল্যায়নের পার্থক্য থেকে এসেছে। দরকারী অধ্যয়নগুলি BI-RADS নির্দেশিকা, প্রাথমিক বিশেষজ্ঞের ভবিষ্যদ্বাণী, প্রতিক্রিয়া মডিউল বা ভাষা মডেলকে সরিয়ে দেয় এমন সংস্করণগুলির সাথে সম্পূর্ণ সিস্টেমের তুলনা করবে। তাদেরও পরিমাপ করা উচিত কখন ভাষা মডেলটি ভুল, কত ঘন ঘন বিশেষজ্ঞ গেট তার প্রতিক্রিয়া প্রত্যাখ্যান করে এবং উভয় উপাদান একই ত্রুটি ভাগ করলে সিস্টেমটি অতিরিক্ত আত্মবিশ্বাসী হয়ে ওঠে কিনা। একটি পাঠক অধ্যয়ন মূল্যায়ন করতে পারে যে ব্যাখ্যাগুলি ডায়গনিস্টিক সিদ্ধান্তগুলিকে উন্নত করে নাকি আউটপুটগুলিকে আরও প্ররোচিত করে তোলে। ক্লিনিকাল মূল্যায়ন পূর্ববর্তী বেঞ্চমার্ক নির্ভুলতার বাইরে যেতে হবে। সম্ভাব্য অধ্যয়নগুলি অপারেটর, হাসপাতাল, আল্ট্রাসাউন্ড সরঞ্জাম এবং রোগীর জনসংখ্যার জুড়ে কর্মক্ষমতা পরীক্ষা করতে পারে, কর্মপ্রবাহের সময় এবং চিকিত্সকদের সাথে মতবিরোধ পর্যবেক্ষণ করার সময়। বিশেষ মনোযোগ বিরল বা অস্পষ্ট অনুসন্ধানে যাওয়া উচিত, যেখানে একটি সাবলীল কিন্তু ভুল বর্ণনা বিশেষত ক্ষতিকারক হতে পারে। উত্সটি নিয়ন্ত্রক অবস্থা, স্থাপনার পরিকল্পনা, রোগীর ফলাফল, গোপনীয়তা সুরক্ষা বা প্রাপ্যতা সম্পর্কে রিপোর্ট করে না, তাই কনফারেন্সের কার্যপ্রণালী প্রসঙ্গে কাগজের প্রকাশনা থেকে সেগুলির কোনওটিই অনুমান করা উচিত নয়। মেডিকেল-ইমেজিং সিস্টেমগুলি কীভাবে অনিশ্চয়তাকে সংজ্ঞায়িত করে এবং যোগাযোগ করে তাও দেখার মতো। BooF শোরগোল পাঠ্য প্রতিক্রিয়া ফিল্টার করার জন্য ডিজাইন করা হয়েছে, তবে বিমূর্তটি বলে না যে এটি এড়িয়ে যেতে পারে, মানুষের পর্যালোচনার অনুরোধ করতে পারে বা মডেলের অনিশ্চয়তা থেকে চিত্রের সীমাবদ্ধতাগুলিকে আলাদা করতে পারে। ভবিষ্যত রিপোর্টিং সেই আচরণগুলিকে দৃশ্যমান করে তুলবে এবং ডিস্ট্রিবিউশন শিফটের অধীনে তাদের পরীক্ষা করবে। যতক্ষণ না এই ধরনের প্রমাণ পাওয়া যায়, BooF একটি গবেষণা পত্রে রিপোর্ট করা একটি প্রতিশ্রুতিশীল আর্কিটেকচার হিসাবে ভালভাবে বোঝা যায়, একটি ক্লিনিক্যালি যাচাইকৃত ডায়াগনস্টিক পণ্য হিসাবে নয়।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

স্তন আল্ট্রাসাউন্ড ব্যাখ্যা অপারেটরের অভিজ্ঞতার সাথে পরিবর্তিত হতে পারে, এবং AI সিস্টেম যা অসমর্থিত বর্ণনা তৈরি করে অতিরিক্ত ক্লিনিকাল ঝুঁকি তৈরি করতে পারে। BooF BI-RADS অভিধান এবং প্রাথমিক বিশেষজ্ঞের ভবিষ্যদ্বাণীগুলির সাথে ভাষা-মডেল আউটপুটকে সীমাবদ্ধ করে উভয় সমস্যার সমাধান করে, তারপর এটি নির্ণয়কে প্রভাবিত করার আগে ফলাফলের পাঠ্য প্রতিক্রিয়া ফিল্টার করে।

অপারেটরের অভিজ্ঞতা স্তন-আল্ট্রাসাউন্ড ব্যাখ্যাকে প্রভাবিত করতে পারে, যখন অসমর্থিত AI বিবরণ ক্লিনিকাল ঝুঁকি যোগ করতে পারে।

BooF BI-RADS এবং প্রাথমিক বিশেষজ্ঞের পূর্বাভাস দিয়ে আউটপুট সীমাবদ্ধ করে, তারপর নির্ণয়ের আগে পাঠ্য প্রতিক্রিয়া ফিল্টার করে।

উত্সটি ক্লিনিকাল সুবিধা, বিশ্বস্ত ব্যাখ্যা, কম মিস করা ক্যান্সার বা কম অপ্রয়োজনীয় বায়োপসি স্থাপন করে না।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

মূল প্রশ্নগুলি হল রিপোর্ট করা লাভগুলি হাসপাতাল, ডিভাইস, রোগীর জনসংখ্যা এবং চিকিত্সক জুড়ে রয়েছে কিনা এবং সিস্টেমটি কেবল বেঞ্চমার্ক স্কোরের পরিবর্তে সিদ্ধান্তগুলিকে উন্নত করে কিনা। উত্সটি সম্ভাব্য ক্লিনিকাল সুবিধা, নিয়ন্ত্রক ছাড়পত্র, স্থাপনা, রোগীর ফলাফল বা মূল্যায়ন করা ডেটাসেটের আকার এবং গঠন স্থাপন করে না।

ডেটাসেটের নাম, নমুনা গণনা, রোগী-স্তরের বিচ্ছেদ, বাহ্যিক বৈধতা, শ্রেণির ভারসাম্য, বেসলাইন এবং সঠিক মেট্রিক্স পর্যালোচনা করুন।

পরীক্ষা হাসপাতাল, ডিভাইস, রোগীর জনসংখ্যা এবং চিকিত্সক সহ, অস্পষ্ট অনুসন্ধান এবং মডেল ভুল যেখানে মামলা.

উত্সটি নিয়ন্ত্রক অবস্থা, স্থাপনার পরিকল্পনা, রোগীর ফলাফল, গোপনীয়তা সুরক্ষা, প্রাপ্যতা বা অনিশ্চয়তা আচরণের প্রতিবেদন করে না।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই নীতিশাস্ত্রট্রান্সফরমারAI কি?আপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?