क्या हुआ?
शोधकर्ताओं ने डीआरआरजी, स्वचालित रेडियोलॉजी रिपोर्ट पीढ़ी के लिए एक असतत प्रसार बड़े भाषा मॉडल ढांचे की शुरुआत की। पाठ को बाएं से दाएं सख्ती से तैयार करने के बजाय, डीआरआरजी बार-बार टोकन को मास्क और पुनर्निर्माण करता है, जिससे रिपोर्ट को पुनरावृत्तियों में परिष्कृत किया जा सकता है। लेखक दो रेडियोलॉजी डेटासेट पर बेहतर परिणामों की रिपोर्ट करते हैं, लेकिन स्रोत एक arXiv सबमिशन है और नैदानिक तैनाती या रोगी-देखभाल प्रभाव स्थापित नहीं करता है।
25 अगस्त को arXiv को प्रस्तुत किया गया पेपर, DRRG को ऑटोरेग्रेसिव रेडियोलॉजी रिपोर्ट जेनरेशन के विकल्प के रूप में प्रस्तुत करता है। लेखक पारंपरिक ऑटोरेग्रेसिव सिस्टम का वर्णन टोकन दर टोकन रिपोर्ट तैयार करने के रूप में करते हैं, जो प्रारंभिक त्रुटियों को फैलने की अनुमति दे सकता है और पहले की सामग्री के संशोधन को कठिन बना सकता है। इसके बजाय डीआरआरजी रिपोर्ट निर्माण को पुनरावृत्तीय मुखौटा-टोकन निरूपण के रूप में मानता है। उस सेटअप में, टोकन को क्रमिक चरणों में भरा और संशोधित किया जा सकता है, लेखकों का कहना है कि यह प्रक्रिया रेडियोलॉजिकल रिपोर्टिंग में शामिल पुनरावृत्तीय शोधन के साथ अधिक सुसंगत है। स्रोत इसे एक अनुसंधान ढांचे के रूप में प्रस्तुत करता है, न कि एक तैनात नैदानिक उत्पाद के रूप में।
डीआरआरजी दो घटकों को जोड़ती है जिनका उद्देश्य पीढ़ी प्रक्रिया को अधिक चिकित्सकीय रूप से केंद्रित बनाना है। पहला एक नैदानिक-इकाई-जागरूक पूरक मुखौटा है। लेखकों के अनुसार, यह मास्क रिपोर्ट में चिकित्सकीय रूप से महत्वपूर्ण संस्थाओं पर जोर देते हुए टोकन-पर्यवेक्षण कवरेज को बढ़ाता है। दूसरा एक अवधारणा-कंडीशनिंग मॉड्यूल है जो सिस्टम द्वारा उपयोग किए जाने वाले दृश्य अभ्यावेदन में छवि-व्युत्पन्न नैदानिक अवधारणाओं को इंजेक्ट करता है। साथ में, इन घटकों को अंतर्निहित रेडियोलॉजी छवियों से निकाले गए निष्कर्षों के साथ उत्पन्न भाषा को अधिक निकटता से जोड़ने के लिए डिज़ाइन किया गया है। स्रोत आपूर्ति किए गए पाठ में पूर्ण कार्यान्वयन विवरण, उन्मूलन परिणाम, या परिचालन आवश्यकताएं प्रदान नहीं करता है।
लेखकों ने MIMIC-CXR और CheXpert Plus पर DRRG को प्रशिक्षित और मूल्यांकन किया। MIMIC-CXR पर, वे 0.210 का BLEU-4 स्कोर, 0.549 का CheXpert-F1, 0.281 का RadGraph-F1, 0.360 का हरा और 0.604 का RaTEScore रिपोर्ट करते हैं। उनका कहना है कि काफी छोटे भाषा-मॉडल डिकोडर का उपयोग करने के बावजूद डीआरआरजी ने अधिकांश रिपोर्ट किए गए मेट्रिक्स पर तुलनात्मक तरीकों से बेहतर प्रदर्शन किया है।
CheXpert Plus पर, पेपर तुलनात्मक तरीकों के बीच उच्चतम BLEU-4 स्कोर, 0.119, और CheXpert-F1 स्कोर, 0.347 की रिपोर्ट करता है। स्रोत आपूर्ति किए गए सार में उन तुलना प्रणालियों की पहचान नहीं करता है या यह स्थापित नहीं करता है कि रिपोर्ट किए गए अंतर सांख्यिकीय रूप से महत्वपूर्ण हैं या नहीं।
यह क्यों मायने रखता है?
यदि दोहराया जाता है, तो दृष्टिकोण में सुधार हो सकता है कि कैसे एआई सिस्टम संशोधन को बाद के विचार के बजाय पीढ़ी का हिस्सा बनाकर रेडियोलॉजी रिपोर्ट का मसौदा तैयार करता है। रिपोर्ट किए गए लाभ प्रासंगिक हैं क्योंकि रूपरेखा नैदानिक इकाइयों और छवि-व्युत्पन्न अवधारणाओं पर केंद्रित है, लेकिन उपलब्ध स्रोत यह नहीं दिखाता है कि सिस्टम रेडियोलॉजिस्ट के निर्णयों में सुधार करता है, अभ्यास में कार्यभार कम करता है, या अस्पतालों और रोगी आबादी में विश्वसनीय प्रदर्शन करता है।
केंद्रीय महत्व वास्तुशिल्प है: डीआरआरजी एक पीढ़ी पद्धति लागू करता है जो उत्पादन के दौरान पाठ को उस कार्य में संशोधित कर सकता है जहां तथ्यात्मक स्थिरता मायने रखती है। लेखकों का तर्क है कि यह द्विदिश, पुनरावृत्तीय प्रक्रिया सख्ती से बाएं से दाएं डिकोडिंग से जुड़े त्रुटि प्रसार को कम कर सकती है। यह दावा मेडिकल एआई के लिए परिणामी है क्योंकि एक रिपोर्ट केवल धाराप्रवाह गद्य नहीं है; इसे छवि निष्कर्षों और नैदानिक इकाइयों का सटीक रूप से प्रतिनिधित्व करना चाहिए। हालाँकि, स्रोत रोगी के परिणामों, नैदानिक निर्णयों या रेडियोलॉजिस्ट के दिन-प्रतिदिन के कार्यभार में सुधार के बजाय बेंचमार्क प्रदर्शन की रिपोर्ट करता है।
रिपोर्ट किए गए नतीजों से पता चलता है कि यह ढांचा चिकित्सकीय रूप से आधारित रिपोर्ट निर्माण में अनुसंधान के लिए एक उपयोगी दिशा प्रदान कर सकता है। पेपर के अनुसार, डीआरआरजी केवल सामान्य भाषा निर्माण पर निर्भर नहीं है; यह नैदानिक इकाइयों पर जोर देता है और छवि-व्युत्पन्न अवधारणाओं पर दृश्य प्रतिनिधित्व की स्थिति देता है। लेखक एमआईएमआईसी-सीएक्सआर पर काफी छोटे डिकोडर के साथ प्रतिस्पर्धी प्रदर्शन की भी रिपोर्ट करते हैं। यह उन प्रणालियों के लिए मायने रख सकता है जहां मॉडल आकार और तैनाती संसाधन बाधाएं हैं, लेकिन स्रोत विलंबता, मेमोरी उपयोग, ऊर्जा खपत, कुल प्रशिक्षण लागत, या सेवा लागत के लिए कोई माप नहीं देता है। इसलिए एक छोटे डिकोडर को सस्ते या आसान नैदानिक प्रणाली के प्रमाण के रूप में नहीं माना जाना चाहिए।
पेपर कई स्थापित रिपोर्ट-जनरेशन मेट्रिक्स का मूल्यांकन करता है, जिसमें भाषा-ओवरलैप, रोग-लेबल, ग्राफ-आधारित और सार में नामित अन्य नैदानिक-स्थिरता उपाय शामिल हैं। इसका MIMIC-CXR और CheXpert Plus दोनों का उपयोग दो डेटासेटों में साक्ष्य प्रदान करता है, और लेखक प्रत्येक में चयनित उपायों पर अग्रणी परिणामों की रिपोर्ट करते हैं। फिर भी, बेंचमार्क श्रेष्ठता स्वयं सामान्य नैदानिक विश्वसनीयता स्थापित नहीं करती है।
आपूर्ति किया गया स्रोत यह नहीं बताता है कि सिस्टम लापता निष्कर्षों, परस्पर विरोधी दृश्य साक्ष्य, दुर्लभ स्थितियों, अस्पष्ट छवियों या नैदानिक रूप से महत्वपूर्ण चूक को कैसे संभालता है। यह यह भी रिपोर्ट नहीं करता है कि क्या रेडियोलॉजिस्ट ने उत्पन्न रिपोर्ट को अन्य प्रणालियों द्वारा उत्पादित रिपोर्ट के मुकाबले सुरक्षित, उपयोगी या बेहतर माना है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
अगले प्रमुख चरण स्वतंत्र प्रतिकृति, सहकर्मी-समीक्षा मूल्यांकन और दो रिपोर्ट किए गए डेटासेट से परे परीक्षण हैं। पाठकों को त्रुटि प्रकार, अनुमान गति, डिकोडर आकार और गणना आवश्यकताओं, मानव समीक्षा और असामान्य या अस्पष्ट मामलों पर प्रदर्शन के बारे में साक्ष्य भी देखना चाहिए। स्रोत तैनाती, संभावित नैदानिक परीक्षण, पाठक अध्ययन, सांख्यिकीय महत्व या सुरक्षा परिणामों की रिपोर्ट नहीं करता है।
सबसे पहले, शोध को स्वतंत्र पुनरुत्पादन और पूर्ण प्रकाशन के माध्यम से जांचा जाना चाहिए। उस मूल्यांकन के लिए महत्वपूर्ण विवरणों में सटीक आधार रेखाएं, ट्रेन-परीक्षण विभाजन, प्रीप्रोसेसिंग, मॉडल आकार, डिकोडिंग शेड्यूल और क्लिनिकल-एंटिटी मास्क और अवधारणा-कंडीशनिंग मॉड्यूल के लिए एब्लेशन परिणाम शामिल हैं। स्रोत एक arXiv सबमिशन है और लेखकों के अपने परिणाम प्रस्तुत करता है; आपूर्ति की गई सामग्री में कोई स्वतंत्र सत्यापन नहीं है। भविष्य के काम को यह स्पष्ट करना चाहिए कि क्या रिपोर्ट किए गए सुधार लगातार प्रयोगात्मक नियंत्रणों के बाद भी बने हुए हैं और क्या वे यादृच्छिक बीज और मूल्यांकन सेटिंग्स पर कायम हैं।
दूसरा, मूल्यांकन में केवल अंकों के बजाय विफलता के तरीकों की जांच होनी चाहिए। उपयोगी अनुवर्ती साक्ष्य में एक रिपोर्ट के भीतर नैदानिक रूप से महत्वपूर्ण मतिभ्रम, छूटे हुए निष्कर्ष, गलत निषेध, शारीरिक गलतियाँ और विरोधाभासों का अलग-अलग विश्लेषण शामिल होगा। अतिरिक्त संस्थानों और रोगी समूहों पर परीक्षण से यह निर्धारित करने में मदद मिलेगी कि क्या विधि MIMIC-CXR और CheXpert Plus से परे सामान्यीकृत है। स्रोत आपूर्ति किए गए पाठ में उन डेटासेट के जनसांख्यिकीय, नैदानिक, या इमेजिंग वितरण की पहचान नहीं करता है, इसलिए यह स्थापित नहीं कर सकता कि रिपोर्ट किया गया प्रदर्शन कितने व्यापक रूप से लागू होता है।
अंत में, किसी भी व्यावहारिक अपनाने के लिए वर्कफ़्लो और निरीक्षण के बारे में साक्ष्य की आवश्यकता होगी। पेपर संभावित नैदानिक परीक्षणों, रेडियोलॉजिस्ट-इन-द-लूप परीक्षण, तैनाती विलंबता, या रिपोर्टिंग समय और सटीकता पर उत्पन्न ड्राफ्ट के प्रभाव की रिपोर्ट नहीं करता है। यह उन मामलों के लिए नैदानिक उपकरण, नियामक स्थिति या सुरक्षा उपायों के रूप में उपलब्धता का वर्णन नहीं करता है जिनमें छवि-व्युत्पन्न अवधारणाएं अधूरी या गलत हैं।
वे अज्ञात तथ्य हैं: रिपोर्ट किए गए बेंचमार्क लाभ एक शोध परिणाम दिखाते हैं, लेकिन वे यह नहीं दिखाते हैं कि डीआरआरजी पेशेवर निर्णय को बदलने या समीक्षा के बिना काम करने के लिए तैयार है।