क्या हुआ?
मिनेसोटा विश्वविद्यालय के नेतृत्व में एक शोध दल ने प्रदर्शित किया है कि एक हाइब्रिड ओपन-सोर्स ऑप्टिकल कैरेक्टर रिकग्निशन (ओसीआर) पाइपलाइन स्कैन किए गए ऑनकोटाइप डीएक्स स्तन कैंसर रिपोर्ट से जीनोमिक पुनरावृत्ति स्कोर को सटीक रूप से निकाल सकती है। कैंसर कारण और नियंत्रण में प्रकाशित अध्ययन में 675 रिपोर्टों को संसाधित करने के लिए टेसेरैक्ट और ईज़ीओसीआर इंजन के संयोजन का उपयोग किया गया, जिससे मैन्युअल मानव अमूर्तता के साथ 97% समझौता दर प्राप्त हुई। स्वचालित प्रणाली ने पारंपरिक मैन्युअल रजिस्ट्री प्रविष्टि की गति से काफी बेहतर प्रदर्शन किया, जिसमें अक्सर 12 से 18 महीने की देरी का सामना करना पड़ता है।
कियानयुन लुओ और शेलोमो मार्मोर सहित अनुसंधान टीम ने कैंसर रजिस्ट्रियों में विलंबता को संबोधित करने के लिए एक 'हाइब्रिड ओसीआर' (एच-ओसीआर) पाइपलाइन विकसित की। जीनोमिक परीक्षण के परिणाम, जैसे कि ओंकोटाइप डीएक्स पुनरावृत्ति स्कोर, अक्सर मशीन-पठनीय डेटा के बजाय इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड (ईएचआर) में असंरचित स्कैन की गई छवियों के रूप में संग्रहीत होते हैं, जिनके लिए मैन्युअल ट्रांसक्रिप्शन की आवश्यकता होती है।
H-OCR पाइपलाइन अपने डीप-लर्निंग-आधारित टेक्स्ट डिटेक्शन के लिए EasyOCR और चरित्र पहचान के लिए फ़ॉलबैक इंजन के रूप में Tesseract का उपयोग करती है। इस हाइब्रिड दृष्टिकोण को टेसेरैक्ट की गति और चरित्र पहचान क्षमताओं का उपयोग करते हुए रिपोर्ट पर गोलाकार एनोटेशन को स्थानीयकृत करने की EasyOCR की क्षमता का लाभ उठाने के लिए डिज़ाइन किया गया था।
675 रिपोर्टों के सत्यापन सेट में, एच-ओसीआर पाइपलाइन ने मैन्युअल संदर्भ मानकों के साथ 97% समझौता हासिल किया, जो पारंपरिक रजिस्ट्री अमूर्त की 91% सटीकता दर से बेहतर प्रदर्शन कर रहा है। वर्तमान मैन्युअल वर्कफ़्लो में होने वाली महीनों की देरी की तुलना में, स्वचालित प्रक्रिया ने कार्य को लगभग 4.9 घंटों में पूरा कर लिया।
अध्ययन में पाया गया कि पाइपलाइन के आत्मविश्वास स्कोर ने संभावित त्रुटियों को प्रभावी ढंग से पहचाना, यह सुझाव दिया कि भविष्य के कार्यान्वयन इन स्कोर का उपयोग मानव समीक्षा के लिए अनिश्चित निष्कर्षणों को चिह्नित करने के लिए कर सकते हैं, जिससे नैदानिक रूप से महत्वपूर्ण गलत वर्गीकरण का जोखिम कम हो जाएगा।
स्रोत विवरण: bioengineer.org ↗
यह क्यों मायने रखता है?
जीनोमिक डेटा के लिए मैन्युअल ट्रांसक्रिप्शन पर वर्तमान निर्भरता कैंसर अनुसंधान और सटीक ऑन्कोलॉजी में एक महत्वपूर्ण बाधा पैदा करती है। असंरचित पीडीएफ से संरचित डेटा के निष्कर्षण को स्वचालित करके, यह ओपन-सोर्स दृष्टिकोण स्वास्थ्य प्रणालियों को वास्तविक समय में कैंसर रजिस्ट्रियों को भरने की अनुमति देता है। यह बदलाव वास्तविक दुनिया के साक्ष्य की गुणवत्ता में सुधार, तेजी से तुलनात्मक प्रभावशीलता अनुसंधान को सक्षम करने और ऑन्कोलॉजी में भविष्य के एआई मॉडल को प्रशिक्षित करने के लिए आवश्यक संरचित डेटा प्रदान करने के लिए महत्वपूर्ण है। क्योंकि उपकरण ओपन-सोर्स हैं और HIPAA-अनुपालक वातावरण में काम कर सकते हैं, यह विधि संसाधन-बाधित संस्थानों के लिए मालिकाना सॉफ़्टवेयर के बिना अपने डेटा बुनियादी ढांचे को आधुनिक बनाने के लिए कम लागत वाला, प्रतिलिपि प्रस्तुत करने योग्य समाधान प्रदान करती है।
सटीक ऑन्कोलॉजी और गुणवत्ता माप के लिए जीनोमिक बायोमार्कर आवश्यक हैं, फिर भी उनकी उपयोगिता वर्तमान में उन्हें अनुसंधान डेटाबेस में उपलब्ध कराने में लगने वाले समय तक सीमित है। इस विलंबता को कम करने से अधिक समय पर साक्ष्य सृजन की अनुमति मिलती है।
Tesseract और EasyOCR जैसे ओपन-सोर्स टूल का उपयोग यह सुनिश्चित करता है कि समाधान छोटे या संसाधन-बाधित कैंसर केंद्रों तक पहुंच योग्य है, जिनके पास महंगे, मालिकाना चिकित्सा डेटा निष्कर्षण सॉफ़्टवेयर के लिए बजट की कमी हो सकती है।
अध्ययन से पता चला कि इस स्वचालित कैप्चर के लाभ व्यापक रूप से विभिन्न रोगी आबादी पर लागू होते हैं, क्योंकि शोधकर्ताओं ने पाया कि रोगी जनसांख्यिकी और नैदानिक कारकों ने निष्कर्षण त्रुटियों की महत्वपूर्ण भविष्यवाणी नहीं की थी।
असंरचित बाइनरी ऑब्जेक्ट को संरचित डेटा में परिवर्तित करके, यह पाइपलाइन ऑन्कोलॉजी क्षेत्र में भविष्य के एआई और मशीन लर्निंग मॉडल को प्रशिक्षण और परिष्कृत करने के लिए आवश्यक उच्च-गुणवत्ता, अनुदैर्ध्य डेटा प्रदान करती है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
भविष्य के अनुसंधान को मानकीकृत ऑनकोटाइप डीएक्स प्रारूप से परे इस पाइपलाइन की स्केलेबिलिटी को संबोधित करने की आवश्यकता होगी। लेखकों ने नोट किया कि दैहिक अगली पीढ़ी की अनुक्रमण रिपोर्ट, जो विक्रेताओं के बीच अधिक विविधता प्रदर्शित करती है, स्वचालित निष्कर्षण के लिए अधिक जटिल चुनौती पेश करती है। इसके अतिरिक्त, जबकि अध्ययन ने पूर्वव्यापी डेटासेट के विरुद्ध पाइपलाइन को मान्य किया है, वास्तविक दुनिया, उच्च-मात्रा सेटिंग्स में इसकी विश्वसनीयता की पुष्टि करने के लिए लाइव क्लिनिकल रजिस्ट्री वर्कफ़्लो के भीतर संभावित परीक्षण की आवश्यकता है।
शोधकर्ताओं ने स्पष्ट रूप से अधिक विषम दस्तावेज़ प्रकारों पर पाइपलाइन का परीक्षण करने की आवश्यकता की पहचान की, जैसे कि दैहिक अगली पीढ़ी की अनुक्रमण रिपोर्ट, जो विक्रेता और प्रारूप के अनुसार काफी भिन्न होती हैं।
अध्ययन एकल स्वास्थ्य प्रणाली पर आयोजित किया गया था; भविष्य के काम में कई संस्थानों में पाइपलाइन के प्रदर्शन का मूल्यांकन किया जाना चाहिए ताकि यह सुनिश्चित हो सके कि यह स्कैन गुणवत्ता, फैक्स रिज़ॉल्यूशन और विभिन्न ईएचआर कॉन्फ़िगरेशन में भिन्नता के खिलाफ मजबूत बना रहे।
लाइव रजिस्ट्री वर्कफ़्लोज़ में संभावित एकीकरण यह निर्धारित करने के लिए अगला तार्किक कदम है कि क्या सिस्टम वास्तविक समय में आने वाले नैदानिक डेटा को संसाधित करते समय अपनी सटीकता और दक्षता बनाए रखता है।