समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

ओपन-सोर्स ओसीआर पाइपलाइन कैंसर रजिस्ट्री डेटा विलंबता को कम करती है

मिनेसोटा विश्वविद्यालय के शोधकर्ताओं ने एक हाइब्रिड ओपन-सोर्स ओसीआर पाइपलाइन विकसित की है जो 97% सटीकता के साथ नैदानिक ​​रिपोर्ट से जीनोमिक परीक्षण स्कोर निकालती है, जो संभावित रूप से धीमी मैन्युअल डेटा प्रविष्टि की जगह लेती है।

4 min readRead the linked source
Source-provided image accompanying Open-source OCR pipeline reduces cancer registry data latency
स्रोत संदर्भस्रोत रिकार्ड किया गया
प्रकाशक
bioengineer.org
स्रोत लिंक
bioengineer.orghttps://bioengineer.org/ai-reads-the-charts-how-open-source-ocr-could-slash-cancer-data-delays/
स्रोत प्रकार
लिंक्ड स्रोत - प्राथमिक-स्रोत स्थिति स्थापित नहीं की गई है।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

ओसीआर (ऑप्टिकल कैरेक्टर रिकग्निशन)
वह तकनीक जो पाठ को छवियों में परिवर्तित करती है या स्कैन करके मशीन-पठनीय पाठ में परिवर्तित करती है।
पाइपलाइन
प्रीप्रोसेसिंग, मॉडल चरणों और पोस्टप्रोसेसिंग चरणों का एक क्रमबद्ध वर्कफ़्लो।
विलंबता
अनुरोध भेजने और मॉडल का आउटपुट प्राप्त करने के बीच का समय।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

मिनेसोटा विश्वविद्यालय के नेतृत्व में एक शोध दल ने प्रदर्शित किया है कि एक हाइब्रिड ओपन-सोर्स ऑप्टिकल कैरेक्टर रिकग्निशन (ओसीआर) पाइपलाइन स्कैन किए गए ऑनकोटाइप डीएक्स स्तन कैंसर रिपोर्ट से जीनोमिक पुनरावृत्ति स्कोर को सटीक रूप से निकाल सकती है। कैंसर कारण और नियंत्रण में प्रकाशित अध्ययन में 675 रिपोर्टों को संसाधित करने के लिए टेसेरैक्ट और ईज़ीओसीआर इंजन के संयोजन का उपयोग किया गया, जिससे मैन्युअल मानव अमूर्तता के साथ 97% समझौता दर प्राप्त हुई। स्वचालित प्रणाली ने पारंपरिक मैन्युअल रजिस्ट्री प्रविष्टि की गति से काफी बेहतर प्रदर्शन किया, जिसमें अक्सर 12 से 18 महीने की देरी का सामना करना पड़ता है।

कियानयुन लुओ और शेलोमो मार्मोर सहित अनुसंधान टीम ने कैंसर रजिस्ट्रियों में विलंबता को संबोधित करने के लिए एक 'हाइब्रिड ओसीआर' (एच-ओसीआर) पाइपलाइन विकसित की। जीनोमिक परीक्षण के परिणाम, जैसे कि ओंकोटाइप डीएक्स पुनरावृत्ति स्कोर, अक्सर मशीन-पठनीय डेटा के बजाय इलेक्ट्रॉनिक स्वास्थ्य रिकॉर्ड (ईएचआर) में असंरचित स्कैन की गई छवियों के रूप में संग्रहीत होते हैं, जिनके लिए मैन्युअल ट्रांसक्रिप्शन की आवश्यकता होती है।

H-OCR पाइपलाइन अपने डीप-लर्निंग-आधारित टेक्स्ट डिटेक्शन के लिए EasyOCR और चरित्र पहचान के लिए फ़ॉलबैक इंजन के रूप में Tesseract का उपयोग करती है। इस हाइब्रिड दृष्टिकोण को टेसेरैक्ट की गति और चरित्र पहचान क्षमताओं का उपयोग करते हुए रिपोर्ट पर गोलाकार एनोटेशन को स्थानीयकृत करने की EasyOCR की क्षमता का लाभ उठाने के लिए डिज़ाइन किया गया था।

675 रिपोर्टों के सत्यापन सेट में, एच-ओसीआर पाइपलाइन ने मैन्युअल संदर्भ मानकों के साथ 97% समझौता हासिल किया, जो पारंपरिक रजिस्ट्री अमूर्त की 91% सटीकता दर से बेहतर प्रदर्शन कर रहा है। वर्तमान मैन्युअल वर्कफ़्लो में होने वाली महीनों की देरी की तुलना में, स्वचालित प्रक्रिया ने कार्य को लगभग 4.9 घंटों में पूरा कर लिया।

अध्ययन में पाया गया कि पाइपलाइन के आत्मविश्वास स्कोर ने संभावित त्रुटियों को प्रभावी ढंग से पहचाना, यह सुझाव दिया कि भविष्य के कार्यान्वयन इन स्कोर का उपयोग मानव समीक्षा के लिए अनिश्चित निष्कर्षणों को चिह्नित करने के लिए कर सकते हैं, जिससे नैदानिक ​​​​रूप से महत्वपूर्ण गलत वर्गीकरण का जोखिम कम हो जाएगा।

स्रोत विवरण: bioengineer.org ↗

यह क्यों मायने रखता है?

जीनोमिक डेटा के लिए मैन्युअल ट्रांसक्रिप्शन पर वर्तमान निर्भरता कैंसर अनुसंधान और सटीक ऑन्कोलॉजी में एक महत्वपूर्ण बाधा पैदा करती है। असंरचित पीडीएफ से संरचित डेटा के निष्कर्षण को स्वचालित करके, यह ओपन-सोर्स दृष्टिकोण स्वास्थ्य प्रणालियों को वास्तविक समय में कैंसर रजिस्ट्रियों को भरने की अनुमति देता है। यह बदलाव वास्तविक दुनिया के साक्ष्य की गुणवत्ता में सुधार, तेजी से तुलनात्मक प्रभावशीलता अनुसंधान को सक्षम करने और ऑन्कोलॉजी में भविष्य के एआई मॉडल को प्रशिक्षित करने के लिए आवश्यक संरचित डेटा प्रदान करने के लिए महत्वपूर्ण है। क्योंकि उपकरण ओपन-सोर्स हैं और HIPAA-अनुपालक वातावरण में काम कर सकते हैं, यह विधि संसाधन-बाधित संस्थानों के लिए मालिकाना सॉफ़्टवेयर के बिना अपने डेटा बुनियादी ढांचे को आधुनिक बनाने के लिए कम लागत वाला, प्रतिलिपि प्रस्तुत करने योग्य समाधान प्रदान करती है।

सटीक ऑन्कोलॉजी और गुणवत्ता माप के लिए जीनोमिक बायोमार्कर आवश्यक हैं, फिर भी उनकी उपयोगिता वर्तमान में उन्हें अनुसंधान डेटाबेस में उपलब्ध कराने में लगने वाले समय तक सीमित है। इस विलंबता को कम करने से अधिक समय पर साक्ष्य सृजन की अनुमति मिलती है।

Tesseract और EasyOCR जैसे ओपन-सोर्स टूल का उपयोग यह सुनिश्चित करता है कि समाधान छोटे या संसाधन-बाधित कैंसर केंद्रों तक पहुंच योग्य है, जिनके पास महंगे, मालिकाना चिकित्सा डेटा निष्कर्षण सॉफ़्टवेयर के लिए बजट की कमी हो सकती है।

अध्ययन से पता चला कि इस स्वचालित कैप्चर के लाभ व्यापक रूप से विभिन्न रोगी आबादी पर लागू होते हैं, क्योंकि शोधकर्ताओं ने पाया कि रोगी जनसांख्यिकी और नैदानिक ​​​​कारकों ने निष्कर्षण त्रुटियों की महत्वपूर्ण भविष्यवाणी नहीं की थी।

असंरचित बाइनरी ऑब्जेक्ट को संरचित डेटा में परिवर्तित करके, यह पाइपलाइन ऑन्कोलॉजी क्षेत्र में भविष्य के एआई और मशीन लर्निंग मॉडल को प्रशिक्षण और परिष्कृत करने के लिए आवश्यक उच्च-गुणवत्ता, अनुदैर्ध्य डेटा प्रदान करती है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Model Parameter Size:8B Parameters
VRAM Required5.5 GBGPU memory footprint
Target HardwareMacBook / Single GPUDeployment tier
Privacy100% Air-GappedLocal device capability
Core takeaway: Small, quantized models (3B–8B) now run directly inside smartphones and laptops with complete data privacy, while mammoth 400B+ models remain the domain of datacenter clusters.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

भविष्य के अनुसंधान को मानकीकृत ऑनकोटाइप डीएक्स प्रारूप से परे इस पाइपलाइन की स्केलेबिलिटी को संबोधित करने की आवश्यकता होगी। लेखकों ने नोट किया कि दैहिक अगली पीढ़ी की अनुक्रमण रिपोर्ट, जो विक्रेताओं के बीच अधिक विविधता प्रदर्शित करती है, स्वचालित निष्कर्षण के लिए अधिक जटिल चुनौती पेश करती है। इसके अतिरिक्त, जबकि अध्ययन ने पूर्वव्यापी डेटासेट के विरुद्ध पाइपलाइन को मान्य किया है, वास्तविक दुनिया, उच्च-मात्रा सेटिंग्स में इसकी विश्वसनीयता की पुष्टि करने के लिए लाइव क्लिनिकल रजिस्ट्री वर्कफ़्लो के भीतर संभावित परीक्षण की आवश्यकता है।

शोधकर्ताओं ने स्पष्ट रूप से अधिक विषम दस्तावेज़ प्रकारों पर पाइपलाइन का परीक्षण करने की आवश्यकता की पहचान की, जैसे कि दैहिक अगली पीढ़ी की अनुक्रमण रिपोर्ट, जो विक्रेता और प्रारूप के अनुसार काफी भिन्न होती हैं।

अध्ययन एकल स्वास्थ्य प्रणाली पर आयोजित किया गया था; भविष्य के काम में कई संस्थानों में पाइपलाइन के प्रदर्शन का मूल्यांकन किया जाना चाहिए ताकि यह सुनिश्चित हो सके कि यह स्कैन गुणवत्ता, फैक्स रिज़ॉल्यूशन और विभिन्न ईएचआर कॉन्फ़िगरेशन में भिन्नता के खिलाफ मजबूत बना रहे।

लाइव रजिस्ट्री वर्कफ़्लोज़ में संभावित एकीकरण यह निर्धारित करने के लिए अगला तार्किक कदम है कि क्या सिस्टम वास्तविक समय में आने वाले नैदानिक ​​​​डेटा को संसाधित करते समय अपनी सटीकता और दक्षता बनाए रखता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणएआई का भविष्यआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?