क्या हुआ?
वेंचरबीट की रिपोर्ट है कि कोहेयर ने पार्स 5 जारी किया, जो एक दस्तावेज़-पार्सिंग मॉडल है जो बड़े पैमाने पर एंटरप्राइज़ दस्तावेज़ों को संसाधित करने की लागत को कम करते हुए संरचना को संरक्षित करने के लिए डिज़ाइन किया गया है।
वेंचरबीट की रिपोर्ट है कि कोहेरे ने पीडीएफ, पावरपॉइंट फाइलों और जेपीईजी पेजों को संरचित मार्कडाउन में परिवर्तित करने के लिए 2.3 बिलियन-पैरामीटर विज़न-भाषा मॉडल के रूप में पार्स 5 को गुरुवार को जारी किया। रिपोर्ट के अनुसार, मॉडल एक पृष्ठ को एकल दृष्टि-भाषा-मॉडल पास में एक छवि के रूप में संसाधित करता है, जो कई दस्तावेज़ वर्कफ़्लो द्वारा उपयोग किए जाने वाले अलग-अलग ऑप्टिकल-चरित्र-पहचान और भाषा-मॉडल चरणों की जगह लेता है। वेंचरबीट का कहना है कि पार्स 5 में 8,192-टोकन संदर्भ विंडो और लगभग 4.6 गीगाबाइट का फ़ुटप्रिंट है।
रिपोर्ट में कहा गया है कि पार्स 5 का डिफ़ॉल्ट आउटपुट प्रत्येक पृष्ठ के लिए एक मार्कडाउन स्ट्रिंग है, जबकि ब्लॉक मोड टाइप किए गए तत्वों को लौटाता है। तालिकाओं में HTML, विवरण और बाउंडिंग-बॉक्स निर्देशांक शामिल हो सकते हैं, और छवियां विवरण और निर्देशांक प्राप्त कर सकती हैं। वेंचरबीट अरबी, अंग्रेजी, फ्रेंच, जर्मन, इतालवी, जापानी, कोरियाई, पुर्तगाली और स्पेनिश के लिए स्थिर सटीकता की रिपोर्ट करता है, अन्य भाषाओं के लिए कम सटीकता वाले शून्य-शॉट समर्थन के साथ। लेख में कहा गया है कि मॉडल आम तौर पर कोहेयर के एपीआई, मॉडल वॉल्ट, Microsoft फाउंड्री और AWS सेजमेकर के माध्यम से उपलब्ध है।
वेंचरबीट की रिपोर्ट है कि कोहेयर की प्रकाशित पार्सबेंच तुलना ने पार्स 5 को तालिकाओं, सामग्री की विश्वसनीयता और सिमेंटिक फ़ॉर्मेटिंग में 79.2 का स्कोर दिया है। रिपोर्ट में कहा गया है कि स्कोर GPT-5.5 को 84.4 पर, ओपस 4.8 को 84.3 पर और Gemini 3.5 फ्लैश को 81.8 पर पीछे छोड़ता है, जबकि LlamaParse के कॉस्ट इफेक्टिव टियर को 78.3 पर, Mistral OCR 4 को 74.5 पर, डेटाब्रिक्स AI पार्स को 72.4 पर और Azure डॉक्यूमेंट को पीछे छोड़ देता है। 69.3 पर इंटेलिजेंस. ये आंकड़े कोहेरे की तुलना से बताए गए हैं और स्रोत में स्वतंत्र रूप से पुष्टि नहीं की गई है।
रिपोर्ट में कहा गया है कि कोहेयर ने अपने एपीआई के माध्यम से पार्स 5 की कीमत 1.50 डॉलर प्रति 1,000 पृष्ठों पर रखी है और उच्च-मात्रा, एकल-किरायेदार तैनाती के लिए मॉडल वॉल्ट प्रदान करता है। वेंचरबीट ने यह भी रिपोर्ट दी है कि कोहेयर ने सालाना 750 मिलियन दस्तावेज़ों को संसाधित करने के लिए एक वित्तीय-सेवा वर्कफ़्लो का मॉडल तैयार किया है और अनुमान लगाया है कि पार्स 5 GPT-5.5 की तुलना में लागत को 98% से अधिक कम कर देगा। लेख स्पष्ट रूप से उस आंकड़े को एक मॉडल किए गए वर्कफ़्लो के लिए कोहेरे के अनुमान के रूप में चित्रित करता है, न कि ऑडिटेड तैनाती के रूप में। वेंचरबीट का कहना है कि पार्सबेंच ने लेआउट और चार्ट आयामों को बाहर रखा क्योंकि पार्से 5 रीडिंग-ऑर्डर मार्कडाउन लौटाता है और उनके अंतर्निहित डेटा को निकालने के बजाय चार्ट का वर्णन करता है।
स्रोत विवरण: venturebeat.com ↗
यह क्यों मायने रखता है?
उत्पाद एआई तैनाती में एक व्यावहारिक बाधा को लक्षित करता है: प्रत्येक पृष्ठ के लिए फ्रंटियर-मॉडल कीमतों का भुगतान किए बिना टेबल, लेआउट, चार्ट और छवियों को मशीन-पठनीय जानकारी में परिवर्तित करना।
वेंचरबीट की रिपोर्ट पार्स 5 को एंटरप्राइज एआई स्टैक के परिणामी हिस्से में रखती है: दस्तावेज़ अंतर्ग्रहण। व्यावसायिक रिकॉर्ड, प्रपत्र, प्रस्तुतियाँ और स्कैन की गई फ़ाइलों में अक्सर ऐसी जानकारी होती है जिसका अर्थ तालिकाओं, शीर्षकों, दृश्य प्लेसमेंट और पाठ और छवियों के बीच संबंधों पर निर्भर करता है। यदि वे संरचनाएँ पुनर्प्राप्ति या निर्माण से पहले खो जाती हैं, तो बाद की प्रणालियाँ उन्हें पुनर्प्राप्त करने में सक्षम नहीं हो सकती हैं। सूत्र ने विश्लेषक स्टेफ़नी वाल्टर के हवाले से कहा है कि पार्सिंग को एंटरप्राइज़ एआई वर्कफ़्लो के लिए प्रारंभिक गुणवत्ता गेट के रूप में वर्णित किया गया है।
इसलिए उत्पाद का महत्व एकल लीडरबोर्ड स्थिति के बजाय ट्रेड-ऑफ़ पर निर्भर करता है। वेंचरबीट की रिपोर्ट है कि बड़े सामान्य-उद्देश्य वाले मॉडल कोहेयर के घोषित सटीकता आयामों पर उच्च स्कोर करते हैं, लेकिन वे प्रत्येक पृष्ठ पर उपयोग करने के लिए अधिक महंगे और धीमे हो सकते हैं। एक छोटा विशेष मॉडल बड़े पैमाने पर अंतर्ग्रहण को आर्थिक रूप से व्यवहार्य बना सकता है, खासकर जब किसी संगठन में लाखों पृष्ठ हों और बेंचमार्क प्रदर्शन में कुछ कमी को सहन कर सकते हों। यह एक व्यावहारिक परिनियोजन प्रश्न है, यह इस बात का प्रमाण नहीं है कि कुल मिलाकर पार्स 5 अधिक सटीक है।
रिपोर्ट किया गया आउटपुट स्वरूप परिचालनात्मक रूप से भी मायने रख सकता है। वेंचरबीट का कहना है कि पार्स 5 ब्लॉक मोड में तालिकाओं और छवियों के लिए HTML, विवरण और निर्देशांक संलग्न कर सकता है, जिसे कोहेयर एजेंटिक वर्कफ़्लोज़ में उद्धरण-स्तरीय ट्रैसेबिलिटी के लिए उपयोगी मानता है। संरचित आउटपुट डाउनस्ट्रीम सिस्टम को यह पहचानने में मदद कर सकता है कि जानकारी कहां से आई है और उन संबंधों को संरक्षित करता है जो सादे निकाले गए पाठ को खो देते हैं। हालाँकि, स्रोत स्वतंत्र रूप से परीक्षण नहीं करता है कि क्या वे क्षेत्र उत्पादन में पुनर्प्राप्ति, उद्धरण या कार्य सटीकता में सुधार करते हैं।
लागत दावे के संभावित रूप से बड़े निहितार्थ हैं लेकिन इसे सावधानी से व्यवहार किया जाना चाहिए। GPT-5.5 के मुकाबले 98% से अधिक की अनुमानित बचत उच्च-मात्रा दस्तावेज़ प्रसंस्करण के लिए महत्वपूर्ण होगी, फिर भी वेंचरबीट का कहना है कि यह ऑडिटेड ग्राहक तैनाती के बजाय कोहेरे के स्वयं के वर्कफ़्लो अनुमान से आता है। स्रोत कोहेरे के बेंचमार्क के बाहर दस्तावेज़ों पर विलंबता, विफलता दर, कुल परिचालन लागत, एकीकरण प्रयास या पार्स 5 के आउटपुट की गुणवत्ता का स्वतंत्र माप भी प्रदान नहीं करता है। वे अज्ञात उत्पाद के वास्तविक-विश्व लाभ के बारे में जो निष्कर्ष निकाला जा सकता है उसे सीमित करते हैं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
मुख्य अनुत्तरित प्रश्न यह है कि क्या पार्स 5 का रिपोर्ट किया गया मूल्य लाभ ग्राहकों के स्वयं के दस्तावेज़ों पर समान या बेहतर डाउनस्ट्रीम परिणाम उत्पन्न करता है। स्वतंत्र परीक्षण, चार्ट निष्कर्षण, विलंबता, त्रुटि दर और लेखा परीक्षित परिनियोजन डेटा महत्वपूर्ण बने हुए हैं।
सबसे महत्वपूर्ण अगला कदम कठिन, प्रतिनिधि दस्तावेजों पर स्वतंत्र मूल्यांकन है। वेंचरबीट ने विश्लेषक स्टेफनी वाल्टर के हवाले से कहा है कि उद्यमों को अपनी सबसे कठिन फाइलों के खिलाफ पार्सर्स का परीक्षण करने और डाउनस्ट्रीम पुनर्प्राप्ति और कार्य सटीकता को मापने की सलाह दी जाती है, बजाय इसके कि केवल साफ निकाला गया पाठ कैसा दिखता है। उपयोगी परीक्षणों में सघन तालिकाएँ, स्कैन किए गए पृष्ठ, मिश्रित पढ़ने के आदेश, बहुभाषी दस्तावेज़ और पृष्ठ शामिल होंगे जहाँ दृश्य स्वरूपण व्याख्या को बदल देता है। स्रोत ऐसे परीक्षण से कोई स्वतंत्र परिणाम प्रदान नहीं करता है।
चार्ट प्रबंधन निगरानी के लिए एक विशिष्ट सीमा है। वेंचरबीट की रिपोर्ट है कि पार्स 5 चार्ट का वर्णन करता है और एक एजेंट को उन्हें दृश्य रूप से निरीक्षण करने की अनुमति देता है, लेकिन अंतर्निहित चार्ट डेटा को नहीं निकालता है। कोहेयर ने कथित तौर पर कहा कि भविष्य के संस्करण के लिए चार्ट-डेटा निष्कर्षण की योजना बनाई गई है। जब तक वह क्षमता मौजूद नहीं होती और उसका मूल्यांकन नहीं किया जाता, तब तक जो संगठन मात्रात्मक निर्णयों के लिए चार्ट पर भरोसा करते हैं, उन्हें एक अलग उपकरण या मानव समीक्षा कदम की आवश्यकता हो सकती है।
उपलब्धता और तैनाती के दावे भी सत्यापन की गारंटी देते हैं। वेंचरबीट की रिपोर्ट है कि पार्स 5 आम तौर पर कोहेयर के एपीआई, मॉडल वॉल्ट, Microsoft फाउंड्री और AWS सेजमेकर के माध्यम से उपलब्ध है, लेकिन स्रोत स्वतंत्र रूप से क्षेत्रीय उपलब्धता, कोटा, सेवा-स्तर की प्रतिबद्धताओं, विलंबता, बताई गई एपीआई दर के बाहर मूल्य निर्धारण या सभी आउटपुट मोड की पुष्टि नहीं करता है। वे विवरण गोद लेने के निर्णयों को भौतिक रूप से प्रभावित कर सकते हैं।
अंत में, पाठकों को केवल बेंचमार्क रैंकिंग या मॉडल की गई बचत पर निर्भर रहने के बजाय ऑडिट किए गए ग्राहक साक्ष्य पर ध्यान देना चाहिए। वेंचरबीट उन विश्लेषकों को उद्धृत करता है जो पार्स 5 को विरासत ओसीआर और महंगे फ्रंटियर मॉडल के बीच एक मध्य स्थान के रूप में देखते हैं, लेकिन लेख यह स्थापित नहीं करता है कि यह समग्र उद्यम अर्थशास्त्र पर जीत हासिल करता है। त्रुटि सुधार, गोपनीयता नियंत्रण, थ्रूपुट, डाउनस्ट्रीम एजेंट प्रदर्शन और अपवादों को संभालने की कुल लागत के बारे में साक्ष्य यह निर्धारित करेंगे कि रिपोर्ट किया गया मूल्य-से-प्रदर्शन मामला कोहेयर की अपनी तुलना से परे है या नहीं।