क्या हुआ?
एक arXiv पेपर CoVA-SFT का परिचय देता है, जो एक संरचित प्रशिक्षण डेटासेट है जो मल्टीमॉडल भाषा मॉडल को तर्क समस्याओं को हल करते समय दृश्य अमूर्तता का उपयोग करने में मदद करने के लिए डिज़ाइन किया गया है। डेटासेट में 51,900 नमूने, 222,000 से अधिक मल्टीमॉडल तर्क चरण, पांच लेआउट परिवार और 17 जटिल कार्य शामिल हैं। लेखकों ने 1,700-सैंपल हेल्ड-आउट बेंचमार्क, CoVA-बेंच भी पेश किया है। वे रिपोर्ट करते हैं कि CoVA-SFT पर फाइन-ट्यून किए गए मॉडल ने इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन से औसतन दो गुना से अधिक बेहतर प्रदर्शन किया है, जबकि अभी भी मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट बेसलाइन से पीछे हैं।
29 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, CoVA-SFT को मल्टीमॉडल भाषा मॉडल के लिए एक प्रशिक्षण कोष के रूप में प्रस्तुत करता है। इसका केंद्रीय आधार यह है कि केवल पाठ-श्रृंखला-विचार तर्क दृश्य समस्याओं के लिए एक अजीब फिट है क्योंकि यह दृश्य संरचना को गद्य में मजबूर करता है। इसके बजाय लेखक एक ऐसी विधि का वर्णन करते हैं जिसमें मॉडल कार्यों को हल करते समय दृश्य अमूर्तता के साथ पाठ को जोड़ते हैं।
पेपर के सार के अनुसार, CoVA-SFT में 51,900 नमूने और 222,000 से अधिक मल्टीमॉडल तर्क चरण शामिल हैं। उदाहरणों में पांच लेआउट परिवार और 17 जटिल कार्य शामिल हैं। सूत्र का कहना है कि कॉर्पस में स्पष्ट तर्क सूत्रीकरण, एजेंटिक रेंडरिंग और सत्यापन लूप शामिल हैं, जिनका उद्देश्य मॉडलों को तर्क के दौरान आंतरिक दृश्य कार्यक्षेत्र का निर्माण और रखरखाव करना सिखाना है।
लेखक CoVA-बेंच भी पेश करते हैं, जो एक सहयोगी मूल्यांकन सेट है जिसमें समान कार्य श्रेणियों में 1,700 आयोजित परीक्षण नमूने शामिल हैं। बेंचमार्क को दृष्टिकोणों के बीच प्रतिलिपि प्रस्तुत करने योग्य तुलनाओं का समर्थन करने के एक तरीके के रूप में प्रस्तुत किया गया है। स्रोत व्यक्तिगत कार्य, उनके बीच नमूनों का वितरण, मूल्यांकन किए गए मॉडल की पहचान या पूर्ण स्कोरिंग पद्धति प्रदान नहीं करता है।
पेपर की रिपोर्ट है कि CoVA-SFT पर फाइन-ट्यून किए गए मॉडल ने CoVA-बेंच पर सभी इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन से औसतन दो गुना से अधिक बेहतर प्रदर्शन किया। यह परिणाम लेखकों द्वारा किया गया दावा है और यहां स्वतंत्र रूप से सत्यापित नहीं किया गया है। वही सार कहता है कि वे मॉडल अभी भी मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट बेसलाइन से कम हैं, जिससे परिणाम कुछ मल्टीमॉडल दृष्टिकोणों पर सुधार के बजाय इस बात का सबूत है कि व्यापक दृश्य-तर्क समस्या हल हो गई है।
यह क्यों मायने रखता है?
कार्य मल्टीमॉडल एआई में एक विशिष्ट सीमा को लक्षित करता है: मॉडल दृश्य इनपुट प्राप्त कर सकते हैं, लेकिन प्रशिक्षण डेटा हमेशा उन्हें दृश्य मध्यवर्ती अभ्यावेदन का निर्माण, रखरखाव और सत्यापन करना नहीं सिखाता है। एक बड़ा, प्रतिलिपि प्रस्तुत करने योग्य डेटासेट और बेंचमार्क शोधकर्ताओं को उस समस्या का अध्ययन करने का एक सामान्य तरीका दे सकता है। हालाँकि, पेपर के अपने परिणाम योग्य हैं: रिपोर्ट किए गए लाभ को CoVA-बेंच पर मापा जाता है, और सुव्यवस्थित मॉडल मजबूत टेक्स्ट-ओनली रीजनिंग सिस्टम के पीछे रहते हैं।
मल्टीमॉडल सिस्टम को अक्सर स्थानिक संबंधों, लेआउट और अन्य संरचनाओं के बारे में तर्क करने की आवश्यकता होती है जिन्हें शब्दों के अनुक्रम में ईमानदारी से प्रस्तुत करना मुश्किल होता है। CoVA-SFT दृश्य मध्यवर्ती अभ्यावेदन को उदाहरणों का हिस्सा बनाकर सीधे उस प्रशिक्षण समस्या का समाधान करता है। यदि दृष्टिकोण सामान्यीकृत होता है, तो यह मॉडल को उन कार्यों को संभालने में मदद कर सकता है जहां संरचना को संरक्षित करना उतना ही मायने रखता है जितना कि व्यक्तिगत वस्तुओं को पहचानना या पाठ पढ़ना।
स्रोत द्वारा वर्णित संकीर्ण समस्या के भीतर प्रस्तावित कोष का पैमाना महत्वपूर्ण है। 222,000 से अधिक तर्क चरण शोधकर्ताओं को यह अध्ययन करने के लिए एक बड़ा लक्ष्य देते हैं कि प्रदर्शनों के एक छोटे संग्रह की तुलना में दृश्य अमूर्तता और आत्म-सुधार मॉडल व्यवहार को कैसे प्रभावित करते हैं। CoVA-बेंच एक निश्चित मूल्यांकन बिंदु जोड़ता है, जिससे भविष्य की प्रणालियों में परिणामों की तुलना करना आसान हो सकता है।
रिपोर्ट किया गया परिणाम भी भौतिक रूप से सीमित है। लेखक इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन के मुकाबले तुलना करते हैं और अपने बेंचमार्क पर दोगुने से अधिक औसत लाभ की रिपोर्ट करते हैं, लेकिन वे स्वीकार करते हैं कि फाइन-ट्यून किए गए मॉडल मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट सिस्टम से नीचे रहते हैं। इससे पता चलता है कि प्रस्तावित प्रतिनिधित्व सबसे मजबूत पाठ-आधारित तरीकों की तर्क क्षमता से मेल खाए बिना एक बाधा को संबोधित कर सकता है।
व्यावहारिक मूल्य स्रोत पृष्ठ से अनुपस्थित विवरण पर निर्भर करेगा। यह स्पष्ट नहीं है कि क्या डेटासेट, एनोटेशन, रेंडरिंग टूल या प्रशिक्षित चेकपॉइंट सार्वजनिक रूप से उपलब्ध हैं, फाइन-ट्यूनिंग कितनी महंगी है, या क्या उदाहरण बेंचमार्क के बाहर सामने आई दृश्य स्थितियों को दर्शाते हैं। स्रोत उच्च जोखिम वाले अनुप्रयोगों में सुरक्षा, जनसांख्यिकीय कवरेज, पहुंच या प्रदर्शन के बारे में कोई सबूत नहीं देता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
अगला महत्वपूर्ण परीक्षण यह है कि क्या CoVA-SFT अपने संबद्ध बेंचमार्क से परे प्रदर्शन में सुधार करता है और मॉडल, लेआउट और वास्तविक दुनिया के दृश्य कार्यों में स्थानांतरित होता है। शोधकर्ताओं को यह भी जांचना चाहिए कि क्या डेटासेट के स्पष्ट तर्क और सत्यापन लूप विश्वसनीयता में सुधार करते हैं या मुख्य रूप से बेंचमार्क-विशिष्ट व्यवहार को प्रोत्साहित करते हैं। स्रोत डेटासेट का लाइसेंस, सार्वजनिक डाउनलोड स्थिति, प्रशिक्षण लागत, मॉडल आर्किटेक्चर, कार्य-स्तर के परिणाम या बाहरी मूल्यांकन पर प्रदर्शन स्थापित नहीं करता है।
बाहरी सत्यापन पहली प्राथमिकता होनी चाहिए. स्वतंत्र विज़ुअल-रीज़निंग डेटासेट पर परिणाम यह दिखाने में मदद करेंगे कि क्या CoVA-SFT, CoVA-बेंच में दर्शाए गए लेआउट और कार्यों के लिए अनुकूलन के बजाय हस्तांतरणीय क्षमता सिखाता है। तुलनाओं में समान आधार मॉडल, बजट की गणना और संकेत देने वाली स्थितियाँ शामिल होनी चाहिए ताकि रिपोर्ट किए गए लाभ की निष्पक्ष व्याख्या की जा सके।
शोधकर्ताओं को रिपोर्ट किए गए औसत के पीछे कार्य-स्तर की भिन्नता को देखना चाहिए। दोगुने से अधिक समग्र सुधार से कुछ लेआउट परिवारों पर बड़े लाभ और दूसरों पर बहुत कम या कोई सुधार नहीं हो सकता है। स्रोत यह नहीं बताता है कि प्रदर्शन में वृद्धि सभी 17 कार्यों में सुसंगत है या नहीं, न ही यह त्रुटि पैटर्न या आत्मविश्वास उपायों की रिपोर्ट करता है।
लेखकों द्वारा वर्णित सत्यापन लूप बारीकी से जांच के योग्य हैं। वे मॉडलों को मध्यवर्ती दृश्य संरचनाओं में गलतियाँ पकड़ने में मदद कर सकते हैं, लेकिन वे सही अंतिम उत्तर सुनिश्चित किए बिना अनुमान लागत भी जोड़ सकते हैं या विश्वसनीयता की उपस्थिति उत्पन्न कर सकते हैं। भविष्य के मूल्यांकन में सटीकता, अंशांकन, गणना और विफलता पुनर्प्राप्ति को अलग से मापा जाना चाहिए।
अंततः, फ़ील्ड को पहुंच और प्रतिलिपि प्रस्तुत करने योग्यता के बारे में स्पष्ट जानकारी की आवश्यकता होगी। स्रोत ईएमएनएलपी 2026 निष्कर्षों के लिए स्वीकृत पेपर की पहचान करता है, लेकिन यह डेटासेट के लाइसेंस, रिलीज स्थान, एनोटेशन प्रक्रिया या हार्डवेयर आवश्यकताओं को नहीं बताता है। वे विवरण यह निर्धारित करेंगे कि क्या CoVA-SFT एक व्यापक रूप से प्रयोग करने योग्य अनुसंधान संसाधन बन जाएगा या मुख्य रूप से एक पेपर-विशिष्ट प्रशिक्षण पद्धति बनी रहेगी।