समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

CoVA-SFT डेटासेट का उद्देश्य दृश्य अमूर्तता के माध्यम से मल्टीमॉडल AI को तर्क करना सिखाना है

शोधकर्ताओं ने CoVA-SFT, 51,900 मल्टीमॉडल उदाहरणों और 222,000 से अधिक तर्क चरणों का एक डेटासेट पेश किया है, जिसमें बताया गया है कि फाइन-ट्यून किए गए मॉडल अपने साथी बेंचमार्क पर इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन के प्रदर्शन को दोगुना से अधिक कर देते हैं।

5 min readRead the primary source
Source-page capture accompanying CoVA-SFT dataset aims to teach multimodal AI to reason through visual abstractions
प्राथमिक-स्रोत दस्तावेज़स्रोत रिकार्ड किया गया
प्रकाशक
arxiv.org
स्रोत लिंक
arxiv.orghttps://arxiv.org/abs/2608.28958
स्रोत प्रकार
प्राथमिक दस्तावेज़ - एक आधिकारिक घोषणा, कागज, फाइलिंग, या प्रथम-पक्ष पृष्ठ जिसे हम सीधे पढ़ते हैं।
प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

डेटासेट
प्रशिक्षण, सत्यापन या परीक्षण के लिए उपयोग किए जाने वाले संरचित या असंरचित उदाहरणों का संग्रह।
विचार की शृंखला
एक तर्क शैली जहां एक एआई मॉडल किसी समस्या को मध्यवर्ती चरणों में विघटित करता है।
मूल्यांकन सेट
प्रशिक्षण के बाद मॉडल की गुणवत्ता को मापने के लिए उपयोग किया जाने वाला एक आयोजित डेटासेट।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

एक arXiv पेपर CoVA-SFT का परिचय देता है, जो एक संरचित प्रशिक्षण डेटासेट है जो मल्टीमॉडल भाषा मॉडल को तर्क समस्याओं को हल करते समय दृश्य अमूर्तता का उपयोग करने में मदद करने के लिए डिज़ाइन किया गया है। डेटासेट में 51,900 नमूने, 222,000 से अधिक मल्टीमॉडल तर्क चरण, पांच लेआउट परिवार और 17 जटिल कार्य शामिल हैं। लेखकों ने 1,700-सैंपल हेल्ड-आउट बेंचमार्क, CoVA-बेंच भी पेश किया है। वे रिपोर्ट करते हैं कि CoVA-SFT पर फाइन-ट्यून किए गए मॉडल ने इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन से औसतन दो गुना से अधिक बेहतर प्रदर्शन किया है, जबकि अभी भी मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट बेसलाइन से पीछे हैं।

29 अगस्त, 2026 को arXiv को प्रस्तुत किया गया पेपर, CoVA-SFT को मल्टीमॉडल भाषा मॉडल के लिए एक प्रशिक्षण कोष के रूप में प्रस्तुत करता है। इसका केंद्रीय आधार यह है कि केवल पाठ-श्रृंखला-विचार तर्क दृश्य समस्याओं के लिए एक अजीब फिट है क्योंकि यह दृश्य संरचना को गद्य में मजबूर करता है। इसके बजाय लेखक एक ऐसी विधि का वर्णन करते हैं जिसमें मॉडल कार्यों को हल करते समय दृश्य अमूर्तता के साथ पाठ को जोड़ते हैं।

पेपर के सार के अनुसार, CoVA-SFT में 51,900 नमूने और 222,000 से अधिक मल्टीमॉडल तर्क चरण शामिल हैं। उदाहरणों में पांच लेआउट परिवार और 17 जटिल कार्य शामिल हैं। सूत्र का कहना है कि कॉर्पस में स्पष्ट तर्क सूत्रीकरण, एजेंटिक रेंडरिंग और सत्यापन लूप शामिल हैं, जिनका उद्देश्य मॉडलों को तर्क के दौरान आंतरिक दृश्य कार्यक्षेत्र का निर्माण और रखरखाव करना सिखाना है।

लेखक CoVA-बेंच भी पेश करते हैं, जो एक सहयोगी मूल्यांकन सेट है जिसमें समान कार्य श्रेणियों में 1,700 आयोजित परीक्षण नमूने शामिल हैं। बेंचमार्क को दृष्टिकोणों के बीच प्रतिलिपि प्रस्तुत करने योग्य तुलनाओं का समर्थन करने के एक तरीके के रूप में प्रस्तुत किया गया है। स्रोत व्यक्तिगत कार्य, उनके बीच नमूनों का वितरण, मूल्यांकन किए गए मॉडल की पहचान या पूर्ण स्कोरिंग पद्धति प्रदान नहीं करता है।

पेपर की रिपोर्ट है कि CoVA-SFT पर फाइन-ट्यून किए गए मॉडल ने CoVA-बेंच पर सभी इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन से औसतन दो गुना से अधिक बेहतर प्रदर्शन किया। यह परिणाम लेखकों द्वारा किया गया दावा है और यहां स्वतंत्र रूप से सत्यापित नहीं किया गया है। वही सार कहता है कि वे मॉडल अभी भी मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट बेसलाइन से कम हैं, जिससे परिणाम कुछ मल्टीमॉडल दृष्टिकोणों पर सुधार के बजाय इस बात का सबूत है कि व्यापक दृश्य-तर्क समस्या हल हो गई है।

स्रोत विवरण: arxiv.org ↗

यह क्यों मायने रखता है?

कार्य मल्टीमॉडल एआई में एक विशिष्ट सीमा को लक्षित करता है: मॉडल दृश्य इनपुट प्राप्त कर सकते हैं, लेकिन प्रशिक्षण डेटा हमेशा उन्हें दृश्य मध्यवर्ती अभ्यावेदन का निर्माण, रखरखाव और सत्यापन करना नहीं सिखाता है। एक बड़ा, प्रतिलिपि प्रस्तुत करने योग्य डेटासेट और बेंचमार्क शोधकर्ताओं को उस समस्या का अध्ययन करने का एक सामान्य तरीका दे सकता है। हालाँकि, पेपर के अपने परिणाम योग्य हैं: रिपोर्ट किए गए लाभ को CoVA-बेंच पर मापा जाता है, और सुव्यवस्थित मॉडल मजबूत टेक्स्ट-ओनली रीजनिंग सिस्टम के पीछे रहते हैं।

मल्टीमॉडल सिस्टम को अक्सर स्थानिक संबंधों, लेआउट और अन्य संरचनाओं के बारे में तर्क करने की आवश्यकता होती है जिन्हें शब्दों के अनुक्रम में ईमानदारी से प्रस्तुत करना मुश्किल होता है। CoVA-SFT दृश्य मध्यवर्ती अभ्यावेदन को उदाहरणों का हिस्सा बनाकर सीधे उस प्रशिक्षण समस्या का समाधान करता है। यदि दृष्टिकोण सामान्यीकृत होता है, तो यह मॉडल को उन कार्यों को संभालने में मदद कर सकता है जहां संरचना को संरक्षित करना उतना ही मायने रखता है जितना कि व्यक्तिगत वस्तुओं को पहचानना या पाठ पढ़ना।

स्रोत द्वारा वर्णित संकीर्ण समस्या के भीतर प्रस्तावित कोष का पैमाना महत्वपूर्ण है। 222,000 से अधिक तर्क चरण शोधकर्ताओं को यह अध्ययन करने के लिए एक बड़ा लक्ष्य देते हैं कि प्रदर्शनों के एक छोटे संग्रह की तुलना में दृश्य अमूर्तता और आत्म-सुधार मॉडल व्यवहार को कैसे प्रभावित करते हैं। CoVA-बेंच एक निश्चित मूल्यांकन बिंदु जोड़ता है, जिससे भविष्य की प्रणालियों में परिणामों की तुलना करना आसान हो सकता है।

रिपोर्ट किया गया परिणाम भी भौतिक रूप से सीमित है। लेखक इंटरलीव्ड चेन-ऑफ-थॉट बेसलाइन के मुकाबले तुलना करते हैं और अपने बेंचमार्क पर दोगुने से अधिक औसत लाभ की रिपोर्ट करते हैं, लेकिन वे स्वीकार करते हैं कि फाइन-ट्यून किए गए मॉडल मजबूत टेक्स्ट-ओनली चेन-ऑफ-थॉट सिस्टम से नीचे रहते हैं। इससे पता चलता है कि प्रस्तावित प्रतिनिधित्व सबसे मजबूत पाठ-आधारित तरीकों की तर्क क्षमता से मेल खाए बिना एक बाधा को संबोधित कर सकता है।

व्यावहारिक मूल्य स्रोत पृष्ठ से अनुपस्थित विवरण पर निर्भर करेगा। यह स्पष्ट नहीं है कि क्या डेटासेट, एनोटेशन, रेंडरिंग टूल या प्रशिक्षित चेकपॉइंट सार्वजनिक रूप से उपलब्ध हैं, फाइन-ट्यूनिंग कितनी महंगी है, या क्या उदाहरण बेंचमार्क के बाहर सामने आई दृश्य स्थितियों को दर्शाते हैं। स्रोत उच्च जोखिम वाले अनुप्रयोगों में सुरक्षा, जनसांख्यिकीय कवरेज, पहुंच या प्रदर्शन के बारे में कोई सबूत नहीं देता है।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

अगला महत्वपूर्ण परीक्षण यह है कि क्या CoVA-SFT अपने संबद्ध बेंचमार्क से परे प्रदर्शन में सुधार करता है और मॉडल, लेआउट और वास्तविक दुनिया के दृश्य कार्यों में स्थानांतरित होता है। शोधकर्ताओं को यह भी जांचना चाहिए कि क्या डेटासेट के स्पष्ट तर्क और सत्यापन लूप विश्वसनीयता में सुधार करते हैं या मुख्य रूप से बेंचमार्क-विशिष्ट व्यवहार को प्रोत्साहित करते हैं। स्रोत डेटासेट का लाइसेंस, सार्वजनिक डाउनलोड स्थिति, प्रशिक्षण लागत, मॉडल आर्किटेक्चर, कार्य-स्तर के परिणाम या बाहरी मूल्यांकन पर प्रदर्शन स्थापित नहीं करता है।

बाहरी सत्यापन पहली प्राथमिकता होनी चाहिए. स्वतंत्र विज़ुअल-रीज़निंग डेटासेट पर परिणाम यह दिखाने में मदद करेंगे कि क्या CoVA-SFT, CoVA-बेंच में दर्शाए गए लेआउट और कार्यों के लिए अनुकूलन के बजाय हस्तांतरणीय क्षमता सिखाता है। तुलनाओं में समान आधार मॉडल, बजट की गणना और संकेत देने वाली स्थितियाँ शामिल होनी चाहिए ताकि रिपोर्ट किए गए लाभ की निष्पक्ष व्याख्या की जा सके।

शोधकर्ताओं को रिपोर्ट किए गए औसत के पीछे कार्य-स्तर की भिन्नता को देखना चाहिए। दोगुने से अधिक समग्र सुधार से कुछ लेआउट परिवारों पर बड़े लाभ और दूसरों पर बहुत कम या कोई सुधार नहीं हो सकता है। स्रोत यह नहीं बताता है कि प्रदर्शन में वृद्धि सभी 17 कार्यों में सुसंगत है या नहीं, न ही यह त्रुटि पैटर्न या आत्मविश्वास उपायों की रिपोर्ट करता है।

लेखकों द्वारा वर्णित सत्यापन लूप बारीकी से जांच के योग्य हैं। वे मॉडलों को मध्यवर्ती दृश्य संरचनाओं में गलतियाँ पकड़ने में मदद कर सकते हैं, लेकिन वे सही अंतिम उत्तर सुनिश्चित किए बिना अनुमान लागत भी जोड़ सकते हैं या विश्वसनीयता की उपस्थिति उत्पन्न कर सकते हैं। भविष्य के मूल्यांकन में सटीकता, अंशांकन, गणना और विफलता पुनर्प्राप्ति को अलग से मापा जाना चाहिए।

अंततः, फ़ील्ड को पहुंच और प्रतिलिपि प्रस्तुत करने योग्यता के बारे में स्पष्ट जानकारी की आवश्यकता होगी। स्रोत ईएमएनएलपी 2026 निष्कर्षों के लिए स्वीकृत पेपर की पहचान करता है, लेकिन यह डेटासेट के लाइसेंस, रिलीज स्थान, एनोटेशन प्रक्रिया या हार्डवेयर आवश्यकताओं को नहीं बताता है। वे विवरण यह निर्धारित करेंगे कि क्या CoVA-SFT एक व्यापक रूप से प्रयोग करने योग्य अनुसंधान संसाधन बन जाएगा या मुख्य रूप से एक पेपर-विशिष्ट प्रशिक्षण पद्धति बनी रहेगी।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याट्रांसफार्मरएआई प्रशिक्षणChatGPT और एलएलएमआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?