क्या हुआ?
शोधकर्ताओं ने रोबोफिज-3डी पेश किया, जो 3डी पुनर्निर्माण, राज्य समझ और कार्य-स्तरीय उपायों के माध्यम से सन्निहित विश्व मॉडल के मूल्यांकन के लिए एक बेंचमार्क है। बेंचमार्क में 50 हेरफेर कार्य, 5,000 एपिसोड और 25,000 मल्टी-व्यू जमीनी सच्चाई वाले वीडियो शामिल हैं। पेपर की रिपोर्ट है कि कॉसमॉस 3 ने चार परीक्षण किए गए वीडियो वर्ल्ड मॉडल के बीच उच्चतम रोबोफिस्कोर हासिल किया, जबकि निष्पादन-आधारित मेट्रिक्स ने उन कमजोरियों को उजागर किया जो अवधारणात्मक और दृष्टि-भाषा-मॉडल निर्णयों पर कब्जा नहीं कर सके।
28 अगस्त, 2026 को arXiv को प्रस्तुत एक पेपर, रोबोफिज-3डी को सन्निहित विश्व मॉडल के लिए एक बेंचमार्क के रूप में पेश करता है। लेखक इस समस्या को वीडियो वर्ल्ड मॉडल के इर्द-गिर्द रखते हैं जिनका उपयोग डेटा इंजन, एक्शन प्लानर और सन्निहित एआई के लिए सिमुलेटर के रूप में किया जाता है। उनकी आलोचना यह है कि पारंपरिक सन्निहित विश्व-मॉडल मूल्यांकन त्रि-आयामी दृश्य संरचना और निष्पादन योग्य क्रियाओं पर आधारित एकीकृत प्रोटोकॉल प्रदान नहीं करते हैं। RoboPhys-3D को RoboTwin 2.0 पर बनाया गया है और यह 5,000 एपिसोड और 25,000 मल्टी-व्यू ग्राउंड-ट्रूथ वीडियो के साथ चार शासनों में 50 हेरफेर कार्यों को कवर करता है।
बेंचमार्क प्रक्रियाओं ने समान 3डी पुनर्निर्माण पाइपलाइन के माध्यम से वीडियो और जमीनी सच्चाई वाले वीडियो तैयार किए। पेपर के अनुसार, इस डिज़ाइन का उद्देश्य पुनर्निर्माण प्रक्रिया द्वारा उत्पन्न त्रुटियों को उत्पन्न वीडियो के कारण होने वाली त्रुटियों से अलग करना है। रोबोफिज-3डी 50 मेट्रिक्स को 18 उप-आयामों और चार मूल्यांकन स्तरों में समूहित करता है: पिक्सेल-स्तरीय निष्ठा, 3डी ज्यामिति स्थिरता, राज्य-स्तरीय समझ और कार्य-स्तरीय पूर्णता। लेखक औसत पूर्ण स्कोर भी पेश करते हैं, जो सभी 50 मेट्रिक्स का औसत है, और रोबोफिस्कोर, मेट्रिक्स के आधार पर एक छोटा कार्य-संरेखित स्कोर, जिसे वे कार्य की सफलता के साथ सबसे दृढ़ता से सहसंबद्ध बताते हैं।
चार प्रतिनिधि वीडियो विश्व मॉडलों के लिए सार रिपोर्ट परिणाम। कॉसमॉस 3 को 0.6330 के स्कोर के साथ उच्चतम रोबोफिस्कोर प्राप्त हुआ, जिसे जमीनी सच्चाई स्कोर का 92.7% बताया गया है। पेपर में कहा गया है कि राज्य- और निष्पादन-आधारित उपायों से पर्याप्त विफलताओं का पता चला है जिन्हें अवधारणात्मक मेट्रिक्स या दृष्टि-भाषा मॉडल से निर्णय द्वारा पकड़ नहीं लिया गया था। यह 0.9761 के पियर्सन सहसंबंध और 0.8962 के स्पीयरमैन सहसंबंध के साथ रोबोफिस्कोर और मानव मूल्यांकन के बीच मजबूत समझौते की भी रिपोर्ट करता है। ये संस्करण-एक arXiv प्रीप्रिंट के दावे हैं; स्रोत स्वतंत्र सत्यापन या सार के पीछे पूर्ण प्रयोगात्मक विवरण प्रदान नहीं करता है।
यह क्यों मायने रखता है?
कार्य सन्निहित एआई में एक केंद्रीय समस्या को संबोधित करता है: एक उत्पन्न वीडियो दृश्य को गलत तरीके से प्रस्तुत करते हुए या उपयोगी कार्रवाई का समर्थन करने में विफल होने पर ठोस लग सकता है। एक बेंचमार्क जो दृश्य भविष्यवाणी को 3डी स्थिति और कार्य पूर्णता से जोड़ता है, शोधकर्ताओं को सिस्टम की तुलना करने का अधिक व्यावहारिक तरीका दे सकता है, हालांकि पेपर एक प्रीप्रिंट है और सार भौतिक रोबोट पर या इसकी बेंचमार्क सेटिंग के बाहर प्रदर्शन स्थापित नहीं करता है।
पेपर का केंद्रीय योगदान यह मापने का प्रयास है कि जेनरेट किया गया रोलआउट प्रशंसनीय लगता है या नहीं। किसी रोबोट का मार्गदर्शन करने के उद्देश्य से बनाई गई प्रणाली के लिए, यदि पूर्वानुमानित ज्यामिति, वस्तु स्थिति या क्रियाओं का क्रम गलत है, तो अकेले दृश्य समानता अपर्याप्त हो सकती है। पिक्सेल-स्तरीय निष्ठा के साथ 3डी स्थिरता और कार्य-स्तरीय पूर्णता को शामिल करके, रोबोफिज-3डी आकर्षक वीडियो पीढ़ी को भविष्यवाणियों से अलग करने में मदद कर सकता है जो योजना और निष्पादन के लिए आवश्यक जानकारी को संरक्षित करता है। यह अंतर सीधे तौर पर इस बात से प्रासंगिक है कि सन्निहित एआई सिस्टम का मूल्यांकन और सुधार कैसे किया जाता है।
साझा पुनर्निर्माण पाइपलाइन संभावित रूप से उपयोगी है क्योंकि यह उत्पन्न और संदर्भ वीडियो को एक सामान्य माप प्रक्रिया प्रदान करती है। यदि पुनर्निर्माण कलाकृतियाँ तुलनात्मक तरीके से तुलना के दोनों पक्षों को प्रभावित करती हैं, तो शोधकर्ता बेहतर ढंग से यह पहचानने में सक्षम हो सकते हैं कि कम स्कोर विश्व मॉडल में या मूल्यांकनकर्ता में किसी समस्या को दर्शाता है या नहीं। स्रोत केवल यह बताता है कि पाइपलाइन इस भेद को सक्षम बनाती है; यह स्थापित नहीं करता है कि पृथक्करण सही है या प्रत्येक पुनर्निर्माण विफलता का विश्वसनीय रूप से निदान किया जा सकता है।
रोबोफिस्कोर और मानव मूल्यांकन के बीच रिपोर्ट किए गए संबंध से पता चलता है कि प्रस्तावित कॉम्पैक्ट स्कोर परीक्षण सेटिंग में मानव निर्णयों को ट्रैक कर सकता है। यदि दोहराया जाए, तो कार्य-संरेखित स्कोर दर्जनों असंबंधित मीट्रिक की रिपोर्ट करने की तुलना में तुलना को आसान बना सकता है। हालाँकि, सबूत पेपर के अपने बेंचमार्क, चार प्रतिनिधि मॉडल और बताए गए मूल्यांकन डिज़ाइन से बंधे हुए हैं। स्रोत यह नहीं दिखाता है कि एक उच्च रोबोफिस्कोर सफल भौतिक हेरफेर की गारंटी देता है, अनदेखे वातावरण को सामान्य बनाता है या सुरक्षा-महत्वपूर्ण तैनाती में प्रदर्शन की भविष्यवाणी करता है।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
महत्वपूर्ण अगले चरण हैं स्वतंत्र प्रतिकृति, बेंचमार्क के विस्तृत कार्य और मूल्यांकन प्रक्रियाओं का प्रकाशन, और सबूत कि रोबोफिस्कोर नए वातावरण या वास्तविक हार्डवेयर पर प्रदर्शन की भविष्यवाणी करता है। पाठकों को यह भी देखना चाहिए कि क्या मॉडल रैंकिंग कार्य प्रकारों में स्थिर रहती है, पुनर्निर्माण त्रुटियां स्कोर को कैसे प्रभावित करती हैं, और क्या मानव मूल्यांकन के साथ रिपोर्ट किया गया समझौता व्यापक परीक्षण के अंतर्गत है।
बेंचमार्क का व्यावहारिक मूल्य स्रोत के सार में शामिल नहीं किए गए विवरणों पर निर्भर करेगा: सभी चार परीक्षण किए गए मॉडल की पहचान और कॉन्फ़िगरेशन, सटीक कार्य व्यवस्था, 50 मेट्रिक्स, पुनर्निर्माण कार्यान्वयन और कार्य की सफलता से संबंधित मेट्रिक्स की पहचान करने के लिए उपयोग किए जाने वाले मानदंड। वे विवरण प्रतिकृति के लिए और यह निर्णय लेने के लिए महत्वपूर्ण हैं कि क्या रोबोफिस्कोर एक व्यापक क्षमता को मापता है या बेंचमार्क के कार्य वितरण के साथ निकटता से फिट बैठता है।
एक अज्ञात कुंजी रोबोट्विन 2.0 द्वारा दर्शाए गए रिकॉर्ड किए गए वीडियो और सिम्युलेटेड या बेंचमार्क एपिसोड से परे स्थानांतरण है। स्रोत भौतिक रोबोट, नए वातावरण, सेंसर शोर, वास्तविक समय की बाधाओं या अपरिचित वस्तु व्यवस्था पर परीक्षणों की रिपोर्ट नहीं करता है। अनुवर्ती कार्य में यह परीक्षण किया जाना चाहिए कि क्या स्कोर उन परिस्थितियों में कार्रवाई की सफलता की भविष्यवाणी करते हैं, जहां ज्यामिति या स्थिति में छोटी त्रुटियों के ऑफ़लाइन मूल्यांकन की तुलना में बड़े परिणाम हो सकते हैं।
शोधकर्ताओं को यह भी जांचना चाहिए कि रिपोर्ट की गई मॉडल रैंकिंग कितनी स्थिर है। सार कॉसमॉस 3 का रोबोफिस्कोर देता है लेकिन अन्य प्रणालियों के स्कोर, अनिश्चितता सीमा या प्रति-कार्य भिन्नता की पहचान नहीं करता है। भविष्य के संस्करण और स्वतंत्र अध्ययन दिखा सकते हैं कि क्या अवधारणात्मक और दृष्टि-भाषा-मॉडल मूल्यांकन लगातार विफलता के समान वर्गों को याद करते हैं, क्या पुनर्निर्माण विकल्प भौतिक रूप से रैंकिंग बदलते हैं, और क्या मॉडल वास्तविक दुनिया के निष्पादन में सुधार किए बिना बेंचमार्क के लिए अनुकूलन कर सकते हैं। रिपोर्ट किए गए पियर्सन और स्पीयरमैन सहसंबंध भी व्यापक मानव-रेटिंग नमूनों और विभिन्न कार्य संग्रहों पर प्रतिकृति की गारंटी देते हैं।