विश्व मॉडल और सीखे हुए सिमुलेटर
विश्व मॉडल एक तंत्रिका नेटवर्क है जो भविष्यवाणी करना सीखता है कि समय के साथ वातावरण कैसे बदलता है, जिससे एआई को कार्य करने से पहले भविष्य के परिणामों की 'कल्पना' करने की सुविधा मिलती है।
सिंहावलोकन
Learned simulators take this further, generating interactive, playable environments from data instead of being hand-coded by engineers.
गहरा गोता
क्या करना है यह याद रखने के बजाय, एक विश्व मॉडल एक पर्यावरण की गतिशीलता को पकड़ता है: वर्तमान स्थिति और एक प्रस्तावित कार्रवाई को देखते हुए, यह अगले अवलोकन की भविष्यवाणी करता है। हा और श्मिडहुबर द्वारा क्लासिक 2018 'वर्ल्ड मॉडल्स' पेपर ने एक ऑटोएनकोडर के साथ गेम फ्रेम को संपीड़ित किया, एक आवर्ती नेटवर्क के साथ उनकी गतिशीलता को मॉडल किया, और इस सीखे हुए 'सपने' के अंदर लगभग पूरी तरह से एक नियंत्रक को प्रशिक्षित किया। डीपमाइंड की ड्रीमर लाइन काल्पनिक प्रक्षेप पथों को चलाकर अव्यक्त गतिशीलता और योजनाएं सीखती है, और ड्रीमरवी3 ने विविध कार्यों में महारत हासिल की है - यहां तक कि माइनक्राफ्ट में शुरुआत से हीरों को इकट्ठा करना भी। हाल ही में, Google का जिन्न छवियों और बिना लेबल वाले वीडियो से नियंत्रणीय 2D दुनिया उत्पन्न करता है, और GameNGen ने केवल एक प्रसार मॉडल का उपयोग करके वास्तविक समय में गेम DOOM को पुन: पेश किया। अपील: एजेंट जोखिम भरी, धीमी वास्तविकता के बजाय सस्ती, तेज़ कल्पना में सीख सकते हैं या परीक्षण कर सकते हैं।
तकनीकी अंतर्दृष्टि
विश्व मॉडल आम तौर पर उच्च-आयामी अवलोकनों को एक कॉम्पैक्ट अव्यक्त स्थिति में एन्कोड करते हैं, फिर अगली अव्यक्त स्थिति की भविष्यवाणी करने और एक कार्रवाई से इनाम पाने के लिए एक संक्रमण फ़ंक्शन सीखते हैं। योजना 'रोलआउट' का उपयोग करती है: आगे के कई क्रिया अनुक्रमों की कल्पना करना और सर्वश्रेष्ठ चुनना, या कल्पित डेटा पर नीति का प्रशिक्षण देना। आधुनिक संस्करण फ्रेम की सीधे भविष्यवाणी करने के लिए ट्रांसफॉर्मर या वीडियो-डिफ्यूजन का उपयोग करते हैं, उपयोगकर्ता क्रियाओं पर आधारित होते हैं, जिससे इंटरैक्टिव फ्रेम-दर-फ्रेम पीढ़ी प्राप्त होती है।
सामरिक प्रभाव
स्पष्ट निर्णय
यह आपको स्पष्ट तकनीकी दावों को मार्केटिंग भाषा से अलग करने में मदद करता है।
लागत और बजट
आप पैसा या समय खर्च करने से पहले बेहतर कार्यान्वयन संबंधी प्रश्न पूछ सकते हैं।
टीम और वर्कफ़्लो
साझा समझ वाली टीमें बेहतर उत्पाद, नीति और सीखने के निर्णय लेती हैं।
विश्व मॉडलों और सीखे गए सिमुलेटरों का भविष्य
विश्व मॉडल रोबोटिक्स और गेम जेनरेशन के केंद्र बन रहे हैं: वे डेटा-कुशल सीखने का वादा करते हैं जहां वास्तविक इंटरैक्शन महंगा है, और ऑन-द-फ्लाई जेनरेट, खेलने योग्य वातावरण है। उच्च-निष्ठा, लंबे-क्षितिज, एक्शन-कंडीशंड वीडियो मॉडल, योजना एजेंटों के साथ सख्त एकीकरण और स्व-ड्राइविंग और हेरफेर नीतियों के प्रशिक्षण के लिए 'तंत्रिका सिमुलेटर' के रूप में उपयोग की अपेक्षा करें। खुली चुनौतियों में दीर्घकालिक स्थिरता, मतिभ्रम भौतिकी से बचना और स्मृति को बढ़ाना शामिल है।
वास्तविक विश्व कार्यान्वयन
हा और श्मिधुबर एक कार-रेसिंग एजेंट को लगभग पूरी तरह से पर्यावरण के अपने सीखे हुए सपने के अंदर प्रशिक्षण देते हैं
डीपमाइंड का ड्रीमरवी3 कल्पना में योजना बनाकर माइनक्राफ्ट में हीरे इकट्ठा कर रहा है
Google का जिन्न एक एकल छवि से खेलने योग्य 2D प्लेटफ़ॉर्मर दुनिया तैयार कर रहा है
GameNGen वास्तविक समय में DOOM का एक खेलने योग्य संस्करण चला रहा है, जिसमें एक प्रसार मॉडल द्वारा निर्मित फ्रेम हैं
जोखिम और रेलिंग
अलग-अलग टीमें एक ही शब्द का अलग-अलग इस्तेमाल कर सकती हैं, इसलिए दायरे को पहले ही परिभाषित कर लें।
बेंचमार्क मजबूत दिख सकते हैं जबकि वास्तविक दुनिया का प्रदर्शन असमान है।
डेटा गुणवत्ता और मूल्यांकन योजनाओं की अनदेखी अक्सर नाजुक परिणाम पैदा करती है।
कार्यान्वयन रोडमैप
आपको जिस परिणाम की आवश्यकता है उसकी सरल भाषा में परिभाषा से शुरुआत करें।
परीक्षण से पहले एक सफलता मीट्रिक और एक विफलता स्थिति चुनें।
प्रतिनिधि डेटा के साथ एक छोटा पायलट चलाएँ, न कि एक परिष्कृत डेमो सेट।
दस्तावेज़ जहां विश्व मॉडल और सीखे गए सिम्युलेटर मदद करते हैं और जहां सरल तरीके बेहतर हैं।
अन्वेषण करते रहें
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the World Models and Learned Simulators quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
अगली गाइड
NVIDIA कॉसमॉस वर्ल्ड फाउंडेशन मॉडल
अक्सर पूछे जाने वाले प्रश्नों
What is World Models and Learned Simulators?
विश्व मॉडल एक तंत्रिका नेटवर्क है जो भविष्यवाणी करना सीखता है कि समय के साथ वातावरण कैसे बदलता है, जिससे एआई को कार्य करने से पहले भविष्य के परिणामों की 'कल्पना' करने की सुविधा मिलती है। सीखे गए सिमुलेटर इसे और आगे ले जाते हैं, इंजीनियरों द्वारा हाथ से कोड किए जाने के बजाय डेटा से इंटरैक्टिव, खेलने योग्य वातावरण तैयार करते हैं।
विश्व मॉडल का मुख्य कार्य क्या है?
एक विश्व मॉडल पर्यावरण की गतिशीलता सीखता है: एक वर्तमान स्थिति और एक कार्रवाई से यह अगले अवलोकन (और अक्सर इनाम) की भविष्यवाणी करता है, जिससे काल्पनिक रोलआउट सक्षम होते हैं।
हा और श्मिधुबर द्वारा 2018 'वर्ल्ड मॉडल्स' पेपर में, नियंत्रक को बड़े पैमाने पर कहाँ प्रशिक्षित किया गया था?
एजेंट ने लगभग पूरी तरह से सीखी हुई अव्यक्त गतिशीलता ('स्वप्न') के भीतर कार्य करना सीखा, फिर वास्तविक वातावरण में स्थानांतरित हो गया।
डीपमाइंड के ड्रीमरवी3 ने कौन सी उल्लेखनीय उपलब्धि हासिल की?
ड्रीमरवी3 ने गुप्त गतिशीलता सीखी और मानव डेटा या पाठ्यक्रम के बिना Minecraft में हीरे प्राप्त करने सहित कई कार्यों में महारत हासिल करने के लिए कल्पित रोलआउट का उपयोग किया।
Google का जिन्न क्या करता है?
जिन्न एक जेनरेटिव इंटरैक्टिव वातावरण है जो एक्शन-नियंत्रित 2डी दुनिया का निर्माण करने के लिए बिना लेबल वाले वीडियो से सीखता है।
कई विश्व मॉडल छवियों जैसे उच्च-आयामी इनपुट के लिए भविष्यवाणी की समस्या को कैसे सुगम बनाए रखते हैं?
अवलोकनों को निम्न-आयामी अव्यक्त स्थिति में एन्कोड किया जाता है, और संक्रमण फ़ंक्शन अगली अव्यक्त स्थिति की भविष्यवाणी करता है, जिससे रोलआउट कुशल हो जाता है।