क्या हुआ?
एमआईटी टेक्नोलॉजी रिव्यू ने सात पहेलियों पर आधारित एक इंटरैक्टिव फीचर प्रकाशित किया है जो यह जांच करता है कि एआई मॉडल कैसे तर्क करते हैं। लेख में बताया गया है कि मॉडल ने कुछ कार्यों में तेजी से सुधार किया है, लेकिन अभी भी स्थानिक हेरफेर, परिचित समस्याओं के सूक्ष्म बदलाव, दृश्य अमूर्तता और तेजी से जटिल मल्टीस्टेप तर्क के साथ संघर्ष कर रहे हैं।
एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि इसकी सुविधा स्थानिक तर्क, स्मृति और अनुकूलनशीलता, अमूर्त और दृश्य तर्क, मानव अंतर्ज्ञान और बढ़ती जटिलता को कवर करने वाले सात परीक्षण प्रस्तुत करती है। लेख एआई मूल्यांकन के लंबे इतिहास में पहेली-सुलझाने को स्थान देता है, यह देखते हुए कि चेकर्स, शतरंज और गो जैसे खेलों का उपयोग क्षेत्र के शुरुआती वर्षों से परीक्षण बेड के रूप में किया गया है। इसमें कहा गया है कि पहेली के प्रदर्शन में काफी सुधार हुआ है: कोलंबिया विश्वविद्यालय की एक टीम ने 2024 के अंत में पाया कि प्रमुख मॉडलों ने न्यूयॉर्क टाइम्स कनेक्शंस की केवल 18% पहेलियों को हल किया, जबकि 2025 की शुरुआत तक कुछ मॉडल उन्हें लगभग हर बार पूरी तरह से हल कर सकते थे। स्रोत मॉडलों की पहचान नहीं करता है या फ़ीचर में उदाहरणों में मानकीकृत तुलना प्रदान नहीं करता है।
एमआईटी टेक्नोलॉजी रिव्यू का कहना है कि स्थानिक तर्क एक बड़ी कमजोरी बनी हुई है। इसका मानसिक-रोटेशन अनुभाग पाठकों से दूसरे कोण से दिखाई गई त्रि-आयामी वस्तु की पहचान करने के लिए कहता है, और लेख रिपोर्ट करता है कि दृश्य-इनपुट क्षमताओं वाले भाषा मॉडल अभी भी ऐसे कार्यों पर बहुत खराब प्रदर्शन करते हैं। यह सुविधा इस कठिनाई को एआई सिस्टम द्वारा विश्व मॉडल विकसित करने के दावों से जोड़ती है, यह तर्क देते हुए कि वर्तमान बड़े भाषा मॉडल त्रि-आयामी वस्तुओं में उसी तरह से हेरफेर नहीं करते हैं जैसे मानव स्थानिक विशेषज्ञ कर सकते हैं। लेख एक स्मृति-और-अनुकूलनशीलता समस्या का भी वर्णन करता है: बड़ी मात्रा में जानकारी पर प्रशिक्षित मॉडल एक परिचित पहेली पैटर्न को पहचान सकते हैं और एक छोटे से बदलाव को नजरअंदाज कर सकते हैं। यह इस चिंता के प्रमाण के रूप में 2024 Google और यूनिवर्सिटी ऑफ इलिनोइस अर्बाना-शैंपेन अध्ययन का हवाला देता है जिसमें नाइट्स और नेव्स पहेलियों की विविधताएं शामिल हैं।
फिर यह सुविधा द्वि-आयामी अमूर्तता और दृश्य तर्क में बदल जाती है। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि मॉडल एआरसी-एजीआई पहेलियों पर बेहतर प्रदर्शन करते हैं जब ग्रिड को छवियों के बजाय सेल रंगों को एन्कोड करने वाले संख्यात्मक स्ट्रिंग के रूप में प्रदान किया जाता है। इसमें यह भी कहा गया है कि शोध में पाया गया है कि मॉडल कभी-कभी जटिल, गैर-सामान्यीकृत नियमों के माध्यम से सही उत्तर तक पहुंच सकते हैं, जबकि मनुष्य सरल दृश्य अवधारणाओं पर भरोसा कर सकते हैं। लेख सिंपलबेंच प्रश्न, शूरवीरों और गुफ़ाओं की समस्याओं और एक एआरसी-एजीआई परिवर्तन पहेली को उन कार्यों के उदाहरण के रूप में प्रस्तुत करता है जो इन अंतरों को उजागर कर सकते हैं।
यह अलग से अंतर्ज्ञान परीक्षणों का वर्णन करता है जिसमें लोग अक्सर तेजी से लेकिन गलत उत्तर देते हैं, जबकि मॉडल अधिक जानबूझकर प्रतिक्रिया दे सकते हैं। एक उदाहरण में पूछा गया है कि जब किसी गुफा में चमगादड़ों की संख्या प्रतिदिन दोगुनी हो जाती है तो उसे आधा भरने में कितना समय लगेगा; दूसरा पाठकों से ऐलिस से जुड़े एक उद्धरण की पहचान करने के लिए कहता है।
अंत में, एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि समस्याएँ अधिक जटिल हो जाने के कारण प्रदर्शन अक्सर ख़राब हो जाता है। यह एक Apple अध्ययन का हवाला देता है जिसमें पाया गया है कि भाषा मॉडल हनोई के टॉवर के सरल संस्करणों और नदी-पार करने की समस्याओं को हल कर सकते हैं लेकिन जब डिस्क या लोगों की संख्या छह या अधिक तक पहुंच गई तो लड़खड़ाना शुरू हो गया। यह वाशिंगटन विश्वविद्यालय, स्टैनफोर्ड विश्वविद्यालय और एलन इंस्टीट्यूट के शोधकर्ताओं द्वारा तर्क-ग्रिड पहेली के साथ समान कठिनाइयों का पता लगाने के काम का भी हवाला देता है। फीचर नोट में टिप्पणीकारों ने सवाल किया कि क्या ये परिणाम एक विशिष्ट मशीन जैसी तर्क सीमा को प्रकट करते हैं या केवल इस तथ्य को दर्शाते हैं कि जटिलता बढ़ने पर लोग अधिक गलतियाँ भी करते हैं। इसलिए इसके रिवर-क्रॉसिंग और लॉजिक-ग्रिड उदाहरण न केवल यह परीक्षण करते हैं कि क्या कोई मॉडल उत्तर दे सकता है, बल्कि यह भी परीक्षण करता है कि क्या यह कई जुड़े हुए कटौतियों में बाधाएं बनाए रख सकता है।
स्रोत विवरण: technologyreview.com ↗
यह क्यों मायने रखता है?
यह सुविधा दिखाती है कि एआई इंटेलिजेंस के बारे में व्यापक दावे भ्रामक क्यों हो सकते हैं। एक मॉडल सामान्य ज्ञान या किसी परिचित बेंचमार्क पर अच्छा प्रदर्शन कर सकता है, जबकि शब्दों में एक छोटा सा बदलाव, एक दृश्य परिवर्तन, या कई आश्रित चरणों की आवश्यकता वाली समस्या में विफल हो सकता है। वे अंतर तब मायने रखते हैं जब सिस्टम का उपयोग प्रदर्शनों के बजाय निर्णयों के लिए किया जाता है।
केंद्रीय सबक यह है कि परीक्षण के एक वर्ग में प्रदर्शन को बुद्धिमत्ता का सामान्य माप नहीं माना जाना चाहिए। एमआईटी टेक्नोलॉजी रिव्यू के उदाहरणों में ऐसे कार्य शामिल हैं जो सतही रूप से सरल दिखते हैं लेकिन विभिन्न क्षमताओं की आवश्यकता होती है: किसी वस्तु को मानसिक रूप से घुमाना, बयानों में सच्चाई और झूठ पर नज़र रखना, एक दृश्य नियम का अनुमान लगाना, भ्रामक अंतर्ज्ञान का विरोध करना, या बाधाओं के तहत अनुक्रम की योजना बनाना। एक प्रणाली एक क्षेत्र में असामान्य रूप से मजबूत और दूसरे में अविश्वसनीय हो सकती है। यह असमानता विशेष रूप से प्रासंगिक है जब उपयोगकर्ता धाराप्रवाह उत्तरों को सबूत के रूप में व्याख्या करते हैं कि एक मॉडल ने अंतर्निहित समस्या को समझ लिया है।
लेख एक मूल्यांकन समस्या पर भी प्रकाश डालता है: किसी कार्य का प्रारूप परिणाम को महत्वपूर्ण रूप से प्रभावित कर सकता है। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि जब दृश्य ग्रिड को संख्यात्मक प्रतिनिधित्व में परिवर्तित किया जाता है तो एआरसी-एजीआई प्रदर्शन में सुधार होता है। इससे पता चलता है कि स्कोर न केवल मॉडल की तर्क क्षमता को दर्शाता है बल्कि समस्या को एन्कोड करने और प्रस्तुत करने के तरीके को भी दर्शाता है। यही चिंता परिचित पहेलियों पर भी लागू होती है। यदि किसी मॉडल को प्रशिक्षण के दौरान एक करीबी संस्करण का सामना करना पड़ा है, तो एक सही उत्तर किसी नियम को नए मामले में अनुकूलित करने की क्षमता के बजाय पैटर्न पहचान या पुनर्प्राप्ति को प्रतिबिंबित कर सकता है। स्रोत यह स्थापित नहीं करता है कि तैनात प्रणालियों में कोई भी तंत्र कितनी बार होता है।
इन सीमाओं का शिक्षा, सॉफ्टवेयर, अनुसंधान, प्रशासन या अन्य सेटिंग्स में एआई का उपयोग करने वाले किसी भी व्यक्ति के लिए व्यावहारिक प्रभाव पड़ता है जिसमें अपरिचित मामले शामिल होते हैं। एक मॉडल जो नियमित उदाहरणों पर सफल होता है वह तब भी विफल हो सकता है जब शब्दों में बदलाव होता है, कई बाधाएँ परस्पर क्रिया करती हैं, या प्रासंगिक जानकारी पाठ्य के बजाय दृश्य होती है। यह सुविधा किसी नए उत्पाद लॉन्च, नए मॉडल रिलीज़ या किसी विशिष्ट वाणिज्यिक प्रणाली के नियंत्रित मूल्यांकन की रिपोर्ट नहीं करती है। इसका मूल्य व्याख्यात्मक है: यह पाठकों को यह देखने के लिए ठोस तरीके देता है कि बेंचमार्क लाभ और परिष्कृत भाषा स्वयं मजबूत तर्क क्यों स्थापित नहीं करती है। लेख एक महत्वपूर्ण योग्यता को भी संरक्षित करता है: मनुष्यों के अपने पूर्वाग्रह होते हैं और कुछ समस्याओं पर धीमे या कम विश्वसनीय हो सकते हैं।
इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है
इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।
Which component of an AI application is the machine-learning model itself?
आगे क्या देखना है
भविष्य के मूल्यांकनों को हेडलाइन स्कोर से अधिक परीक्षण करने की आवश्यकता होगी। महत्वपूर्ण प्रश्नों में यह शामिल है कि क्या मॉडल अपरिचित समस्याओं का सामान्यीकरण कर सकते हैं, क्या उनके उत्तर इस बात पर निर्भर करते हैं कि जानकारी का प्रतिनिधित्व कैसे किया जाता है, जटिलता बढ़ने पर प्रदर्शन कैसे बदलता है, और क्या सफलता पुन: प्रयोज्य रणनीति या याद किए गए पैटर्न को दर्शाती है।
अगला उपयोगी विकास मॉडलों और कार्य प्रारूपों में व्यापक, प्रतिलिपि प्रस्तुत करने योग्य परीक्षण होगा। एमआईटी टेक्नोलॉजी रिव्यू की सुविधा सभी सात परीक्षणों को कवर करने वाला एक एकल स्कोरकार्ड प्रदान नहीं करती है, न ही स्रोत अधिकांश उदाहरणों के लिए मॉडल नाम, संस्करण, नमूना आकार, संकेत की स्थिति या त्रुटि दर निर्दिष्ट करता है। यह निर्धारित करने के लिए उन विवरणों की आवश्यकता होगी कि क्या रिपोर्ट की गई कमजोरियाँ व्यापक हैं, विशेष मॉडल परिवारों में केंद्रित हैं, या परीक्षण कैसे प्रशासित किए जाते हैं इसके प्रति संवेदनशील हैं।
स्वतंत्र मूल्यांकन को अंतर्निहित पहेली को स्थिर रखते हुए इसके प्रतिनिधित्व को बदलते हुए दृश्य-धारणा विफलताओं को तर्क विफलताओं से अलग करना चाहिए। शोधकर्ताओं और मूल्यांकनकर्ताओं को यह भी देखना चाहिए कि क्या मॉडल वास्तविक सामान्यीकरण के माध्यम से या बेंचमार्क जैसी सामग्री के अधिक प्रदर्शन के माध्यम से सुधार करते हैं। लेख में कनेक्शंस पहेलियाँ और शूरवीरों और गुफ़ाओं की विविधताओं की चर्चा से पता चलता है कि संदूषण और परिचितता क्यों मायने रखती है। एक मॉडल जो प्रकाशित या निकट से संबंधित प्रश्नों पर अच्छा प्रदर्शन करता है, वह समान अंतर्निहित संरचना के साथ नई उत्पन्न समस्याओं पर समान रूप से सक्षम नहीं हो सकता है। इसलिए परीक्षण में रुकी हुई पहेलियाँ, परिवर्तित शब्दांकन, अपरिचित दृश्य लेआउट और ऐसे कार्य शामिल होने चाहिए जिनमें प्रेरक उत्तर को सही मानने के बिना मध्यवर्ती बाधाओं को समझाने या जांचने की आवश्यकता होती है।
जटिलता और वास्तविक दुनिया में स्थानांतरण खुले प्रश्न बने हुए हैं। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि तत्वों की संख्या या आवश्यक कदम बढ़ने पर प्रदर्शन खराब हो सकता है, लेकिन स्रोत यह स्थापित नहीं करता है कि ये निष्कर्ष उपकरण, पुनर्प्राप्ति, बाहरी मेमोरी या मानव निरीक्षण के साथ व्यावहारिक प्रणालियों में कैसे अनुवादित होते हैं। भविष्य की रिपोर्टिंग में यह ट्रैक किया जाना चाहिए कि क्या इस तरह के परिवर्धन से विश्वसनीयता में सुधार होता है, केवल मॉडल को अधिक प्रभावी ढंग से खोजने में मदद मिलती है, या नए विफलता मोड पेश होते हैं। पाठकों को उन मूल्यांकनों पर भी ध्यान देना चाहिए जो रणनीति की गुणवत्ता को मापते हैं, न कि केवल अंतिम उत्तर को, क्योंकि एक भंगुर या गैर-सामान्यीकरण योग्य नियम के माध्यम से प्राप्त सही परिणाम समस्या में एक छोटे से बदलाव से बच नहीं सकता है।