समाचार पर वापस जाएँ
नवीनताAI Understanding ब्रीफिंग

एमआईटी टेक्नोलॉजी रिव्यू यह उजागर करने के लिए सात पहेलियों का उपयोग करता है कि एआई मॉडल अभी भी कहाँ विफल हैं

एमआईटी टेक्नोलॉजी रिव्यू सात पहेलियाँ प्रस्तुत करता है जो स्थानिक तर्क, स्मृति, अमूर्तता, अंतर्ज्ञान और तार्किक योजना का परीक्षण करती हैं, जो कुछ बेंचमार्क पर तेजी से लाभ के बावजूद बनी हुई कमियों को उजागर करती हैं।

6 min readRead the original reporting
Source-provided image accompanying MIT Technology Review uses seven puzzles to expose where AI models still fail
जिम्मेदार रिपोर्टिंगस्रोत रिकार्ड किया गया
प्रकाशक
technologyreview.com
स्रोत लिंक
technologyreview.comhttps://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/
स्रोत प्रकार
किसी समाचार आउटलेट द्वारा रिपोर्टिंग - प्रथम-पक्ष दस्तावेज़ नहीं।

जिसकी पुष्टि हम स्वतंत्र रूप से नहीं कर सके: यह दावा नामित आउटलेट के लिए जिम्मेदार है। हमने इसे प्रथम-पक्ष दस्तावेज़ के विरुद्ध सत्यापित नहीं किया। (technologyreview.com)

प्रसंगइसे 60 सेकंड में समझें

यहां से प्रारंभ करें

प्रमुख शर्तें

एजीआई (आर्टिफिशियल जनरल इंटेलिजेंस)
एक काल्पनिक एआई प्रणाली जो कई डोमेन में मानवीय स्तर पर अधिकांश बौद्धिक कार्य कर सकती है।
मेमोरी (एजेंट मेमोरी)
संग्रहीत संदर्भ एक एआई एजेंट निरंतरता में सुधार के लिए चरणों या सत्रों में उपयोग करता है।
सामान्यीकरण
कोई मॉडल प्रशिक्षण सेट के बाहर नए, अनदेखे डेटा पर कितना अच्छा प्रदर्शन करता है।
स्वयं की जांच करोएआई मॉडल समझाए गए प्रश्नोत्तरी

क्या हुआ?

एमआईटी टेक्नोलॉजी रिव्यू ने सात पहेलियों पर आधारित एक इंटरैक्टिव फीचर प्रकाशित किया है जो यह जांच करता है कि एआई मॉडल कैसे तर्क करते हैं। लेख में बताया गया है कि मॉडल ने कुछ कार्यों में तेजी से सुधार किया है, लेकिन अभी भी स्थानिक हेरफेर, परिचित समस्याओं के सूक्ष्म बदलाव, दृश्य अमूर्तता और तेजी से जटिल मल्टीस्टेप तर्क के साथ संघर्ष कर रहे हैं।

एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि इसकी सुविधा स्थानिक तर्क, स्मृति और अनुकूलनशीलता, अमूर्त और दृश्य तर्क, मानव अंतर्ज्ञान और बढ़ती जटिलता को कवर करने वाले सात परीक्षण प्रस्तुत करती है। लेख एआई मूल्यांकन के लंबे इतिहास में पहेली-सुलझाने को स्थान देता है, यह देखते हुए कि चेकर्स, शतरंज और गो जैसे खेलों का उपयोग क्षेत्र के शुरुआती वर्षों से परीक्षण बेड के रूप में किया गया है। इसमें कहा गया है कि पहेली के प्रदर्शन में काफी सुधार हुआ है: कोलंबिया विश्वविद्यालय की एक टीम ने 2024 के अंत में पाया कि प्रमुख मॉडलों ने न्यूयॉर्क टाइम्स कनेक्शंस की केवल 18% पहेलियों को हल किया, जबकि 2025 की शुरुआत तक कुछ मॉडल उन्हें लगभग हर बार पूरी तरह से हल कर सकते थे। स्रोत मॉडलों की पहचान नहीं करता है या फ़ीचर में उदाहरणों में मानकीकृत तुलना प्रदान नहीं करता है।

एमआईटी टेक्नोलॉजी रिव्यू का कहना है कि स्थानिक तर्क एक बड़ी कमजोरी बनी हुई है। इसका मानसिक-रोटेशन अनुभाग पाठकों से दूसरे कोण से दिखाई गई त्रि-आयामी वस्तु की पहचान करने के लिए कहता है, और लेख रिपोर्ट करता है कि दृश्य-इनपुट क्षमताओं वाले भाषा मॉडल अभी भी ऐसे कार्यों पर बहुत खराब प्रदर्शन करते हैं। यह सुविधा इस कठिनाई को एआई सिस्टम द्वारा विश्व मॉडल विकसित करने के दावों से जोड़ती है, यह तर्क देते हुए कि वर्तमान बड़े भाषा मॉडल त्रि-आयामी वस्तुओं में उसी तरह से हेरफेर नहीं करते हैं जैसे मानव स्थानिक विशेषज्ञ कर सकते हैं। लेख एक स्मृति-और-अनुकूलनशीलता समस्या का भी वर्णन करता है: बड़ी मात्रा में जानकारी पर प्रशिक्षित मॉडल एक परिचित पहेली पैटर्न को पहचान सकते हैं और एक छोटे से बदलाव को नजरअंदाज कर सकते हैं। यह इस चिंता के प्रमाण के रूप में 2024 Google और यूनिवर्सिटी ऑफ इलिनोइस अर्बाना-शैंपेन अध्ययन का हवाला देता है जिसमें नाइट्स और नेव्स पहेलियों की विविधताएं शामिल हैं।

फिर यह सुविधा द्वि-आयामी अमूर्तता और दृश्य तर्क में बदल जाती है। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि मॉडल एआरसी-एजीआई पहेलियों पर बेहतर प्रदर्शन करते हैं जब ग्रिड को छवियों के बजाय सेल रंगों को एन्कोड करने वाले संख्यात्मक स्ट्रिंग के रूप में प्रदान किया जाता है। इसमें यह भी कहा गया है कि शोध में पाया गया है कि मॉडल कभी-कभी जटिल, गैर-सामान्यीकृत नियमों के माध्यम से सही उत्तर तक पहुंच सकते हैं, जबकि मनुष्य सरल दृश्य अवधारणाओं पर भरोसा कर सकते हैं। लेख सिंपलबेंच प्रश्न, शूरवीरों और गुफ़ाओं की समस्याओं और एक एआरसी-एजीआई परिवर्तन पहेली को उन कार्यों के उदाहरण के रूप में प्रस्तुत करता है जो इन अंतरों को उजागर कर सकते हैं।

यह अलग से अंतर्ज्ञान परीक्षणों का वर्णन करता है जिसमें लोग अक्सर तेजी से लेकिन गलत उत्तर देते हैं, जबकि मॉडल अधिक जानबूझकर प्रतिक्रिया दे सकते हैं। एक उदाहरण में पूछा गया है कि जब किसी गुफा में चमगादड़ों की संख्या प्रतिदिन दोगुनी हो जाती है तो उसे आधा भरने में कितना समय लगेगा; दूसरा पाठकों से ऐलिस से जुड़े एक उद्धरण की पहचान करने के लिए कहता है।

अंत में, एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि समस्याएँ अधिक जटिल हो जाने के कारण प्रदर्शन अक्सर ख़राब हो जाता है। यह एक Apple अध्ययन का हवाला देता है जिसमें पाया गया है कि भाषा मॉडल हनोई के टॉवर के सरल संस्करणों और नदी-पार करने की समस्याओं को हल कर सकते हैं लेकिन जब डिस्क या लोगों की संख्या छह या अधिक तक पहुंच गई तो लड़खड़ाना शुरू हो गया। यह वाशिंगटन विश्वविद्यालय, स्टैनफोर्ड विश्वविद्यालय और एलन इंस्टीट्यूट के शोधकर्ताओं द्वारा तर्क-ग्रिड पहेली के साथ समान कठिनाइयों का पता लगाने के काम का भी हवाला देता है। फीचर नोट में टिप्पणीकारों ने सवाल किया कि क्या ये परिणाम एक विशिष्ट मशीन जैसी तर्क सीमा को प्रकट करते हैं या केवल इस तथ्य को दर्शाते हैं कि जटिलता बढ़ने पर लोग अधिक गलतियाँ भी करते हैं। इसलिए इसके रिवर-क्रॉसिंग और लॉजिक-ग्रिड उदाहरण न केवल यह परीक्षण करते हैं कि क्या कोई मॉडल उत्तर दे सकता है, बल्कि यह भी परीक्षण करता है कि क्या यह कई जुड़े हुए कटौतियों में बाधाएं बनाए रख सकता है।

स्रोत विवरण: technologyreview.com ↗

यह क्यों मायने रखता है?

यह सुविधा दिखाती है कि एआई इंटेलिजेंस के बारे में व्यापक दावे भ्रामक क्यों हो सकते हैं। एक मॉडल सामान्य ज्ञान या किसी परिचित बेंचमार्क पर अच्छा प्रदर्शन कर सकता है, जबकि शब्दों में एक छोटा सा बदलाव, एक दृश्य परिवर्तन, या कई आश्रित चरणों की आवश्यकता वाली समस्या में विफल हो सकता है। वे अंतर तब मायने रखते हैं जब सिस्टम का उपयोग प्रदर्शनों के बजाय निर्णयों के लिए किया जाता है।

केंद्रीय सबक यह है कि परीक्षण के एक वर्ग में प्रदर्शन को बुद्धिमत्ता का सामान्य माप नहीं माना जाना चाहिए। एमआईटी टेक्नोलॉजी रिव्यू के उदाहरणों में ऐसे कार्य शामिल हैं जो सतही रूप से सरल दिखते हैं लेकिन विभिन्न क्षमताओं की आवश्यकता होती है: किसी वस्तु को मानसिक रूप से घुमाना, बयानों में सच्चाई और झूठ पर नज़र रखना, एक दृश्य नियम का अनुमान लगाना, भ्रामक अंतर्ज्ञान का विरोध करना, या बाधाओं के तहत अनुक्रम की योजना बनाना। एक प्रणाली एक क्षेत्र में असामान्य रूप से मजबूत और दूसरे में अविश्वसनीय हो सकती है। यह असमानता विशेष रूप से प्रासंगिक है जब उपयोगकर्ता धाराप्रवाह उत्तरों को सबूत के रूप में व्याख्या करते हैं कि एक मॉडल ने अंतर्निहित समस्या को समझ लिया है।

लेख एक मूल्यांकन समस्या पर भी प्रकाश डालता है: किसी कार्य का प्रारूप परिणाम को महत्वपूर्ण रूप से प्रभावित कर सकता है। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि जब दृश्य ग्रिड को संख्यात्मक प्रतिनिधित्व में परिवर्तित किया जाता है तो एआरसी-एजीआई प्रदर्शन में सुधार होता है। इससे पता चलता है कि स्कोर न केवल मॉडल की तर्क क्षमता को दर्शाता है बल्कि समस्या को एन्कोड करने और प्रस्तुत करने के तरीके को भी दर्शाता है। यही चिंता परिचित पहेलियों पर भी लागू होती है। यदि किसी मॉडल को प्रशिक्षण के दौरान एक करीबी संस्करण का सामना करना पड़ा है, तो एक सही उत्तर किसी नियम को नए मामले में अनुकूलित करने की क्षमता के बजाय पैटर्न पहचान या पुनर्प्राप्ति को प्रतिबिंबित कर सकता है। स्रोत यह स्थापित नहीं करता है कि तैनात प्रणालियों में कोई भी तंत्र कितनी बार होता है।

इन सीमाओं का शिक्षा, सॉफ्टवेयर, अनुसंधान, प्रशासन या अन्य सेटिंग्स में एआई का उपयोग करने वाले किसी भी व्यक्ति के लिए व्यावहारिक प्रभाव पड़ता है जिसमें अपरिचित मामले शामिल होते हैं। एक मॉडल जो नियमित उदाहरणों पर सफल होता है वह तब भी विफल हो सकता है जब शब्दों में बदलाव होता है, कई बाधाएँ परस्पर क्रिया करती हैं, या प्रासंगिक जानकारी पाठ्य के बजाय दृश्य होती है। यह सुविधा किसी नए उत्पाद लॉन्च, नए मॉडल रिलीज़ या किसी विशिष्ट वाणिज्यिक प्रणाली के नियंत्रित मूल्यांकन की रिपोर्ट नहीं करती है। इसका मूल्य व्याख्यात्मक है: यह पाठकों को यह देखने के लिए ठोस तरीके देता है कि बेंचमार्क लाभ और परिष्कृत भाषा स्वयं मजबूत तर्क क्यों स्थापित नहीं करती है। लेख एक महत्वपूर्ण योग्यता को भी संरक्षित करता है: मनुष्यों के अपने पूर्वाग्रह होते हैं और कुछ समस्याओं पर धीमे या कम विश्वसनीय हो सकते हैं।

Interactive Mechanism

इंटरैक्टिव तंत्र: यह वास्तव में कैसे काम करता है

इस विकास के पीछे अंतर्निहित प्रौद्योगिकी का अंतःक्रियात्मक रूप से अन्वेषण करें।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
इंटरएक्टिव कॉन्सेप्ट चेक+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

आगे क्या देखना है

भविष्य के मूल्यांकनों को हेडलाइन स्कोर से अधिक परीक्षण करने की आवश्यकता होगी। महत्वपूर्ण प्रश्नों में यह शामिल है कि क्या मॉडल अपरिचित समस्याओं का सामान्यीकरण कर सकते हैं, क्या उनके उत्तर इस बात पर निर्भर करते हैं कि जानकारी का प्रतिनिधित्व कैसे किया जाता है, जटिलता बढ़ने पर प्रदर्शन कैसे बदलता है, और क्या सफलता पुन: प्रयोज्य रणनीति या याद किए गए पैटर्न को दर्शाती है।

अगला उपयोगी विकास मॉडलों और कार्य प्रारूपों में व्यापक, प्रतिलिपि प्रस्तुत करने योग्य परीक्षण होगा। एमआईटी टेक्नोलॉजी रिव्यू की सुविधा सभी सात परीक्षणों को कवर करने वाला एक एकल स्कोरकार्ड प्रदान नहीं करती है, न ही स्रोत अधिकांश उदाहरणों के लिए मॉडल नाम, संस्करण, नमूना आकार, संकेत की स्थिति या त्रुटि दर निर्दिष्ट करता है। यह निर्धारित करने के लिए उन विवरणों की आवश्यकता होगी कि क्या रिपोर्ट की गई कमजोरियाँ व्यापक हैं, विशेष मॉडल परिवारों में केंद्रित हैं, या परीक्षण कैसे प्रशासित किए जाते हैं इसके प्रति संवेदनशील हैं।

स्वतंत्र मूल्यांकन को अंतर्निहित पहेली को स्थिर रखते हुए इसके प्रतिनिधित्व को बदलते हुए दृश्य-धारणा विफलताओं को तर्क विफलताओं से अलग करना चाहिए। शोधकर्ताओं और मूल्यांकनकर्ताओं को यह भी देखना चाहिए कि क्या मॉडल वास्तविक सामान्यीकरण के माध्यम से या बेंचमार्क जैसी सामग्री के अधिक प्रदर्शन के माध्यम से सुधार करते हैं। लेख में कनेक्शंस पहेलियाँ और शूरवीरों और गुफ़ाओं की विविधताओं की चर्चा से पता चलता है कि संदूषण और परिचितता क्यों मायने रखती है। एक मॉडल जो प्रकाशित या निकट से संबंधित प्रश्नों पर अच्छा प्रदर्शन करता है, वह समान अंतर्निहित संरचना के साथ नई उत्पन्न समस्याओं पर समान रूप से सक्षम नहीं हो सकता है। इसलिए परीक्षण में रुकी हुई पहेलियाँ, परिवर्तित शब्दांकन, अपरिचित दृश्य लेआउट और ऐसे कार्य शामिल होने चाहिए जिनमें प्रेरक उत्तर को सही मानने के बिना मध्यवर्ती बाधाओं को समझाने या जांचने की आवश्यकता होती है।

जटिलता और वास्तविक दुनिया में स्थानांतरण खुले प्रश्न बने हुए हैं। एमआईटी टेक्नोलॉजी रिव्यू की रिपोर्ट है कि तत्वों की संख्या या आवश्यक कदम बढ़ने पर प्रदर्शन खराब हो सकता है, लेकिन स्रोत यह स्थापित नहीं करता है कि ये निष्कर्ष उपकरण, पुनर्प्राप्ति, बाहरी मेमोरी या मानव निरीक्षण के साथ व्यावहारिक प्रणालियों में कैसे अनुवादित होते हैं। भविष्य की रिपोर्टिंग में यह ट्रैक किया जाना चाहिए कि क्या इस तरह के परिवर्धन से विश्वसनीयता में सुधार होता है, केवल मॉडल को अधिक प्रभावी ढंग से खोजने में मदद मिलती है, या नए विफलता मोड पेश होते हैं। पाठकों को उन मूल्यांकनों पर भी ध्यान देना चाहिए जो रणनीति की गुणवत्ता को मापते हैं, न कि केवल अंतिम उत्तर को, क्योंकि एक भंगुर या गैर-सामान्यीकरण योग्य नियम के माध्यम से प्राप्त सही परिणाम समस्या में एक छोटे से बदलाव से बच नहीं सकता है।

संबंधित मार्गदर्शिकाएँ एवं प्रश्नोत्तरी

एआई मॉडल की व्याख्याएआई प्रशिक्षणट्रांसफार्मरआप जो जानते हैं उसका परीक्षण करें - निःशुल्क AI प्रश्नोत्तरी आज़माएँहमारी शब्दावली में एआई शब्द देखेंएआई मॉडल रिलीज ट्रैकर का पालन करें
क्या यह उपयोगी पाया गया?