সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

এমআইটি টেকনোলজি রিভিউ সাতটি ধাঁধা ব্যবহার করে, যেখানে এআই মডেল এখনও ব্যর্থ হয়

এমআইটি টেকনোলজি রিভিউ সাতটি ধাঁধা উপস্থাপন করে যা স্থানিক যুক্তি, মেমরি, বিমূর্ততা, অন্তর্দৃষ্টি এবং যৌক্তিক পরিকল্পনা পরীক্ষা করে, কিছু বেঞ্চমার্কে দ্রুত লাভ হওয়া সত্ত্বেও যে ফাঁকগুলি থেকে যায় তা হাইলাইট করে।

6 min readRead the original reporting
Source-provided image accompanying MIT Technology Review uses seven puzzles to expose where AI models still fail
অ্যাট্রিবিউটেড রিপোর্টিংউৎস রেকর্ড করা হয়েছে
প্রকাশক
technologyreview.com
উৎস লিঙ্ক
technologyreview.comhttps://www.technologyreview.com/2026/08/26/1141952/puzzles-ai-models-flub-these-tests/
উত্স প্রকার
একটি নিউজ আউটলেট দ্বারা রিপোর্ট করা - একটি প্রথম পক্ষের নথি নয়।

যা আমরা স্বাধীনভাবে নিশ্চিত করতে পারিনি: এই দাবি নামযুক্ত আউটলেট দায়ী করা হয়. আমরা এটি একটি প্রথম পক্ষের নথির বিরুদ্ধে যাচাই করিনি৷ (technologyreview.com)

প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

AGI (কৃত্রিম সাধারণ বুদ্ধিমত্তা)
একটি কাল্পনিক AI সিস্টেম যা অনেক ডোমেন জুড়ে মানব স্তরে সর্বাধিক বুদ্ধিবৃত্তিক কাজ সম্পাদন করতে পারে।
মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
সাধারণীকরণ
প্রশিক্ষণ সেটের বাইরে একটি মডেল নতুন, অদেখা ডেটাতে কতটা ভালো পারফর্ম করে।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

এমআইটি টেকনোলজি রিভিউ সাতটি ধাঁধার তৈরি একটি ইন্টারেক্টিভ বৈশিষ্ট্য প্রকাশ করেছে যা এআই মডেলগুলি কীভাবে যুক্তি দেয় তা অনুসন্ধান করে। নিবন্ধটি রিপোর্ট করে যে মডেলগুলি কিছু কাজগুলিতে দ্রুত উন্নতি করেছে কিন্তু এখনও স্থানিক ম্যানিপুলেশন, পরিচিত সমস্যার সূক্ষ্ম বৈচিত্র্য, ভিজ্যুয়াল বিমূর্ততা এবং ক্রমবর্ধমান জটিল মাল্টিস্টেপ যুক্তির সাথে লড়াই করছে।

এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে এর বৈশিষ্ট্যটি স্থানিক যুক্তি, স্মৃতি এবং অভিযোজনযোগ্যতা, বিমূর্ত এবং চাক্ষুষ যুক্তি, মানুষের অন্তর্দৃষ্টি এবং ক্রমবর্ধমান জটিলতা কভার করে সাতটি পরীক্ষা উপস্থাপন করে। নিবন্ধটি এআই মূল্যায়নের দীর্ঘ ইতিহাসে ধাঁধা-সমাধানকে স্থান দেয়, উল্লেখ করে যে চেকার, দাবা এবং গো-এর মতো গেমগুলি মাঠের প্রথম বছর থেকেই পরীক্ষার বিছানা হিসাবে ব্যবহৃত হয়ে আসছে। এটি বলে যে ধাঁধার কর্মক্ষমতা উল্লেখযোগ্যভাবে উন্নত হয়েছে: 2024 সালের শেষের দিকে একটি কলম্বিয়া ইউনিভার্সিটি দল খুঁজে পেয়েছে যে নেতৃস্থানীয় মডেলগুলি নিউ ইয়র্ক টাইমস সংযোগের ধাঁধার মাত্র 18% সমাধান করেছে, যখন 2025 সালের প্রথম দিকে কিছু মডেল প্রায় প্রতিবারই তাদের প্রায় পুরোপুরি সমাধান করতে পারে। উত্সটি মডেলগুলি সনাক্ত করে না বা বৈশিষ্ট্যের উদাহরণ জুড়ে একটি প্রমিত তুলনা প্রদান করে না।

এমআইটি টেকনোলজি রিভিউ বলে যে স্থানিক যুক্তি একটি বড় দুর্বলতা রয়ে গেছে। এর মানসিক-ঘূর্ণন বিভাগটি পাঠকদেরকে অন্য কোণ থেকে দেখানো একটি ত্রি-মাত্রিক বস্তু সনাক্ত করতে বলে, এবং নিবন্ধটি জানায় যে ভিজ্যুয়াল-ইনপুট ক্ষমতা সহ ভাষার মডেলগুলি এখনও এই ধরনের কাজগুলিতে খুব খারাপভাবে কাজ করে। বৈশিষ্ট্যটি এই অসুবিধাটিকে এআই সিস্টেমের বিশ্ব মডেলের বিকাশের দাবির সাথে সংযুক্ত করে, যুক্তি দেয় যে বর্তমান বৃহৎ ভাষার মডেলগুলি ত্রিমাত্রিক বস্তুগুলিকে মানব স্থানিক বিশেষজ্ঞরা যেভাবে ব্যবহার করতে পারে সেভাবে ম্যানিপুলেট করতে দেখা যায় না। নিবন্ধটি একটি স্মৃতি-এবং-অভিযোজনযোগ্যতার সমস্যাও বর্ণনা করে: বিপুল পরিমাণ তথ্যের উপর প্রশিক্ষিত মডেলগুলি একটি পরিচিত ধাঁধার প্যাটার্ন চিনতে পারে এবং একটি ছোট পরিবর্তন উপেক্ষা করতে পারে। এটি একটি 2024 Google এবং ইউনিভার্সিটি অফ ইলিনয় আরবানা-চ্যাম্পেইন অধ্যয়নের উদ্ধৃতি দিয়েছে যাতে এই উদ্বেগের প্রমাণ হিসাবে নাইটস এবং নেভস পাজলের বিভিন্নতা জড়িত।

বৈশিষ্ট্যটি তখন দ্বি-মাত্রিক বিমূর্ততা এবং চাক্ষুষ যুক্তিতে পরিণত হয়। এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে মডেলগুলি এআরসি-এজিআই ধাঁধাগুলিতে আরও ভাল পারফরম্যান্স করে যখন গ্রিডগুলিকে ইমেজ হিসাবে পরিবর্তে সেল রঙের এনকোডিং সংখ্যাসূচক স্ট্রিং হিসাবে সরবরাহ করা হয়। এটি আরও বলে যে গবেষণায় দেখা গেছে যে মডেলগুলি কখনও কখনও জটিল, অ-সাধারণযোগ্য নিয়মের মাধ্যমে সঠিক উত্তরে পৌঁছাতে পারে, যখন মানুষ সহজ চাক্ষুষ ধারণার উপর নির্ভর করতে পারে। নিবন্ধটি সিম্পলবেঞ্চ প্রশ্ন, নাইটস এবং নেভস সমস্যা, এবং একটি ARC-AGI রূপান্তর ধাঁধাকে কাজের উদাহরণ হিসাবে উপস্থাপন করে যা এই পার্থক্যগুলিকে প্রকাশ করতে পারে।

এটি পৃথকভাবে অন্তর্দৃষ্টি পরীক্ষাগুলি বর্ণনা করে যেখানে লোকেরা প্রায়শই দ্রুত কিন্তু ভুল উত্তর দেয়, যখন মডেলগুলি আরও ইচ্ছাকৃতভাবে প্রতিক্রিয়া জানাতে পারে। একটি উদাহরণ জিজ্ঞাসা করে যে একটি গুহা অর্ধেক ভরাট হতে কতক্ষণ সময় নেয় যখন এর ব্যাট জনসংখ্যা প্রতিদিন দ্বিগুণ হয়; অন্য একজন পাঠকদের অ্যালিসের সাথে যুক্ত একটি উদ্ধৃতি সনাক্ত করতে বলে।

অবশেষে, এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে কর্মক্ষমতা প্রায়ই খারাপ হয়ে যায় কারণ সমস্যাগুলি আরও জটিল হয়ে ওঠে। এটি একটি Apple গবেষণার উদ্ধৃতি দেয় যে ভাষা মডেলগুলি হ্যানয়ের টাওয়ারের সহজ সংস্করণ এবং নদী পারাপারের সমস্যাগুলি সমাধান করতে পারে কিন্তু যখন ডিস্ক বা লোকের সংখ্যা ছয় বা তার বেশি হয় তখন তা স্থবির হতে শুরু করে। এটি ওয়াশিংটন ইউনিভার্সিটি, স্ট্যানফোর্ড ইউনিভার্সিটি এবং অ্যালেন ইনস্টিটিউটের গবেষকদের দ্বারা লজিক-গ্রিড পাজলগুলির সাথে একই রকম অসুবিধা খুঁজে পাওয়া কাজের উদ্ধৃতি দেয়। বৈশিষ্ট্যটি উল্লেখ করেছে যে মন্তব্যকারীরা প্রশ্ন করেছেন যে এই ফলাফলগুলি একটি অনন্যভাবে মেশিনের মতো যুক্তির সীমাবদ্ধতা প্রকাশ করে বা কেবল এই সত্যটিকে প্রতিফলিত করে যে জটিলতা বৃদ্ধির সাথে সাথে লোকেরা আরও ত্রুটি করে। এর রিভার-ক্রসিং এবং লজিক-গ্রিড উদাহরণগুলি তাই পরীক্ষা করে যে একটি মডেল একটি উত্তর তৈরি করতে পারে কিনা, তবে এটি একাধিক সংযুক্ত ডিডাকশন জুড়ে সীমাবদ্ধতা বজায় রাখতে পারে কিনা।

উত্স বিবরণ: technologyreview.com ↗

কেন এটা গুরুত্বপূর্ণ

বৈশিষ্ট্যটি দেখায় কেন AI বুদ্ধিমত্তা সম্পর্কে বিস্তৃত দাবি বিভ্রান্তিকর হতে পারে। একটি মডেল ট্রিভিয়া বা একটি পরিচিত বেঞ্চমার্কে ভাল পারফর্ম করতে পারে যখন শব্দের একটি ছোট পরিবর্তন, একটি চাক্ষুষ রূপান্তর, বা একটি সমস্যা যার জন্য বেশ কয়েকটি নির্ভরশীল পদক্ষেপের প্রয়োজন হয়। এই পার্থক্যগুলি গুরুত্বপূর্ণ যখন সিস্টেমগুলি প্রদর্শনের পরিবর্তে সিদ্ধান্তের জন্য ব্যবহার করা হয়।

কেন্দ্রীয় শিক্ষা হল যে এক শ্রেণীর পরীক্ষায় পারফরম্যান্সকে বুদ্ধিমত্তার সাধারণ পরিমাপ হিসাবে বিবেচনা করা উচিত নয়। এমআইটি টেকনোলজি রিভিউ-এর উদাহরণগুলি এমন কাজগুলিকে বিস্তৃত করে যেগুলি অতিমাত্রায় সহজ দেখায় কিন্তু বিভিন্ন ক্ষমতার প্রয়োজন হয়: একটি বস্তুকে মানসিকভাবে ঘোরানো, বিবৃতি জুড়ে সত্য এবং মিথ্যা ট্র্যাক করা, একটি চাক্ষুষ নিয়ম অনুমান করা, একটি বিভ্রান্তিকর অন্তর্দৃষ্টি প্রতিরোধ করা, বা সীমাবদ্ধতার অধীনে একটি ক্রম পরিকল্পনা করা। একটি সিস্টেম একটি এলাকায় অস্বাভাবিকভাবে শক্তিশালী হতে পারে এবং অন্য ক্ষেত্রে অবিশ্বস্ত হতে পারে। এই অসমতা বিশেষভাবে প্রাসঙ্গিক যখন ব্যবহারকারীরা সাবলীল উত্তরগুলিকে প্রমাণ হিসাবে ব্যাখ্যা করে যে একটি মডেল অন্তর্নিহিত সমস্যাটি বুঝতে পেরেছিল।

নিবন্ধটি একটি মূল্যায়ন সমস্যাও তুলে ধরে: একটি কাজের বিন্যাস বস্তুগতভাবে ফলাফলকে প্রভাবিত করতে পারে। MIT প্রযুক্তি পর্যালোচনা রিপোর্ট করে যে ARC-AGI কর্মক্ষমতা উন্নত হয় যখন ভিজ্যুয়াল গ্রিডগুলিকে সংখ্যাসূচক উপস্থাপনায় রূপান্তরিত করা হয়। এটি পরামর্শ দেয় যে একটি স্কোর শুধুমাত্র মডেলের যুক্তির ক্ষমতাকেই প্রতিফলিত করতে পারে না কিন্তু সমস্যাটি এনকোড করা এবং উপস্থাপন করার উপায়ও। একই উদ্বেগ পরিচিত ধাঁধার ক্ষেত্রে প্রযোজ্য। যদি প্রশিক্ষণের সময় একটি মডেল একটি ঘনিষ্ঠ বৈকল্পিক সম্মুখীন হয়, একটি সঠিক উত্তর একটি নতুন ক্ষেত্রে একটি নিয়ম মানিয়ে নেওয়ার ক্ষমতার পরিবর্তে প্যাটার্ন স্বীকৃতি বা পুনরুদ্ধার প্রতিফলিত করতে পারে। উৎসটি স্থাপন করে না যে কত ঘন ঘন কোন প্রক্রিয়াটি স্থাপন করা সিস্টেম জুড়ে ঘটে।

শিক্ষা, সফ্টওয়্যার, গবেষণা, প্রশাসন বা অপরিচিত ক্ষেত্রে জড়িত অন্যান্য সেটিংসে AI ব্যবহার করে এমন যে কেউ এই সীমাবদ্ধতার ব্যবহারিক প্রভাব রয়েছে। একটি মডেল যা রুটিন উদাহরণগুলিতে সফল হয় তা এখনও ব্যর্থ হতে পারে যখন শব্দ পরিবর্তন হয়, বেশ কয়েকটি সীমাবদ্ধতা ইন্টারঅ্যাক্ট করে, বা প্রাসঙ্গিক তথ্য পাঠ্যের পরিবর্তে চাক্ষুষ হয়। বৈশিষ্ট্যটি একটি নতুন পণ্য লঞ্চ, একটি নতুন মডেল প্রকাশ, বা একটি নির্দিষ্ট বাণিজ্যিক সিস্টেমের নিয়ন্ত্রিত মূল্যায়নের প্রতিবেদন করে না। এর মূল্য ব্যাখ্যামূলক: এটি পাঠকদেরকে দেখার জন্য নির্দিষ্ট উপায় দেয় যে কেন বেঞ্চমার্ক লাভ এবং পালিশ ভাষা নিজেরাই শক্তিশালী যুক্তি প্রতিষ্ঠা করে না। নিবন্ধটি একটি গুরুত্বপূর্ণ যোগ্যতাও সংরক্ষণ করে: মানুষের নিজস্ব পক্ষপাত রয়েছে এবং কিছু সমস্যার ক্ষেত্রে তারা ধীরগতিতে বা কম নির্ভরযোগ্য হতে পারে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

ভবিষ্যতের মূল্যায়নের জন্য শিরোনাম স্কোরের চেয়ে বেশি পরীক্ষা করতে হবে। গুরুত্বপূর্ণ প্রশ্নগুলির মধ্যে রয়েছে যে মডেলগুলি অপরিচিত সমস্যাগুলিকে সাধারণীকরণ করতে পারে কিনা, তাদের উত্তরগুলি কীভাবে তথ্য উপস্থাপন করা হয় তার উপর নির্ভর করে, জটিলতা বাড়ার সাথে সাথে কার্যকারিতা কীভাবে পরিবর্তিত হয় এবং সাফল্য একটি পুনঃব্যবহারযোগ্য কৌশল বা মুখস্থ নিদর্শনগুলি প্রতিফলিত করে কিনা।

পরবর্তী দরকারী বিকাশ হবে বিস্তৃত, মডেল এবং টাস্ক ফরম্যাট জুড়ে পুনরুত্পাদনযোগ্য পরীক্ষা। এমআইটি টেকনোলজি রিভিউ-এর বৈশিষ্ট্যটি সমস্ত সাতটি পরীক্ষা কভার করে একটি একক স্কোরকার্ড সরবরাহ করে না, বা উত্সটি বেশিরভাগ উদাহরণের জন্য মডেলের নাম, সংস্করণ, নমুনার আকার, প্রম্পটিং শর্ত বা ত্রুটির হার নির্দিষ্ট করে না। রিপোর্ট করা দুর্বলতাগুলি ব্যাপক, নির্দিষ্ট মডেল পরিবারগুলিতে কেন্দ্রীভূত, বা পরীক্ষাগুলি কীভাবে পরিচালিত হয় সে সম্পর্কে সংবেদনশীল কিনা তা নির্ধারণ করার জন্য এই বিবরণগুলির প্রয়োজন হবে।

স্বাধীন মূল্যায়নের উপস্থাপনা ভিন্ন করার সময় অন্তর্নিহিত ধাঁধাটিকে ধ্রুবক রেখে চাক্ষুষ-অনুভূতি ব্যর্থতাকে যুক্তি ব্যর্থতা থেকে পৃথক করা উচিত। গবেষক এবং মূল্যায়নকারীদের এও দেখতে হবে যে মডেলগুলি প্রকৃত সাধারণীকরণের মাধ্যমে উন্নত হয় নাকি বেঞ্চমার্কের মতো উপাদানের বেশি এক্সপোজারের মাধ্যমে। সংযোগ ধাঁধা এবং নাইটস এবং নেভস বৈচিত্রের নিবন্ধের আলোচনা দেখায় কেন দূষণ এবং পরিচিতি গুরুত্বপূর্ণ। একটি মডেল যা প্রকাশিত বা ঘনিষ্ঠভাবে সম্পর্কিত প্রশ্নগুলিতে ভাল পারফর্ম করে একই অন্তর্নিহিত কাঠামোর সাথে নতুন উত্পন্ন সমস্যাগুলিতে সমানভাবে সক্ষম নাও হতে পারে। পরীক্ষায় তাই রাখা-আউট পাজল, পরিবর্তিত শব্দ, অপরিচিত ভিজ্যুয়াল লেআউট এবং এমন কাজগুলি অন্তর্ভুক্ত করা উচিত যেগুলির জন্য একটি প্ররোচিত উত্তর সঠিক বলে ধরে না নিয়ে মধ্যবর্তী সীমাবদ্ধতাগুলি ব্যাখ্যা করা বা পরীক্ষা করা প্রয়োজন৷

জটিলতা এবং বাস্তব-বিশ্ব স্থানান্তর উন্মুক্ত প্রশ্ন থেকে যায়। এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে উপাদান বা প্রয়োজনীয় পদক্ষেপের সংখ্যা বৃদ্ধির সাথে সাথে কার্যক্ষমতা ভেঙ্গে যেতে পারে, তবে উত্সটি স্থাপন করে না যে কীভাবে এই ফলাফলগুলি সরঞ্জাম, পুনরুদ্ধার, বাহ্যিক মেমরি বা মানুষের তত্ত্বাবধান সহ ব্যবহারিক সিস্টেমে অনুবাদ করে। ভবিষ্যত রিপোর্টিং ট্র্যাক করা উচিত যে এই ধরনের সংযোজনগুলি নির্ভরযোগ্যতা উন্নত করে কিনা, মডেলগুলিকে আরও কার্যকরভাবে অনুসন্ধান করতে সাহায্য করে বা নতুন ব্যর্থতার মোডগুলি প্রবর্তন করে। পাঠকদের মূল্যায়নের দিকেও নজর রাখা উচিত যা কৌশলের গুণমান পরিমাপ করে, শুধুমাত্র চূড়ান্ত উত্তর নয়, কারণ একটি ভঙ্গুর বা অ-সাধারণযোগ্য নিয়মের মাধ্যমে পৌঁছানো একটি সঠিক ফলাফল সমস্যাটিতে সামান্য পরিবর্তন নাও থাকতে পারে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণট্রান্সফরমারআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?