কি হয়েছে
এমআইটি টেকনোলজি রিভিউ সাতটি ধাঁধার তৈরি একটি ইন্টারেক্টিভ বৈশিষ্ট্য প্রকাশ করেছে যা এআই মডেলগুলি কীভাবে যুক্তি দেয় তা অনুসন্ধান করে। নিবন্ধটি রিপোর্ট করে যে মডেলগুলি কিছু কাজগুলিতে দ্রুত উন্নতি করেছে কিন্তু এখনও স্থানিক ম্যানিপুলেশন, পরিচিত সমস্যার সূক্ষ্ম বৈচিত্র্য, ভিজ্যুয়াল বিমূর্ততা এবং ক্রমবর্ধমান জটিল মাল্টিস্টেপ যুক্তির সাথে লড়াই করছে।
এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে এর বৈশিষ্ট্যটি স্থানিক যুক্তি, স্মৃতি এবং অভিযোজনযোগ্যতা, বিমূর্ত এবং চাক্ষুষ যুক্তি, মানুষের অন্তর্দৃষ্টি এবং ক্রমবর্ধমান জটিলতা কভার করে সাতটি পরীক্ষা উপস্থাপন করে। নিবন্ধটি এআই মূল্যায়নের দীর্ঘ ইতিহাসে ধাঁধা-সমাধানকে স্থান দেয়, উল্লেখ করে যে চেকার, দাবা এবং গো-এর মতো গেমগুলি মাঠের প্রথম বছর থেকেই পরীক্ষার বিছানা হিসাবে ব্যবহৃত হয়ে আসছে। এটি বলে যে ধাঁধার কর্মক্ষমতা উল্লেখযোগ্যভাবে উন্নত হয়েছে: 2024 সালের শেষের দিকে একটি কলম্বিয়া ইউনিভার্সিটি দল খুঁজে পেয়েছে যে নেতৃস্থানীয় মডেলগুলি নিউ ইয়র্ক টাইমস সংযোগের ধাঁধার মাত্র 18% সমাধান করেছে, যখন 2025 সালের প্রথম দিকে কিছু মডেল প্রায় প্রতিবারই তাদের প্রায় পুরোপুরি সমাধান করতে পারে। উত্সটি মডেলগুলি সনাক্ত করে না বা বৈশিষ্ট্যের উদাহরণ জুড়ে একটি প্রমিত তুলনা প্রদান করে না।
এমআইটি টেকনোলজি রিভিউ বলে যে স্থানিক যুক্তি একটি বড় দুর্বলতা রয়ে গেছে। এর মানসিক-ঘূর্ণন বিভাগটি পাঠকদেরকে অন্য কোণ থেকে দেখানো একটি ত্রি-মাত্রিক বস্তু সনাক্ত করতে বলে, এবং নিবন্ধটি জানায় যে ভিজ্যুয়াল-ইনপুট ক্ষমতা সহ ভাষার মডেলগুলি এখনও এই ধরনের কাজগুলিতে খুব খারাপভাবে কাজ করে। বৈশিষ্ট্যটি এই অসুবিধাটিকে এআই সিস্টেমের বিশ্ব মডেলের বিকাশের দাবির সাথে সংযুক্ত করে, যুক্তি দেয় যে বর্তমান বৃহৎ ভাষার মডেলগুলি ত্রিমাত্রিক বস্তুগুলিকে মানব স্থানিক বিশেষজ্ঞরা যেভাবে ব্যবহার করতে পারে সেভাবে ম্যানিপুলেট করতে দেখা যায় না। নিবন্ধটি একটি স্মৃতি-এবং-অভিযোজনযোগ্যতার সমস্যাও বর্ণনা করে: বিপুল পরিমাণ তথ্যের উপর প্রশিক্ষিত মডেলগুলি একটি পরিচিত ধাঁধার প্যাটার্ন চিনতে পারে এবং একটি ছোট পরিবর্তন উপেক্ষা করতে পারে। এটি একটি 2024 Google এবং ইউনিভার্সিটি অফ ইলিনয় আরবানা-চ্যাম্পেইন অধ্যয়নের উদ্ধৃতি দিয়েছে যাতে এই উদ্বেগের প্রমাণ হিসাবে নাইটস এবং নেভস পাজলের বিভিন্নতা জড়িত।
বৈশিষ্ট্যটি তখন দ্বি-মাত্রিক বিমূর্ততা এবং চাক্ষুষ যুক্তিতে পরিণত হয়। এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে মডেলগুলি এআরসি-এজিআই ধাঁধাগুলিতে আরও ভাল পারফরম্যান্স করে যখন গ্রিডগুলিকে ইমেজ হিসাবে পরিবর্তে সেল রঙের এনকোডিং সংখ্যাসূচক স্ট্রিং হিসাবে সরবরাহ করা হয়। এটি আরও বলে যে গবেষণায় দেখা গেছে যে মডেলগুলি কখনও কখনও জটিল, অ-সাধারণযোগ্য নিয়মের মাধ্যমে সঠিক উত্তরে পৌঁছাতে পারে, যখন মানুষ সহজ চাক্ষুষ ধারণার উপর নির্ভর করতে পারে। নিবন্ধটি সিম্পলবেঞ্চ প্রশ্ন, নাইটস এবং নেভস সমস্যা, এবং একটি ARC-AGI রূপান্তর ধাঁধাকে কাজের উদাহরণ হিসাবে উপস্থাপন করে যা এই পার্থক্যগুলিকে প্রকাশ করতে পারে।
এটি পৃথকভাবে অন্তর্দৃষ্টি পরীক্ষাগুলি বর্ণনা করে যেখানে লোকেরা প্রায়শই দ্রুত কিন্তু ভুল উত্তর দেয়, যখন মডেলগুলি আরও ইচ্ছাকৃতভাবে প্রতিক্রিয়া জানাতে পারে। একটি উদাহরণ জিজ্ঞাসা করে যে একটি গুহা অর্ধেক ভরাট হতে কতক্ষণ সময় নেয় যখন এর ব্যাট জনসংখ্যা প্রতিদিন দ্বিগুণ হয়; অন্য একজন পাঠকদের অ্যালিসের সাথে যুক্ত একটি উদ্ধৃতি সনাক্ত করতে বলে।
অবশেষে, এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে কর্মক্ষমতা প্রায়ই খারাপ হয়ে যায় কারণ সমস্যাগুলি আরও জটিল হয়ে ওঠে। এটি একটি Apple গবেষণার উদ্ধৃতি দেয় যে ভাষা মডেলগুলি হ্যানয়ের টাওয়ারের সহজ সংস্করণ এবং নদী পারাপারের সমস্যাগুলি সমাধান করতে পারে কিন্তু যখন ডিস্ক বা লোকের সংখ্যা ছয় বা তার বেশি হয় তখন তা স্থবির হতে শুরু করে। এটি ওয়াশিংটন ইউনিভার্সিটি, স্ট্যানফোর্ড ইউনিভার্সিটি এবং অ্যালেন ইনস্টিটিউটের গবেষকদের দ্বারা লজিক-গ্রিড পাজলগুলির সাথে একই রকম অসুবিধা খুঁজে পাওয়া কাজের উদ্ধৃতি দেয়। বৈশিষ্ট্যটি উল্লেখ করেছে যে মন্তব্যকারীরা প্রশ্ন করেছেন যে এই ফলাফলগুলি একটি অনন্যভাবে মেশিনের মতো যুক্তির সীমাবদ্ধতা প্রকাশ করে বা কেবল এই সত্যটিকে প্রতিফলিত করে যে জটিলতা বৃদ্ধির সাথে সাথে লোকেরা আরও ত্রুটি করে। এর রিভার-ক্রসিং এবং লজিক-গ্রিড উদাহরণগুলি তাই পরীক্ষা করে যে একটি মডেল একটি উত্তর তৈরি করতে পারে কিনা, তবে এটি একাধিক সংযুক্ত ডিডাকশন জুড়ে সীমাবদ্ধতা বজায় রাখতে পারে কিনা।
উত্স বিবরণ: technologyreview.com ↗
কেন এটা গুরুত্বপূর্ণ
বৈশিষ্ট্যটি দেখায় কেন AI বুদ্ধিমত্তা সম্পর্কে বিস্তৃত দাবি বিভ্রান্তিকর হতে পারে। একটি মডেল ট্রিভিয়া বা একটি পরিচিত বেঞ্চমার্কে ভাল পারফর্ম করতে পারে যখন শব্দের একটি ছোট পরিবর্তন, একটি চাক্ষুষ রূপান্তর, বা একটি সমস্যা যার জন্য বেশ কয়েকটি নির্ভরশীল পদক্ষেপের প্রয়োজন হয়। এই পার্থক্যগুলি গুরুত্বপূর্ণ যখন সিস্টেমগুলি প্রদর্শনের পরিবর্তে সিদ্ধান্তের জন্য ব্যবহার করা হয়।
কেন্দ্রীয় শিক্ষা হল যে এক শ্রেণীর পরীক্ষায় পারফরম্যান্সকে বুদ্ধিমত্তার সাধারণ পরিমাপ হিসাবে বিবেচনা করা উচিত নয়। এমআইটি টেকনোলজি রিভিউ-এর উদাহরণগুলি এমন কাজগুলিকে বিস্তৃত করে যেগুলি অতিমাত্রায় সহজ দেখায় কিন্তু বিভিন্ন ক্ষমতার প্রয়োজন হয়: একটি বস্তুকে মানসিকভাবে ঘোরানো, বিবৃতি জুড়ে সত্য এবং মিথ্যা ট্র্যাক করা, একটি চাক্ষুষ নিয়ম অনুমান করা, একটি বিভ্রান্তিকর অন্তর্দৃষ্টি প্রতিরোধ করা, বা সীমাবদ্ধতার অধীনে একটি ক্রম পরিকল্পনা করা। একটি সিস্টেম একটি এলাকায় অস্বাভাবিকভাবে শক্তিশালী হতে পারে এবং অন্য ক্ষেত্রে অবিশ্বস্ত হতে পারে। এই অসমতা বিশেষভাবে প্রাসঙ্গিক যখন ব্যবহারকারীরা সাবলীল উত্তরগুলিকে প্রমাণ হিসাবে ব্যাখ্যা করে যে একটি মডেল অন্তর্নিহিত সমস্যাটি বুঝতে পেরেছিল।
নিবন্ধটি একটি মূল্যায়ন সমস্যাও তুলে ধরে: একটি কাজের বিন্যাস বস্তুগতভাবে ফলাফলকে প্রভাবিত করতে পারে। MIT প্রযুক্তি পর্যালোচনা রিপোর্ট করে যে ARC-AGI কর্মক্ষমতা উন্নত হয় যখন ভিজ্যুয়াল গ্রিডগুলিকে সংখ্যাসূচক উপস্থাপনায় রূপান্তরিত করা হয়। এটি পরামর্শ দেয় যে একটি স্কোর শুধুমাত্র মডেলের যুক্তির ক্ষমতাকেই প্রতিফলিত করতে পারে না কিন্তু সমস্যাটি এনকোড করা এবং উপস্থাপন করার উপায়ও। একই উদ্বেগ পরিচিত ধাঁধার ক্ষেত্রে প্রযোজ্য। যদি প্রশিক্ষণের সময় একটি মডেল একটি ঘনিষ্ঠ বৈকল্পিক সম্মুখীন হয়, একটি সঠিক উত্তর একটি নতুন ক্ষেত্রে একটি নিয়ম মানিয়ে নেওয়ার ক্ষমতার পরিবর্তে প্যাটার্ন স্বীকৃতি বা পুনরুদ্ধার প্রতিফলিত করতে পারে। উৎসটি স্থাপন করে না যে কত ঘন ঘন কোন প্রক্রিয়াটি স্থাপন করা সিস্টেম জুড়ে ঘটে।
শিক্ষা, সফ্টওয়্যার, গবেষণা, প্রশাসন বা অপরিচিত ক্ষেত্রে জড়িত অন্যান্য সেটিংসে AI ব্যবহার করে এমন যে কেউ এই সীমাবদ্ধতার ব্যবহারিক প্রভাব রয়েছে। একটি মডেল যা রুটিন উদাহরণগুলিতে সফল হয় তা এখনও ব্যর্থ হতে পারে যখন শব্দ পরিবর্তন হয়, বেশ কয়েকটি সীমাবদ্ধতা ইন্টারঅ্যাক্ট করে, বা প্রাসঙ্গিক তথ্য পাঠ্যের পরিবর্তে চাক্ষুষ হয়। বৈশিষ্ট্যটি একটি নতুন পণ্য লঞ্চ, একটি নতুন মডেল প্রকাশ, বা একটি নির্দিষ্ট বাণিজ্যিক সিস্টেমের নিয়ন্ত্রিত মূল্যায়নের প্রতিবেদন করে না। এর মূল্য ব্যাখ্যামূলক: এটি পাঠকদেরকে দেখার জন্য নির্দিষ্ট উপায় দেয় যে কেন বেঞ্চমার্ক লাভ এবং পালিশ ভাষা নিজেরাই শক্তিশালী যুক্তি প্রতিষ্ঠা করে না। নিবন্ধটি একটি গুরুত্বপূর্ণ যোগ্যতাও সংরক্ষণ করে: মানুষের নিজস্ব পক্ষপাত রয়েছে এবং কিছু সমস্যার ক্ষেত্রে তারা ধীরগতিতে বা কম নির্ভরযোগ্য হতে পারে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
ভবিষ্যতের মূল্যায়নের জন্য শিরোনাম স্কোরের চেয়ে বেশি পরীক্ষা করতে হবে। গুরুত্বপূর্ণ প্রশ্নগুলির মধ্যে রয়েছে যে মডেলগুলি অপরিচিত সমস্যাগুলিকে সাধারণীকরণ করতে পারে কিনা, তাদের উত্তরগুলি কীভাবে তথ্য উপস্থাপন করা হয় তার উপর নির্ভর করে, জটিলতা বাড়ার সাথে সাথে কার্যকারিতা কীভাবে পরিবর্তিত হয় এবং সাফল্য একটি পুনঃব্যবহারযোগ্য কৌশল বা মুখস্থ নিদর্শনগুলি প্রতিফলিত করে কিনা।
পরবর্তী দরকারী বিকাশ হবে বিস্তৃত, মডেল এবং টাস্ক ফরম্যাট জুড়ে পুনরুত্পাদনযোগ্য পরীক্ষা। এমআইটি টেকনোলজি রিভিউ-এর বৈশিষ্ট্যটি সমস্ত সাতটি পরীক্ষা কভার করে একটি একক স্কোরকার্ড সরবরাহ করে না, বা উত্সটি বেশিরভাগ উদাহরণের জন্য মডেলের নাম, সংস্করণ, নমুনার আকার, প্রম্পটিং শর্ত বা ত্রুটির হার নির্দিষ্ট করে না। রিপোর্ট করা দুর্বলতাগুলি ব্যাপক, নির্দিষ্ট মডেল পরিবারগুলিতে কেন্দ্রীভূত, বা পরীক্ষাগুলি কীভাবে পরিচালিত হয় সে সম্পর্কে সংবেদনশীল কিনা তা নির্ধারণ করার জন্য এই বিবরণগুলির প্রয়োজন হবে।
স্বাধীন মূল্যায়নের উপস্থাপনা ভিন্ন করার সময় অন্তর্নিহিত ধাঁধাটিকে ধ্রুবক রেখে চাক্ষুষ-অনুভূতি ব্যর্থতাকে যুক্তি ব্যর্থতা থেকে পৃথক করা উচিত। গবেষক এবং মূল্যায়নকারীদের এও দেখতে হবে যে মডেলগুলি প্রকৃত সাধারণীকরণের মাধ্যমে উন্নত হয় নাকি বেঞ্চমার্কের মতো উপাদানের বেশি এক্সপোজারের মাধ্যমে। সংযোগ ধাঁধা এবং নাইটস এবং নেভস বৈচিত্রের নিবন্ধের আলোচনা দেখায় কেন দূষণ এবং পরিচিতি গুরুত্বপূর্ণ। একটি মডেল যা প্রকাশিত বা ঘনিষ্ঠভাবে সম্পর্কিত প্রশ্নগুলিতে ভাল পারফর্ম করে একই অন্তর্নিহিত কাঠামোর সাথে নতুন উত্পন্ন সমস্যাগুলিতে সমানভাবে সক্ষম নাও হতে পারে। পরীক্ষায় তাই রাখা-আউট পাজল, পরিবর্তিত শব্দ, অপরিচিত ভিজ্যুয়াল লেআউট এবং এমন কাজগুলি অন্তর্ভুক্ত করা উচিত যেগুলির জন্য একটি প্ররোচিত উত্তর সঠিক বলে ধরে না নিয়ে মধ্যবর্তী সীমাবদ্ধতাগুলি ব্যাখ্যা করা বা পরীক্ষা করা প্রয়োজন৷
জটিলতা এবং বাস্তব-বিশ্ব স্থানান্তর উন্মুক্ত প্রশ্ন থেকে যায়। এমআইটি টেকনোলজি রিভিউ রিপোর্ট করে যে উপাদান বা প্রয়োজনীয় পদক্ষেপের সংখ্যা বৃদ্ধির সাথে সাথে কার্যক্ষমতা ভেঙ্গে যেতে পারে, তবে উত্সটি স্থাপন করে না যে কীভাবে এই ফলাফলগুলি সরঞ্জাম, পুনরুদ্ধার, বাহ্যিক মেমরি বা মানুষের তত্ত্বাবধান সহ ব্যবহারিক সিস্টেমে অনুবাদ করে। ভবিষ্যত রিপোর্টিং ট্র্যাক করা উচিত যে এই ধরনের সংযোজনগুলি নির্ভরযোগ্যতা উন্নত করে কিনা, মডেলগুলিকে আরও কার্যকরভাবে অনুসন্ধান করতে সাহায্য করে বা নতুন ব্যর্থতার মোডগুলি প্রবর্তন করে। পাঠকদের মূল্যায়নের দিকেও নজর রাখা উচিত যা কৌশলের গুণমান পরিমাপ করে, শুধুমাত্র চূড়ান্ত উত্তর নয়, কারণ একটি ভঙ্গুর বা অ-সাধারণযোগ্য নিয়মের মাধ্যমে পৌঁছানো একটি সঠিক ফলাফল সমস্যাটিতে সামান্য পরিবর্তন নাও থাকতে পারে।