কি হয়েছে
24 অগাস্টে জমা দেওয়া একটি arXiv প্রিপ্রিন্ট মানুষের উপলব্ধি, ম্যাকাক ইনফিরিয়র টেম্পোরাল কর্টেক্সে স্নায়বিক কার্যকলাপ এবং চিত্র- এবং ভিডিও-ভিত্তিক নিউরাল নেটওয়ার্ক দ্বারা উত্পাদিত উপস্থাপনার মধ্যে একটি তুলনা প্রতিবেদন করে। সমীক্ষায় দেখা গেছে যে অস্থায়ী একীকরণ বস্তুর উপস্থাপনাকে উন্নত করেছে, কিন্তু বেশিরভাগ ভিডিও-স্বীকৃতি মডেলগুলি খারাপভাবে সাধারণীকরণ করেছে যখন গতির গঠন অক্ষত থাকা অবস্থায় চেহারা পরিবর্তিত হয়। ভবিষ্যদ্বাণীমূলক বিশ্ব মডেলগুলি ক্রস-অভিজ্ঞতা সাধারণীকরণ এবং ম্যাকাক ইনফিরিয়র টেম্পোরাল কর্টেক্সে সবচেয়ে ঘনিষ্ঠভাবে মিলে যাওয়া কার্যকলাপের উপর সর্বোত্তম পারফর্ম করেছে, যদিও কোনো পরীক্ষিত মডেলই পরবর্তীতে, গতি-ভিত্তিক এবং চেহারা-অপরিবর্তনীয় কোডিং-এর প্রথম দিকের চেহারা-প্রধান প্রতিক্রিয়া থেকে সম্পূর্ণ পরিবর্তনের পুনরুত্পাদন করেনি।
কাগজটি জিজ্ঞাসা করে যে কীভাবে একটি বুদ্ধিমান ভিজ্যুয়াল সিস্টেম বস্তুগুলিকে কেমন দেখায় তার সাথে তারা কীভাবে নড়াচড়া করে এবং যখন চেহারা পরিবর্তন হয় তখন নির্ভরযোগ্য থাকে। এই প্রশ্নটি তদন্ত করার জন্য, লেখক বিভিন্ন ধরণের নিউরাল নেটওয়ার্কের অভ্যন্তরীণ উপস্থাপনাগুলির সাথে ম্যাকাক ইনফিরিয়র টেম্পোরাল কর্টেক্সে মানুষের উপলব্ধি এবং স্নায়বিক কার্যকলাপের তুলনা করেন। মডেলগুলি চিত্র এবং ভিডিও স্বীকৃতি, বিভাজন, অপটিক-প্রবাহ প্রক্রিয়াকরণ এবং ভবিষ্যদ্বাণীমূলক বিশ্ব মডেলিং। এটি কম্পিউটার দৃষ্টিতে সাধারণ উন্নতির পরিবর্তে জৈবিক দৃষ্টি এবং কৃত্রিম ভিজ্যুয়াল উপস্থাপনার মধ্যে সম্পর্ক সম্পর্কে উত্সের কেন্দ্রীয় তুলনা করে।
রিপোর্ট করা ফলাফল এমন নয় যে সাময়িক তথ্য স্বয়ংক্রিয়ভাবে চাক্ষুষ দৃঢ়তার সমাধান করে। লেখকরা বলেছেন যে সাময়িক একীকরণ বস্তুর উপস্থাপনাকে উন্নত করেছে, কিন্তু বেশিরভাগ ভিডিও-স্বীকৃতি মডেলগুলি খারাপভাবে সাধারণীকরণ করেছে যখন কোনও বস্তুর উপস্থিতি ব্যাহত হয়েছিল এবং এর গতি কাঠামো সংরক্ষণ করা হয়েছিল। মানুষ এবং ম্যাকাক নিকৃষ্ট টেম্পোরাল কর্টেক্স সেই পরিবর্তনের অধীনে শক্তিশালী ছিল। কাগজের তুলনাতে, ভবিষ্যদ্বাণীমূলক বিশ্ব মডেলগুলি ম্যাকাক ইনফিরিয়র টেম্পোরাল কর্টেক্সের কার্যকলাপের নিকটতম চিঠিপত্রের সাথে শক্তিশালী ক্রস-অভিজ্ঞতা সাধারণীকরণকে একত্রিত করেছে, যা বিবেচনা করা অন্যান্য ভিডিও-মডেলিং পদ্ধতিকে ছাড়িয়ে গেছে।
গবেষণাটি পরীক্ষিত কৃত্রিম সিস্টেম দ্বারা ভাগ করা একটি সীমাবদ্ধতারও রিপোর্ট করে। কোনো মডেল লেখকদের দ্বারা বর্ণিত কর্টিকাল রূপান্তরকে পুনরুত্পাদন করেনি: প্রারম্ভিক প্রতিক্রিয়াগুলি উপস্থিতির দ্বারা আধিপত্য বিস্তার করে ধীরে ধীরে পরবর্তী কোডিংকে পথ দেয় যা চেহারার জন্য আরও অপরিবর্তনীয় এবং গতির সাথে আরও ঘনিষ্ঠভাবে আবদ্ধ। লেখকরা এই অনুপস্থিত রূপান্তরটিকে প্রমাণ হিসাবে ব্যাখ্যা করেছেন যে শক্তিশালী গতিশীল দৃষ্টিশক্তির জন্য বস্তুর উপস্থাপনায় গতির প্রগতিশীল একীকরণের প্রয়োজন হতে পারে। উত্সটি সেই গণনার দিকে একটি প্রতিশ্রুতিশীল পথ হিসাবে ভবিষ্যদ্বাণীমূলক শিক্ষাকে চিহ্নিত করে, তবে এটি দাবি করে না যে পরীক্ষিত মডেলগুলি সম্পূর্ণরূপে জৈবিক প্রক্রিয়া বাস্তবায়ন করে বা অনুসন্ধানটি স্থাপন করা সিস্টেমে বৈধ করা হয়েছে।
কেন এটা গুরুত্বপূর্ণ
কাগজটি বর্তমান গতিশীল-দৃষ্টি সিস্টেমে একটি নির্দিষ্ট সীমাবদ্ধতা চিহ্নিত করে: ভিডিও বা সাময়িক তথ্য যোগ করা একটি বস্তুর চেহারাতে পরিবর্তনের জন্য ধারাবাহিকভাবে মডেলগুলিকে শক্তিশালী করেনি। এর প্রস্তাবিত নীতি-অবজেক্টের উপস্থাপনায় গতিকে ক্রমবর্ধমানভাবে একীভূত করা-গবেষকদের ভিজ্যুয়াল এআই ডিজাইন এবং মূল্যায়নের জন্য একটি পরিষ্কার লক্ষ্য দিতে পারে। ফলাফলটি স্থাপনার প্রস্তুতির প্রমাণের পরিবর্তে একটি গবেষণার ফলাফল হিসাবে রয়ে গেছে, এবং উত্সটি প্রতিষ্ঠিত করে না যে ভবিষ্যদ্বাণীমূলক শিক্ষা প্রতিটি চাক্ষুষ কাজ বা অপারেটিং পরিবেশকে উন্নত করবে।
ভিজ্যুয়াল এআই-এর জন্য, একটি বস্তুর চেহারা এবং এর গতিবিধির মধ্যে পার্থক্য কার্যত গুরুত্বপূর্ণ কারণ অর্থপূর্ণ গতি কাঠামো সংরক্ষণ করার সময় একই বস্তু ভিন্ন দেখাতে পারে। কাগজের ফলাফলটি পরামর্শ দেয় যে একটি সিস্টেম দুর্বল থাকতে পারে যদি এটি টেম্পোরাল ইনপুটকে প্রধানত অতিরিক্ত ভিজ্যুয়াল সামগ্রী হিসাবে বিবেচনা করে তার বস্তুর উপস্থাপনাকে পরিমার্জিত করার জন্য গতি ব্যবহার না করে। যদি ব্যাখ্যাটি ধারণ করে, মডেল ডিজাইনারদের শুধুমাত্র একটি সিস্টেম পরিচিত ভিডিওতে বস্তুগুলিকে চিনতে পারে কিনা তা নয়, চেহারা পরিবর্তন এবং গতি যখন তথ্যপূর্ণ থাকে তখন এটি পরিচয় বা বিভাগের তথ্য সংরক্ষণ করে কিনা তাও মূল্যায়ন করতে হতে পারে।
অধ্যয়নটি একটি কংক্রিট গবেষণা দিক নির্দেশ করে। দৃঢ়তাকে স্বীকৃতির পরে যোগ করা একটি পৃথক স্তর হিসাবে বিবেচনা করার পরিবর্তে, গবেষকরা স্থাপত্য এবং শেখার উদ্দেশ্যগুলি তদন্ত করতে পারে যা গতির সাথে চেহারাকে ধীরে ধীরে একত্রিত করে। ভবিষ্যদ্বাণীমূলক বিশ্ব মডেলগুলি এই অ্যাকাউন্টে প্রাসঙ্গিক কারণ উত্স রিপোর্ট করে যে তারা শক্তিশালী ক্রস-অভিজ্ঞতা সাধারণীকরণ এবং তুলনামূলক পদ্ধতির মধ্যে ম্যাকাক নিকৃষ্ট অস্থায়ী প্রতিনিধিত্বের নিকটতম মিল উভয়ই অর্জন করেছে। এটি প্রমাণ করে না যে ভবিষ্যদ্বাণীমূলক শিক্ষা সুবিধার কারণ, তবে এটি গবেষকদের একটি মডেলের প্রশিক্ষণের উদ্দেশ্য, চেহারার ব্যাঘাতের অধীনে এর আচরণ এবং এর স্নায়বিক মিলের মধ্যে একটি পরীক্ষাযোগ্য সংযোগ দেয়।
অনুসন্ধানগুলি দাবির উপর একটি সীমাও স্থাপন করে যে বর্তমান ভিডিও মডেলগুলি ইতিমধ্যে জৈবিক দৃষ্টিভঙ্গির প্রয়োজনীয় নীতিগুলিকে ধারণ করেছে। কাগজটি ভবিষ্যদ্বাণীমূলক বিশ্ব মডেল এবং ম্যাকাক নিকৃষ্ট অস্থায়ী কার্যকলাপের মধ্যে একটি অর্থপূর্ণ চিঠিপত্রের প্রতিবেদন করে, তবুও এটি একই সাথে বলে যে কোনও মডেল চেহারা-প্রধান থেকে গতি-ভিত্তিক কোডিং পর্যন্ত অগ্রগতি পুনরুত্পাদন করেনি। জনসাধারণের তাত্পর্য তাই প্রধানত পদ্ধতিগত: কাজটি গতিশীল-দৃষ্টি গবেষণার জন্য আরও চাহিদাপূর্ণ মান নির্ধারণে সহায়তা করতে পারে। উত্সটি খরচ, বিলম্বতা, শারীরিক পরিবেশে নির্ভরযোগ্যতা, নিরাপত্তা-সমালোচনামূলক স্থাপনা বা রিপোর্ট করা তুলনার বাইরে কাজগুলিতে কর্মক্ষমতা সম্পর্কে প্রমাণ সরবরাহ করে না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
মূল ফলো-আপ হল অন্য গবেষকরা ভবিষ্যদ্বাণীমূলক বিশ্ব মডেল, ক্রস-অভিপ্রদর্শন দৃঢ়তা এবং ম্যাকাক নিকৃষ্ট অস্থায়ী কার্যকলাপের মধ্যে রিপোর্ট করা সম্পর্ক পুনরুত্পাদন করতে পারে কিনা। ভবিষ্যত কাজ এমন আর্কিটেকচারগুলি পরীক্ষা করতে পারে যা স্পষ্টভাবে উপস্থিতি-সংবেদনশীল প্রক্রিয়াকরণ থেকে গতি-ভিত্তিক উপস্থাপনার দিকে চলে যায় এবং পরীক্ষা করতে পারে যে পরিবর্তনটি অধ্যয়নের তুলনার বাইরে কর্মক্ষমতা উন্নত করে কিনা। গুরুত্বপূর্ণ অজানাগুলির মধ্যে রয়েছে সঠিক মূল্যায়নের শর্ত, পরীক্ষিত ভিজ্যুয়াল ব্যাঘাতের প্রস্থ, কীভাবে মডেলগুলিকে প্রশিক্ষিত করা হয়েছিল এবং প্রস্তাবিত নীতি বাস্তব-বিশ্বের সিস্টেমে পরিমাপযোগ্য লাভে অনুবাদ করে কিনা।
প্রজননযোগ্যতা হল প্রথম অমীমাংসিত প্রশ্ন। উত্সটি একটি arXiv সংস্করণ 1 প্রিপ্রিন্ট, এবং সরবরাহ করা পৃষ্ঠাটি বিমূর্ত এবং জমা দেওয়ার ইতিহাস দেয় তবে ফলাফলগুলি কতটা বিস্তৃতভাবে প্রযোজ্য তা মূল্যায়ন করার জন্য প্রয়োজনীয় সম্পূর্ণ পরীক্ষামূলক বিবরণ দেয় না। ফলো-আপ অধ্যয়নগুলি পরীক্ষা করা উচিত যে ভবিষ্যদ্বাণীমূলক বিশ্বের মডেলগুলির রিপোর্ট করা সুবিধা ডেটাসেট, অবজেক্ট বিভাগ, গতির ধরণ এবং বিভিন্ন ধরণের উপস্থিতি ব্যাঘাত জুড়ে বজায় থাকে কিনা। ফলাফল নির্দিষ্ট প্রশিক্ষণ পদ্ধতি বা মডেল পরিবারের উপর নির্ভর করে কিনা তাও তাদের স্পষ্ট করা উচিত।
একটি দ্বিতীয় প্রশ্ন হল প্রস্তাবিত নীতি সরাসরি বাস্তবায়ন করা যেতে পারে কিনা। কাগজটি বস্তুর উপস্থাপনায় গতির প্রগতিশীল একীকরণ বর্ণনা করে এবং বলে যে কোনও পরীক্ষিত মডেল সংশ্লিষ্ট কর্টিকাল রূপান্তর পুনরুত্পাদন করেনি। ভবিষ্যত সিস্টেমগুলি তাই তাদের অভ্যন্তরীণ উপস্থাপনার সময় এবং বিষয়বস্তুর জন্য মূল্যায়ন করা যেতে পারে, শুধুমাত্র তাদের চূড়ান্ত স্বীকৃতির নির্ভুলতা নয়। একটি দরকারী পরীক্ষা হবে যে একটি মডেল পরবর্তী প্রক্রিয়াকরণ পর্যায়ে আরও উপস্থিতি-অপরিবর্তনশীল হয়ে ওঠে কিনা গতির তথ্য ধরে রাখার সময়, যেমনটি মানব এবং ম্যাকাক দৃষ্টির জন্য উত্স রিপোর্ট করে।
অবশেষে, গবেষকদের নির্ধারণ করতে হবে যে স্নায়বিক সাদৃশ্য এবং ক্রস-আদর্শ সাধারণীকরণ অ্যাপ্লিকেশনগুলিতে কার্যকর উন্নতি ঘটায় কিনা। উৎসটি স্থাপনার ফলাফল, ব্যবহারকারীর ফলাফল, অপারেশনাল টেস্টিং বা ভিজ্যুয়াল এআই-এর সার্বজনীন প্রেসক্রিপশনের প্রতিবেদন করে না। অন্যান্য ডিজাইন পছন্দের তুলনায় ভবিষ্যদ্বাণীমূলক শিক্ষা কতটা অবদান রাখে, গুরুত্বপূর্ণ চেহারা পরিবর্তনের প্রতি সংবেদনশীলতার বিরুদ্ধে দৃঢ়তা বাণিজ্য করতে পারে কিনা এবং প্রস্তাবিত গণনা কীভাবে পরিমাপ করা উচিত তাও এটি খোলা রাখে। এই অজানাদের যে কোনও দাবিকে মেজাজ করা উচিত যে গবেষণাটি শক্তিশালী গতিশীল দৃষ্টিকে সমাধান করেছে।