কি হয়েছে
একটি arXiv প্রিপ্রিন্ট AI, মানব কর্মীদের, বা উভয়ের মধ্যে সহযোগিতার জন্য কোন কর্মক্ষেত্রের কাজগুলি উপযুক্ত হতে পারে তা অনুমান করার জন্য একটি পদ্ধতি প্রবর্তন করে। এটি জ্ঞানীয় মাত্রার একই সেট ব্যবহার করে এআই ক্ষমতা এবং কাজের প্রয়োজনীয়তার তুলনা করে।
arXiv পেপারটি AI মোতায়েনকারী সংস্থাগুলির মুখোমুখি একটি স্কোপিং সমস্যা বর্ণনা করে: কোন কাজগুলি স্বয়ংক্রিয় হতে পারে, কোনটি মানুষের সাথে থাকা উচিত এবং কোনটি ভাগ করা উচিত তা নির্ধারণ করা। লেখকরা যুক্তি দেন যে সামগ্রিক বেঞ্চমার্ক স্কোরগুলি এই সিদ্ধান্তের জন্য খারাপভাবে উপযুক্ত কারণ একটি একক সামগ্রিক স্কোর কোনও AI সিস্টেম ভাল বা খারাপভাবে পরিচালনা করে এমন কাজ দেখায় না। তারা আরও যুক্তি দেয় যে মডেলের ক্ষমতা সম্পর্কে মানুষের রায় সিস্টেম পরিবর্তনের সাথে সাথে পুরানো হয়ে যেতে পারে।
প্রস্তাবিত পাইপলাইন মূল জ্ঞানীয় ক্ষমতার একটি ভাগ করা প্রোফাইল ব্যবহার করে। AI সিস্টেমগুলি একটি বেঞ্চমার্ক ব্যাটারিতে তাদের কার্যকারিতা পরিমাপ করে প্রোফাইল করা হয় যার পৃথক আইটেমগুলি তাদের জড়িত জ্ঞানীয় চাহিদাগুলির জন্য টীকা করা হয়। ডোমেন বিশেষজ্ঞদের তাদের কাজের ক্ষেত্রে সেই একই ক্ষমতার আপেক্ষিক গুরুত্বের ওজন করার জন্য জিজ্ঞাসা করে কর্মক্ষেত্রের কাজগুলি আলাদাভাবে প্রোফাইল করা হয়। যেহেতু উভয় পক্ষই মাত্রার একটি সাধারণ সেট ব্যবহার করে, কাগজটি বলে যে মডেল প্রোফাইল এবং কাজের প্রয়োজনীয়তাগুলি স্বাধীনভাবে আপডেট করা যেতে পারে এবং তারপরে একত্রিত করা যেতে পারে।
লেখক বিমূর্ত তিনটি বৈধতা ধাপ রিপোর্ট. তারা পরীক্ষা করে যে পদ্ধতিটি সিন্থেটিক এজেন্টের জন্য সক্ষমতা প্রোফাইল পুনরুদ্ধার করতে পারে, ছয়টি এআই সিস্টেমের প্রোফাইল, এবং ছয়টি পেশাগত ডোমেন জুড়ে 410 জন কর্মচারীর কাছ থেকে টাস্ক-রিকোয়ারমেন্ট অ্যাসেসমেন্ট সংগ্রহ করতে পারে। বিমূর্তটি সেই ডোমেনগুলি সনাক্ত করে না, এআই সিস্টেমের নাম দেয়, বেঞ্চমার্ক ব্যাটারির বিশদ বিবরণ দেয়, বা অন্তর্নিহিত স্কোর প্রদান করে না। অধ্যয়নের কভারেজ এবং তুলনামূলক ফলাফল সম্পর্কে একা উৎস থেকে কী উপসংহার করা যেতে পারে সেইগুলি সীমাবদ্ধ করে।
কাগজটি রিপোর্ট করেছে যে ছয়টি এআই সিস্টেমগুলি মডেল পরিবারের তুলনায় পৃথক জ্ঞানীয় মাত্রা জুড়ে বেশি আলাদা। এটি আরও বলে যে কর্মক্ষেত্রের ক্রিয়াকলাপগুলি একটি ভাগ করা জ্ঞানীয় কোরে একত্রিত হয়েছে। পাইলট প্রকল্পগুলির জন্য প্রতিশ্রুতিশীল প্রার্থীদের নির্বাচন করার জন্য এবং বর্তমান সিস্টেমগুলি ভালভাবে উপযুক্ত হওয়ার সম্ভাবনা নেই এমন অঞ্চলগুলি চিহ্নিত করার জন্য ফলাফল স্কোরগুলি তুলনামূলক স্কোপিং টুল হিসাবে উপস্থাপিত হয়। লেখকরা মানব-মেশিন টাস্ক বরাদ্দকরণকে সমর্থন করার দীর্ঘমেয়াদী লক্ষ্য নিয়ে এআই সিস্টেমের পাশাপাশি প্রোফাইল মানব কর্মীদের দৃষ্টিভঙ্গি প্রসারিত করার বিষয়ে আরও আলোচনা করেছেন।
কেন এটা গুরুত্বপূর্ণ
ফ্রেমওয়ার্ক সংস্থাগুলিকে বিস্তৃত মডেল স্কোর বা অনানুষ্ঠানিক বিচারের উপর নির্ভর করার চেয়ে এআই স্থাপনার সুযোগ দেওয়ার আরও নির্দিষ্ট উপায় দিতে পারে। প্রোফাইলগুলি বাস্তব কর্মক্ষেত্রে কর্মক্ষমতা ভবিষ্যদ্বাণী করে কিনা এবং বিশেষজ্ঞের মূল্যায়ন নির্দিষ্ট ভূমিকার চাহিদাগুলি সঠিকভাবে ক্যাপচার করে কিনা তার উপর এর মান নির্ভর করবে।
ব্যবহারিক অবদান হল একটি এআই মডেলের সামর্থ্যের প্যাটার্ন একটি নির্দিষ্ট দায়িত্বের সাথে মেলে কিনা তা জিজ্ঞাসা করতে সাধারণত সক্ষম কিনা তা জিজ্ঞাসা করা থেকে একটি পরিবর্তন। একটি মডেল কিছু মাত্রার উপর দৃঢ়ভাবে এবং অন্যদের উপর দুর্বলভাবে পারফর্ম করতে পারে, যখন একটি কাজ সেই মাত্রাগুলির উপর খুব আলাদা ওজন রাখতে পারে। কোনও সংস্থা কোনও স্থাপনার প্রতিশ্রুতি দেওয়ার আগে বা কোনও AI সিস্টেমের চারপাশে কোনও ভূমিকা পুনরায় ডিজাইন করার আগে একটি ভাগ করা প্রোফাইল সেই অমিলটি দৃশ্যমান করতে পারে।
সেই পদ্ধতিটি প্রাথমিক পর্যায়ে কর্মক্ষেত্রের পরীক্ষা-নিরীক্ষার গুণমানও উন্নত করতে পারে। একটি মডেলের হেডলাইন বেঞ্চমার্ক পারফরম্যান্সকে প্রমাণ হিসাবে বিবেচনা করার পরিবর্তে যে এটি সম্পূর্ণ পেশার জন্য প্রস্তুত, নিয়োগকর্তারা তত্ত্বাবধানে থাকা পাইলটদের জন্য সংকীর্ণ কাজগুলি সনাক্ত করতে কাঠামোটি ব্যবহার করতে পারে। উত্সটি স্কোরগুলিকে তুলনামূলক এবং স্কোপিংয়ের জন্য উপযুক্ত হিসাবে উপস্থাপন করে; এটি দাবি করে না যে তারা প্রমাণ করে যে একটি AI সিস্টেম নিরাপদে বা কার্যকরভাবে উত্পাদনে নির্বাচিত কাজ সম্পাদন করতে পারে।
কর্মচারী সমীক্ষা সম্ভাব্য গুরুত্বপূর্ণ কারণ এটি একাধিক পেশাগত ডোমেন জুড়ে প্রকৃত কাজের প্রয়োজনীয়তার সাথে মডেল মূল্যায়নকে সংযুক্ত করার চেষ্টা করে। একই সময়ে, বিমূর্ত ব্যাখ্যা করে না যে কীভাবে 410 জন অংশগ্রহণকারীকে নিয়োগ করা হয়েছিল, তারা কীভাবে প্রতিনিধিত্ব করেছিল, কীভাবে কাজগুলি নির্বাচন করা হয়েছিল, বা কর্মীরা তাদের কাজের প্রয়োজনীয় ক্ষমতা সম্পর্কে একে অপরের সাথে একমত হয়েছিল কিনা। এই বিবরণগুলি গুরুত্বপূর্ণ কারণ টাস্ক-ওয়েটিং পছন্দগুলি ফলস্বরূপ উপযুক্ততার অনুমান পরিবর্তন করতে পারে।
মানুষের পাশাপাশি এআই সিস্টেমের প্রোফাইলের কাগজের প্রস্তাবটি একটি বিস্তৃত প্রশাসনিক প্রশ্ন উত্থাপন করে। যদি এই ধরনের প্রোফাইলগুলি দায়িত্ব বরাদ্দ করার জন্য ব্যবহার করা হয়, তাহলে তারা শ্রমের স্পষ্ট বিভাজন সমর্থন করতে পারে, কিন্তু তারা অনিশ্চিত ক্ষমতা অনুমানকে কর্মীদের সম্পর্কে উচ্চ-স্টেকের রায়ে পরিণত করতে পারে। উত্সটি সুরক্ষা, জবাবদিহিতা পদ্ধতি, গোপনীয়তা সুরক্ষা, বা বরাদ্দের প্রতিদ্বন্দ্বিতা করার নিয়ম বর্ণনা করে না। এগুলি প্রিপ্রিন্ট দ্বারা প্রতিষ্ঠিত সিদ্ধান্তের পরিবর্তে অমীমাংসিত সমস্যা।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
কাগজের পরবর্তী পরীক্ষাটি ব্যবহারিক বৈধতা: এর উপযুক্ততা স্কোর লাইভ কর্মক্ষেত্রের পাইলটদের ফলাফলের সাথে সামঞ্জস্যপূর্ণ কিনা। গুরুত্বপূর্ণ অজানাগুলির মধ্যে রয়েছে অধ্যয়ন করা ছয়টি পেশাগত ডোমেন, ব্যবহৃত বেঞ্চমার্ক কাজ, ছয়টি এআই সিস্টেমের পরিচয় এবং কার্যকারিতা এবং কাঠামো কীভাবে পরিবর্তিত কর্মপ্রবাহ, জবাবদিহিতা এবং মানবিক বিচারকে পরিচালনা করে।
সবচেয়ে গুরুত্বপূর্ণ ফলো-আপ হল বাস্তব কর্মক্ষেত্রে ব্যবহারের প্রমাণ। উত্সটি সিন্থেটিক-এজেন্ট যাচাইকরণ, ছয়টি এআই-সিস্টেম প্রোফাইল এবং কর্মীদের কাছ থেকে প্রাপ্ত প্রয়োজনীয়তাগুলি রিপোর্ট করে, তবে এটি একটি সম্ভাব্য পরীক্ষার রিপোর্ট করে না যা দেখায় যে স্কোরগুলি কার্য কার্য সম্পাদন, ত্রুটির হার, উত্পাদনশীলতা বা কর্মীদের ফলাফলের পূর্বাভাস দেয়। স্বাধীন মূল্যায়ন লেখকদের অধ্যয়নের নকশার বাইরে কাঠামোটি কার্যকর কিনা তা প্রতিষ্ঠিত করতে সহায়তা করবে।
পাঠকদের সম্পূর্ণ কাগজে পদ্ধতিগত বিশদটিও সন্ধান করা উচিত: জ্ঞানীয় মাত্রা, বেঞ্চমার্ক নির্মাণ, স্কোরিং পদ্ধতি, মডেল পরিচয়, পেশাগত ডোমেন এবং প্রতিটি অনুমানের চারপাশে অনিশ্চয়তা। সেই তথ্য ছাড়া, এআই সিস্টেম এবং মডেল পরিবারের মধ্যে রিপোর্ট করা পার্থক্যগুলি একা বিমূর্ত থেকে স্বাধীনভাবে মূল্যায়ন করা যায় না।
অবশেষে, কাঠামো পরিবর্তনের মডেল এবং চাকরি পরিবর্তনের জন্য অ্যাকাউন্ট করতে হবে। লেখকরা বলেছেন যে প্রোফাইলগুলি স্বাধীনভাবে আপডেট করা যেতে পারে, যা সেই সমস্যার সাথে সাহায্য করতে পারে, তবে উত্সটি দেখায় না যে কত ঘন ঘন আপডেটের প্রয়োজন হয় বা মডেলের ক্ষমতা, কর্মপ্রবাহ, বা ব্যর্থতার পরিণতি পরিবর্তন হলে সংস্থাগুলি কীভাবে প্রতিক্রিয়া জানায়। প্রস্তাবিত মানব-মেশিন বরাদ্দ সম্প্রসারণ বিশেষভাবে সতর্কতার সাথে মূল্যায়ন করা উচিত যেখানে সিদ্ধান্তগুলি কর্মসংস্থান, নিরাপত্তা, পরিষেবাগুলিতে অ্যাক্সেস বা পেশাগত দায়িত্বকে প্রভাবিত করে।