কি হয়েছে
গবেষকরা PCFBench চালু করেছেন, AI সিস্টেমের জন্য একটি মূল্যায়ন স্যুট যা পণ্য কার্বন পদচিহ্ন অনুমান করে। বেঞ্চমার্কে 614টি বিশেষজ্ঞ-লেবেলযুক্ত আইটেম রয়েছে যার মধ্যে পচন, তথ্য পুনরুদ্ধার, অন্টোলজি ম্যাচিং এবং ছয়টি কাজ জুড়ে সংখ্যাসূচক নিষ্কাশন রয়েছে। চারটি প্রদানকারীর থেকে আটটি ফ্রন্টিয়ার ল্যাঙ্গুয়েজ মডেলের পরীক্ষায়, কাগজটি রিপোর্ট করে যে কোনও মডেল ধারাবাহিকভাবে আধিপত্য বিস্তার করেনি।
উত্সটি পণ্য কার্বন-পদচিহ্নের অনুমানকে একটি ডোমেন-নির্দিষ্ট কর্মপ্রবাহ হিসাবে বর্ণনা করে যেখানে সঠিকতা শুধুমাত্র চূড়ান্ত উত্তরে নয়, মধ্যবর্তী ধাপেও গুরুত্বপূর্ণ। একটি পণ্য কার্বন পদচিহ্ন একটি ভৌত পণ্যের জন্য দায়ী গ্রীনহাউস-গ্যাস নির্গমন বোঝায়। গবেষকরা PCFBench কে একটি ডায়াগনস্টিক বেঞ্চমার্ক হিসাবে উপস্থাপন করেছেন যেটি প্রকাশ করার জন্য ডিজাইন করা হয়েছে যেখানে একটি AI সিস্টেম সেই অনুমানটি তৈরি করার সময় সফল বা ব্যর্থ হয়। চূড়ান্ত রিপোর্ট করা মোটের সাথে তুলনা করার জন্য এই নকশা মধ্যবর্তী ক্রিয়াকলাপগুলিকে দৃশ্যমান রাখে।
PCFBench ওয়ার্কফ্লোকে ছয়টি স্বাধীনভাবে মূল্যায়নযোগ্য কাজে ভাগ করে। বিমূর্তটি পরীক্ষার অধীনে থাকা ক্ষমতাগুলির মধ্যে পচন, পুনরুদ্ধার, অন্টোলজি ম্যাচিং এবং সংখ্যাসূচক নিষ্কাশন সনাক্ত করে। বেঞ্চমার্কে বিশেষজ্ঞদের দ্বারা লেবেল করা 614টি আইটেম রয়েছে এবং যখন তথ্য অসম্পূর্ণ থাকে, যখন প্রাসঙ্গিক তথ্যের দ্বন্দ্ব হয় এবং যখন সংখ্যাগত সীমাবদ্ধতাকে অবশ্যই সম্মান করতে হবে তখন যুক্তি পরীক্ষা করার জন্য ডিজাইন করা হয়েছে।
লেখকরা চারটি প্রদানকারীর থেকে আটটি ফ্রন্টিয়ার বৃহৎ ভাষার মডেলের মূল্যায়ন করেছেন এবং রিপোর্ট করেছেন যে বেঞ্চমার্ক জুড়ে কোনও একক মডেলের আধিপত্য নেই। তারা মোট পণ্য-নিঃসরণ অনুমানের উপর মডেলের কর্মক্ষমতাকে তাদের কর্মক্ষমতার সাথে তুলনা করেছে যখন গণনা ধাপে ধাপে তৈরি করা হয়েছিল। বিমূর্ত অনুসারে, মোট-আনুমানিক সেটিংয়ে 77% পণ্যের জন্য ঘোষিত মোট দুটির একটি ফ্যাক্টরের মধ্যে শক্তিশালী মডেলগুলি এসেছে।
প্রক্রিয়াটি পচে যাওয়ার সময় সেই আপাত কর্মক্ষমতা দুর্বল হয়ে পড়ে। উল্লিখিত হার 37% থেকে 58% এ নেমে এসেছে যখন পণ্যের কার্বন পদচিহ্ন ধাপে ধাপে তৈরি করা হয়েছিল, যেখানে মাত্র 45% থেকে 75% আউটপুট গণ সংরক্ষণকে মেনে চলে। উত্সটি পৃথক মডেলগুলি সনাক্ত করে না, কোন প্রদানকারী কোন ফলাফলটি তৈরি করেছে তা ব্যাখ্যা করে বা বিমূর্তটিতে প্রতিটি ব্যর্থতার বিস্তারিত কারণ প্রদান করে না। গবেষকরা বলছেন যে তারা আরও কাজের জন্য ডেটাসেট এবং মূল্যায়ন জোতা প্রকাশ করছেন।
কেন এটা গুরুত্বপূর্ণ
পণ্য কার্বন-পদচিহ্ন অনুমান পণ্য এবং ডিকার্বনাইজেশন সম্পর্কে সিদ্ধান্তের মধ্যে তুলনা প্রভাবিত করতে পারে। কাগজটি যুক্তি দেয় যে শুধুমাত্র চূড়ান্ত নির্গমনের মোট পরীক্ষা করা অন্তর্নিহিত গণনার অফসেটিং ভুলগুলিকে লুকিয়ে রাখতে পারে। এর ফলাফলগুলি পরামর্শ দেয় যে এআই-উত্পন্ন মূল্যায়নগুলি কম স্বচ্ছ এবং কম নির্ভরযোগ্য হতে পারে যখন সিস্টেমটিকে ধাপে ধাপে অনুমান তৈরি করতে হবে।
কেন্দ্রীয় ব্যবহারিক সমস্যা হল একটি AI-উত্পন্ন কার্বন অনুমান পরিদর্শন করা এবং বিশ্বাস করা যায় কিনা, তার চূড়ান্ত সংখ্যাটি যুক্তিসঙ্গত বলে মনে হচ্ছে কিনা। একটি সিস্টেম ক্লোজ মোটে পৌঁছাতে পারে যখন উপাদানগুলির মধ্যে ত্রুটি তৈরি করে যা একে অপরকে বাতিল করে দেয়। PCFBench আলাদাভাবে কম্পোনেন্টের কাজগুলি মূল্যায়ন করে সেই লুকানো ত্রুটির উত্সগুলিকে দৃশ্যমান করার উদ্দেশ্যে করা হয়েছে৷
পণ্যের তুলনা বা নির্গমন কমানোর উপায় খুঁজছেন এমন সংস্থাগুলির জন্য এটি গুরুত্বপূর্ণ। যদি একটি AI সিস্টেম একটি উপাদান ভুল শনাক্ত করে, একটি অনুপযুক্ত নির্গমন ফ্যাক্টর পুনরুদ্ধার করে, একটি সংখ্যা ভুলভাবে বের করে বা একটি মৌলিক সংখ্যাগত সীমাবদ্ধতা লঙ্ঘন করে, ফলাফল মূল্যায়ন ব্যবহারকারীদের একটি ভুল তুলনা বা একটি অকার্যকর ডিকার্বনাইজেশন অগ্রাধিকারের দিকে নির্দেশ করতে পারে। কাগজ এই ব্যবহারের জন্য একটি প্রয়োজনীয়তা হিসাবে স্বচ্ছতা ফ্রেম.
গণ-সংরক্ষণ ফলাফল কাগজের নিজস্ব পরীক্ষার নকশার মধ্যে বিশেষভাবে গুরুত্বপূর্ণ। মাত্র 45% থেকে 75% ধাপে ধাপে আউটপুটগুলি সেই সীমাবদ্ধতাকে সন্তুষ্ট করেছে, যা নির্দেশ করে যে কিছু সিস্টেম গণনা তৈরি করেছে যার পরিমাণগুলি অভ্যন্তরীণভাবে সামঞ্জস্যপূর্ণ ছিল না। উত্সটি বলে না যে প্রতিটি লঙ্ঘন একটি ক্রয় বা নীতিগত সিদ্ধান্ত পরিবর্তন করবে, তবে এটি দেখায় যে কেন একটি আপাতদৃষ্টিতে যুক্তিসঙ্গত চূড়ান্ত মোট যাচাইয়ের প্রয়োজন হতে পারে।
ফলাফলগুলি সহজ মডেল র্যাঙ্কিংকেও জটিল করে তোলে। যেহেতু আটটি সিস্টেম এবং ছয়টি কাজ জুড়ে কোনও মডেলের আধিপত্য নেই, তাই কার্বন-পদচিহ্নের কাজের জন্য একটি এআই সিস্টেম বেছে নেওয়ার জন্য একটি একক সামগ্রিক স্কোরের উপর নির্ভর না করে নির্দিষ্ট ক্ষমতা পরীক্ষা করার প্রয়োজন হতে পারে। উৎসটি বেঞ্চমার্ক ফলাফল স্থাপন করে, নিয়োজিত কার্বন-অ্যাকাউন্টিং সিস্টেমে ক্ষতির প্রমাণ নয়। এটি স্বাধীন প্রতিলিপি, ক্ষেত্রের বৈধতা বা মানব বিশ্লেষকদের সাথে তুলনা রিপোর্ট করে না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
A route planner searches possible journeys using explicit rules. What does this illustrate about AI?
পরবর্তী কি দেখতে
প্রকাশিত ডেটাসেট এবং মূল্যায়ন জোতা গবেষক এবং অনুশীলনকারীদের এআই-সহায়তা কার্বন অ্যাকাউন্টিংয়ে লক্ষ্যযুক্ত উন্নতি পরীক্ষা করার অনুমতি দিতে পারে। গুরুত্বপূর্ণ অজানা থেকে যায়: উৎসটি প্রতিষ্ঠিত করে না যে বেঞ্চমার্ক কীভাবে প্রতিটি বাস্তব-বিশ্বের পণ্য বিভাগকে প্রতিফলিত করে, পরীক্ষিত সিস্টেমগুলি কাজের জন্য অপ্টিমাইজ করা হয়েছিল কিনা, বা আরও ভাল বেঞ্চমার্ক স্কোরগুলি নির্ভরযোগ্য অপারেশনাল সিদ্ধান্তে অনুবাদ করবে কিনা।
প্রকাশিত বেঞ্চমার্ক এবং মূল্যায়ন জোতা হল কাগজের সবচেয়ে কংক্রিট পরবর্তী ধাপ। পিসিএফবেঞ্চ দ্বারা চিহ্নিত বিশেষ দুর্বলতাগুলি পুনরুদ্ধার, পচন, সংখ্যাগত যুক্তি বা অন্টোলজি ম্যাচিংয়ে উন্নতি হয়েছে কিনা তা পরীক্ষা করার জন্য গবেষকরা তাদের ব্যবহার করতে পারেন। একটি দরকারী ফলো-আপ দেখাবে যে পৃথক কাজগুলিতে লাভগুলি নতুন অসঙ্গতিগুলি প্রবর্তন না করে সম্পূর্ণ পণ্য-পদচিহ্নের গণনার উন্নতি করে কিনা।
ভবিষ্যত মূল্যায়নগুলিকে স্পষ্ট করা উচিত যে 614টি বিশেষজ্ঞ-লেবেলযুক্ত আইটেমগুলি অনুশীলনে সম্মুখীন হওয়া পণ্য, উপকরণ, সরবরাহ চেইন এবং রিপোর্টিং কনভেনশনগুলির কতটা প্রতিনিধিত্বশীল। উত্সটি বিমূর্তভাবে বেঞ্চমার্কের সম্পূর্ণ পণ্য কভারেজ বর্ণনা করে না, তাই এর ফলাফলগুলিকে স্বয়ংক্রিয়ভাবে সমস্ত AI-সহায়তা কার্বন অ্যাকাউন্টিংয়ের পরিমাপ হিসাবে বিবেচনা করা উচিত নয়।
ঘোষিত মোট এবং অন্তর্নিহিত সত্যের মধ্যে সম্পর্কটিও মনোযোগের দাবি রাখে। বিমূর্তটি একটি তুলনা বিন্দু হিসাবে ঘোষিত পণ্যের মোট সংখ্যা ব্যবহার করে, তবে এটি ব্যাখ্যা করে না যে এই ঘোষণাগুলি কীভাবে উত্পাদিত হয়েছিল, কীভাবে তাদের মধ্যে অনিশ্চয়তা পরিচালনা করা হয়েছিল, বা বিকল্প বৈধ অ্যাকাউন্টিং পছন্দগুলি সম্ভব ছিল কিনা। এই বিবরণগুলি কীভাবে রিপোর্ট করা ফ্যাক্টর-অফ-টু এবং ধাপে ধাপে হারগুলিকে ব্যাখ্যা করা উচিত তা প্রভাবিত করতে পারে।
পণ্য-কার্বন বিশ্লেষণের জন্য AI বিবেচনাকারী অনুশীলনকারীদের প্রমাণের জন্য পর্যবেক্ষণ করা উচিত যে সিস্টেমগুলি মধ্যবর্তী গণনা সংরক্ষণ করে, অনুপস্থিত বা বিরোধপূর্ণ ইনপুটগুলি সনাক্ত করে এবং সংখ্যাসূচক মানের উত্সগুলি প্রকাশ করে। বর্তমান উত্সটি প্রকাশিত গবেষণা সামগ্রীর বাইরে কোনও প্রাপ্যতা, স্থাপনা বা কার্যকারিতা তথ্য সরবরাহ করে না এবং এটি প্রতিষ্ঠিত করে না যে কোনও পরীক্ষিত মডেল পণ্য বা ডিকার্বনাইজেশন সম্পর্কে অত্যাধিক সিদ্ধান্ত নেওয়ার জন্য প্রস্তুত।