কি হয়েছে
গবেষকরা ChemDIRT প্রবর্তন করেছেন, একটি বেঞ্চমার্ক যা পরীক্ষা করার জন্য ডিজাইন করা হয়েছে যে বৃহৎ ভাষার মডেলগুলি রসায়ন সম্পর্কে ধারাবাহিকভাবে যুক্তি দিতে পারে যখন কোনও সমস্যার শব্দ বা রাসায়নিক তথ্য উপস্থাপনের উপায় পরিবর্তন হয়। কাগজটি বলে যে এটি আটটি রসায়ন টাস্ক বিভাগে বিস্তৃত নির্দেশাবলী এবং আণবিক উপস্থাপনার নিয়ন্ত্রিত বৈচিত্র জুড়ে নির্ভুলতা এবং ধারাবাহিকতা মূল্যায়ন করে। এর লেখকরা ওপেন- এবং ক্লোজ-সোর্স মডেলের বিভিন্ন সেটের মধ্যে উল্লেখযোগ্য প্রম্পট সংবেদনশীলতা, প্রতিনিধিত্ব নির্ভরতা এবং টাস্ক পরিবার জুড়ে অসম কার্যকারিতার রিপোর্ট করেছেন।
ChemDIRT এর অর্থ হল বৈচিত্র্যপূর্ণ নির্দেশনা, প্রতিনিধিত্ব এবং টাস্ক বেঞ্চমার্ক। লেখকরা এটিকে রসায়ন-ভিত্তিক বৃহৎ ভাষার মডেলগুলির জন্য একটি মূল্যায়ন কাঠামো হিসাবে উপস্থাপন করেছেন, যার বৈজ্ঞানিক সেটিংসে ব্যবহার প্রসারিত হয়েছে। উৎসটি সমস্যাটিকে বিদ্যমান রসায়ন বেঞ্চমার্কের সীমাবদ্ধতা হিসাবে ফ্রেম করে: অনেকে একটি সংকীর্ণ কাজ মূল্যায়ন করে এবং সমস্যা গঠন বা রাসায়নিক উপস্থাপনের সীমিত রূপ ব্যবহার করে। লেখকদের দৃষ্টিতে, এটি একটি মডেলের ধারাবাহিকভাবে যুক্তি করার ক্ষমতার একটি অসম্পূর্ণ চিত্র প্রদান করতে পারে।
বেঞ্চমার্ক দুটি ইনপুট পরিবর্তিত হয় যা বস্তুগতভাবে একটি ভাষা মডেলের প্রতিক্রিয়াকে প্রভাবিত করতে পারে: একটি সমস্যা তৈরি করতে ব্যবহৃত নির্দেশ এবং রাসায়নিক তথ্য প্রকাশ করতে ব্যবহৃত উপস্থাপনা। বিমূর্ত সঠিক শব্দ পরিবর্তন বা অন্তর্ভুক্ত উপস্থাপনা নির্দিষ্ট করে না. এটি বলে যে ChemDIRT একটি নির্দিষ্ট বিন্যাস থেকে শুধুমাত্র একটি একক স্কোরের উপর নির্ভর না করে নিয়ন্ত্রিত বিভ্রান্তির অধীনে কর্মক্ষমতা এবং ধারাবাহিকতা উভয়ই পরিমাপ করে।
গবেষণাপত্রটি বলেছে যে মূল্যায়নটি রসায়নের কাজগুলির আটটি বিভাগকে বিস্তৃত করে এবং এতে খোলা- এবং ক্লোজড-সোর্স এলএলএম-এর বিভিন্ন সেট অন্তর্ভুক্ত রয়েছে। সরবরাহ করা উত্সটি টাস্ক পরিবার বা মডেলগুলির নাম দেয় না এবং এটি কোনও ডেটাসেট গণনা, নির্ভুলতা পরিসংখ্যান, ধারাবাহিকতা স্কোর বা বেসলাইন ফলাফল দেয় না। তাই এটি দাবিকে সমর্থন করে যে গবেষকরা একটি বিস্তৃত, বৈচিত্র্যপূর্ণ মূল্যায়ন করেছেন, কিন্তু পৃথক সিস্টেমের বিশদ তুলনা নয়।
উল্লিখিত ফলাফল উপলব্ধ উৎসে সংখ্যাসূচকের পরিবর্তে দিকনির্দেশক। লেখকরা বলেছেন যে তারা প্রম্পটের প্রতি যথেষ্ট সংবেদনশীলতা, আণবিক প্রতিনিধিত্বের উপর নির্ভরতা এবং টাস্ক পরিবার জুড়ে অসম কর্মক্ষমতা খুঁজে পেয়েছেন। ব্যবহারিক পরিভাষায়, বিমূর্ত যুক্তি দেয় যে একটি রসায়ন বেঞ্চমার্ক বিন্যাসে একটি মডেলের ফলাফলকে স্বয়ংক্রিয়ভাবে অন্যান্য বিন্যাস জুড়ে স্থিতিশীল রাসায়নিক যুক্তির প্রমাণ হিসাবে গণ্য করা উচিত নয়। উত্সটি প্রতিষ্ঠিত করে না কেন নির্দিষ্ট মডেলগুলি সংবেদনশীল ছিল বা কোনও সিস্টেম ধারাবাহিকভাবে অন্যদের তুলনায় পারফর্ম করেছে কিনা।
কেন এটা গুরুত্বপূর্ণ
একটি স্থির বিন্যাস ব্যবহার করে রসায়নের বেঞ্চমার্কগুলি একটি মডেলকে ব্যবহারিক ব্যবহারের চেয়ে আরও বেশি সক্ষম দেখাতে পারে। ChemDIRT-এর কেন্দ্রীয় অবদান, উত্স অনুসারে, একটি একক প্রমিত পরীক্ষার বাইরে একটি রসায়ন ব্যবস্থার সম্মুখীন হতে পারে এমন তারতম্যের অধীনে দৃঢ়তা পরিমাপ করা। রসায়ন এলএলএম স্থিতিশীল ফলাফল দেয় বা শব্দ এবং ইনপুট বিন্যাসের উপর অত্যধিক নির্ভরশীল কিনা তা বিচার করার জন্য গবেষকদের এবং ব্যবহারকারীদের একটি ভাল ভিত্তি দিতে পারে।
প্রধান তাত্পর্য হল পদ্ধতিগত। একটি রসায়ন এলএলএম সঠিকভাবে উত্তর দিতে পারে যখন একটি সমস্যা একটি পরিচিত আকারে উপস্থাপিত হয় যখন শব্দের পরিবর্তন বা অণুটি কীভাবে এনকোড করা হয় তার পরিবর্তনের পরে একটি ভিন্ন বা ভুল উত্তর তৈরি করে। যদি সেই আচরণটি পরিমাপ করা না হয়, একটি মানদণ্ড হস্তান্তরযোগ্য রাসায়নিক যুক্তির মতো ফর্ম্যাট পরিচিতিকে পুরস্কৃত করতে পারে। ChemDIRT-এর নকশা নির্ভুলতার পাশাপাশি ধারাবাহিকতাকে মূল্যায়নের বস্তু হিসেবে বিবেচনা করে সেই ফাঁকটিকে সরাসরি লক্ষ্য করে।
গবেষকদের সিস্টেমের তুলনা করার জন্য এটি গুরুত্বপূর্ণ। একটি একক বেঞ্চমার্ক স্কোর অসম ক্ষমতা লুকিয়ে রাখতে পারে: একটি মডেল কিছু রসায়নের কাজে ভালো করতে পারে এবং অন্যদের ক্ষেত্রে খারাপভাবে করতে পারে, অথবা শুধুমাত্র নির্দিষ্ট উপস্থাপনার জন্য দৃঢ়ভাবে পারফর্ম করতে পারে। টাস্ক ফ্যামিলি জুড়ে অসম পারফরম্যান্সের উত্সের প্রতিবেদনটি পরামর্শ দেয় যে সামগ্রিক স্কোরগুলি যত্ন সহকারে ব্যাখ্যা করা উচিত। একটি বৈচিত্রপূর্ণ পরীক্ষা মডেল ডেভেলপারদের সনাক্ত করতে সাহায্য করতে পারে যেখানে অতিরিক্ত প্রশিক্ষণ, উপস্থাপনা পরিচালনা বা সুরক্ষার প্রয়োজন, যদিও বিমূর্তটি দেখায় না যে কোন হস্তক্ষেপগুলি পর্যবেক্ষণ করা দুর্বলতাগুলিকে সমাধান করবে।
এআই-সহায়তা বৈজ্ঞানিক কাজ বিবেচনা করা লোকেদের জন্যও বিষয়টি গুরুত্বপূর্ণ। রসায়ন মডেলগুলি তথ্য সংগঠিত করতে, প্রযুক্তিগত প্রশ্নের উত্তর দিতে বা গবেষণার সিদ্ধান্তগুলিকে সমর্থন করতে ব্যবহার করা যেতে পারে, তবে উত্সটি দেখায় না যে ChemDIRT কর্মক্ষমতা পরীক্ষাগার বা উত্পাদন পরিবেশে সাফল্যের পূর্বাভাস দেয়। বেঞ্চমার্ক বিভ্রান্তির দৃঢ়তা মূল্যায়নের গুণমান সম্পর্কে দরকারী প্রমাণ; এটি নিজেই প্রমাণ নয় যে একটি মডেল অতত্ত্বাবধানহীন বৈজ্ঞানিক সিদ্ধান্তের জন্য নিরাপদ।
বিস্তৃত AI ক্ষেত্রের জন্য, কাগজটি ব্যাখ্যা করে যে কেন ডোমেন-নির্দিষ্ট মূল্যায়ন সাধারণ ভাষা-মডেল স্কোরে হ্রাস করা যায় না। রসায়নে বিশেষ উপস্থাপনা এবং কাজের ধরন রয়েছে যা সাধারণ প্রশ্ন-উত্তর পরীক্ষা দ্বারা লুকানো ব্যর্থতার মোডগুলিকে প্রকাশ করতে পারে। উত্সটি সংকীর্ণ উপসংহারটিকে সমর্থন করে যে ChemDIRT রসায়ন-LLM আচরণ পরীক্ষা করার জন্য আরও বৈচিত্র্যপূর্ণ উপায় সরবরাহ করে। এটি প্রতিষ্ঠিত করে না যে বেঞ্চমার্কটি নির্দিষ্ট বা এর ফলাফলগুলি প্রতিটি বৈজ্ঞানিক ডোমেনে প্রযোজ্য।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
Which component of an AI application is the machine-learning model itself?
পরবর্তী কি দেখতে
কাগজটি একটি arXiv প্রিপ্রিন্ট, এবং সরবরাহকৃত উৎসে শুধুমাত্র এর বিমূর্ততা রয়েছে। এটি মূল্যায়ন করা মডেল, টাস্ক বিভাগ, আণবিক উপস্থাপনা, ডেটাসেটের আকার, সংখ্যাসূচক ফলাফল বা তুলনা পদ্ধতি সনাক্ত করে না। ফলাফলের শক্তি এবং সাধারণতা মূল্যায়ন করার জন্য এই বিবরণগুলি প্রয়োজন। ফলো-আপ স্ক্রুটিনির পরীক্ষা করা উচিত যে ChemDIRT পুনরুত্পাদনযোগ্য কিনা, এর বিভ্রান্তিগুলি প্রকৃত রসায়নের কার্যপ্রবাহকে প্রতিফলিত করে কিনা এবং যে মডেলগুলি বেঞ্চমার্কে ধারাবাহিকভাবে সম্পাদন করে তাও পরীক্ষাগার, ক্লিনিকাল বা শিল্প কার্যগুলিতে নির্ভরযোগ্যভাবে সম্পাদন করে কিনা।
প্রথম অজানা হল বেঞ্চমার্কের রচনা। সরবরাহ করা arXiv পৃষ্ঠাটি শিরোনাম এবং বিমূর্ত দেয় কিন্তু কাগজের সম্পূর্ণ পদ্ধতি নয়, তাই পাঠকরা নির্ধারণ করতে পারে না কোন আটটি রসায়ন টাস্ক বিভাগ ব্যবহার করা হয়েছিল, কীভাবে আণবিক উপস্থাপনাগুলি নির্বাচন করা হয়েছিল, বা কীভাবে নির্দেশের বৈচিত্রগুলি তৈরি করা হয়েছিল। এই পছন্দগুলি পরীক্ষাটি বাস্তবসম্মত দৃঢ়তা বা প্রধানত কৃত্রিম বিন্যাস পরিবর্তনের সংবেদনশীলতা পরিমাপ করে কিনা তা প্রভাবিত করবে।
দ্বিতীয় অজানা মূল্যায়নের স্কেল এবং তুলনাযোগ্যতা। উত্সটি বলে যে লেখকরা ওপেন- এবং ক্লোজ-সোর্স মডেলগুলি বেঞ্চমার্ক করেছেন, তবে এটি তাদের সনাক্ত করে না বা কতগুলি সিস্টেম পরীক্ষা করা হয়েছিল তা জানায় না। এটি কোন সংখ্যাসূচক প্রভাব আকার, অনিশ্চয়তা অনুমান বা পরিসংখ্যানগত পরীক্ষা প্রদান করে না। এই বিশদ বিবরণগুলি ছাড়া, মডেল-টু-মডেল পার্থক্য, কাজের অসুবিধা বা সম্ভাব্য ডেটা দূষণের বিরুদ্ধে "পর্যাপ্ত" প্রম্পট সংবেদনশীলতা এবং প্রতিনিধিত্ব নির্ভরতা স্বাধীনভাবে ওজন করা যায় না।
তৃতীয় প্রশ্ন বাহ্যিক বৈধতা. ChemDIRT-এর নিয়ন্ত্রিত বৈচিত্র জুড়ে সামঞ্জস্যপূর্ণ একটি মডেল এখনও বেঞ্চমার্ক দ্বারা প্রতিনিধিত্ব না করা সেটিংসে রাসায়নিকভাবে ভুল বা অনিরাপদ সুপারিশ করতে পারে। ভবিষ্যত কাজের পরীক্ষা করা উচিত যে বেঞ্চমার্কের স্কোরগুলি বিশেষজ্ঞের রায়, পরীক্ষামূলকভাবে যাচাইকৃত ফলাফল বা বাস্তব রসায়ন কর্মপ্রবাহের কর্মক্ষমতার সাথে সম্পর্কযুক্ত কিনা। স্বাধীন প্রতিলিপি মডেল সংস্করণ এবং ডেটাসেট জুড়ে রিপোর্ট করা নিদর্শনগুলি বজায় থাকে কিনা তা নির্ধারণ করতেও সাহায্য করবে।
পরিশেষে, ChemDIRT একটি ভাগ করা মূল্যায়ন সংস্থান হয়ে ওঠে বা একটি এক-কাগজের প্রস্তাব থেকে যায় কিনা তা দেখুন। বেঞ্চমার্ক ডেটা, কোড বা মূল্যায়ন জোতা সর্বজনীনভাবে উপলব্ধ কিনা তা উৎসটি উল্লেখ করে না। এই বাদ দেওয়া অবিলম্বে যাচাইকরণ এবং ব্যবহারিক গ্রহণ সীমিত. যতক্ষণ না সম্পূর্ণ কাগজ এবং সমর্থনকারী উপকরণগুলি পরীক্ষা করা হয়, ততক্ষণ পর্যন্ত সবচেয়ে সংরক্ষিত উপসংহার হল ChemDIRT একটি অর্থপূর্ণ মূল্যায়ন সমস্যা চিহ্নিত করে এবং অস্থিরতার প্রমাণ রিপোর্ট করে, যখন সেই অস্থিরতার মাত্রা এবং বাস্তব-বিশ্বের পরিণতিগুলি প্রতিষ্ঠিত করা বাকি থাকে।