সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

ChemDIRT বেঞ্চমার্ক প্রম্পট এবং আণবিক উপস্থাপনা সহ রসায়ন LLM কর্মক্ষমতা পরিবর্তন খুঁজে পায়

একটি নতুন arXiv বেঞ্চমার্ক বিভিন্ন নির্দেশাবলী, আণবিক উপস্থাপনা এবং আটটি টাস্ক বিভাগ জুড়ে রসায়ন-কেন্দ্রিক বৃহৎ ভাষার মডেলগুলিকে মূল্যায়ন করে, যথেষ্ট প্রম্পট সংবেদনশীলতা, প্রতিনিধিত্ব নির্ভরতা এবং অসম কর্মক্ষমতা রিপোর্ট করে।

5 min readRead the primary source
Source-page capture accompanying ChemDIRT benchmark finds chemistry LLM performance changes with prompts and molecular representations
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.21504
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
বেঞ্চমার্ক
মডেলের কর্মক্ষমতা পরিমাপ এবং তুলনা করার জন্য ব্যবহৃত একটি প্রমিত পরীক্ষা বা ডেটাসেট।
দৃঢ়তা
শব্দ, পরিবর্তন, বা প্রতিকূল ইনপুটগুলির অধীনে কার্যক্ষমতা বজায় রাখার জন্য একটি মডেলের ক্ষমতা।
নিজেকে পরীক্ষা করুনএআই মডেল ব্যাখ্যা করা কুইজ

কি হয়েছে

গবেষকরা ChemDIRT প্রবর্তন করেছেন, একটি বেঞ্চমার্ক যা পরীক্ষা করার জন্য ডিজাইন করা হয়েছে যে বৃহৎ ভাষার মডেলগুলি রসায়ন সম্পর্কে ধারাবাহিকভাবে যুক্তি দিতে পারে যখন কোনও সমস্যার শব্দ বা রাসায়নিক তথ্য উপস্থাপনের উপায় পরিবর্তন হয়। কাগজটি বলে যে এটি আটটি রসায়ন টাস্ক বিভাগে বিস্তৃত নির্দেশাবলী এবং আণবিক উপস্থাপনার নিয়ন্ত্রিত বৈচিত্র জুড়ে নির্ভুলতা এবং ধারাবাহিকতা মূল্যায়ন করে। এর লেখকরা ওপেন- এবং ক্লোজ-সোর্স মডেলের বিভিন্ন সেটের মধ্যে উল্লেখযোগ্য প্রম্পট সংবেদনশীলতা, প্রতিনিধিত্ব নির্ভরতা এবং টাস্ক পরিবার জুড়ে অসম কার্যকারিতার রিপোর্ট করেছেন।

ChemDIRT এর অর্থ হল বৈচিত্র্যপূর্ণ নির্দেশনা, প্রতিনিধিত্ব এবং টাস্ক বেঞ্চমার্ক। লেখকরা এটিকে রসায়ন-ভিত্তিক বৃহৎ ভাষার মডেলগুলির জন্য একটি মূল্যায়ন কাঠামো হিসাবে উপস্থাপন করেছেন, যার বৈজ্ঞানিক সেটিংসে ব্যবহার প্রসারিত হয়েছে। উৎসটি সমস্যাটিকে বিদ্যমান রসায়ন বেঞ্চমার্কের সীমাবদ্ধতা হিসাবে ফ্রেম করে: অনেকে একটি সংকীর্ণ কাজ মূল্যায়ন করে এবং সমস্যা গঠন বা রাসায়নিক উপস্থাপনের সীমিত রূপ ব্যবহার করে। লেখকদের দৃষ্টিতে, এটি একটি মডেলের ধারাবাহিকভাবে যুক্তি করার ক্ষমতার একটি অসম্পূর্ণ চিত্র প্রদান করতে পারে।

বেঞ্চমার্ক দুটি ইনপুট পরিবর্তিত হয় যা বস্তুগতভাবে একটি ভাষা মডেলের প্রতিক্রিয়াকে প্রভাবিত করতে পারে: একটি সমস্যা তৈরি করতে ব্যবহৃত নির্দেশ এবং রাসায়নিক তথ্য প্রকাশ করতে ব্যবহৃত উপস্থাপনা। বিমূর্ত সঠিক শব্দ পরিবর্তন বা অন্তর্ভুক্ত উপস্থাপনা নির্দিষ্ট করে না. এটি বলে যে ChemDIRT একটি নির্দিষ্ট বিন্যাস থেকে শুধুমাত্র একটি একক স্কোরের উপর নির্ভর না করে নিয়ন্ত্রিত বিভ্রান্তির অধীনে কর্মক্ষমতা এবং ধারাবাহিকতা উভয়ই পরিমাপ করে।

গবেষণাপত্রটি বলেছে যে মূল্যায়নটি রসায়নের কাজগুলির আটটি বিভাগকে বিস্তৃত করে এবং এতে খোলা- এবং ক্লোজড-সোর্স এলএলএম-এর বিভিন্ন সেট অন্তর্ভুক্ত রয়েছে। সরবরাহ করা উত্সটি টাস্ক পরিবার বা মডেলগুলির নাম দেয় না এবং এটি কোনও ডেটাসেট গণনা, নির্ভুলতা পরিসংখ্যান, ধারাবাহিকতা স্কোর বা বেসলাইন ফলাফল দেয় না। তাই এটি দাবিকে সমর্থন করে যে গবেষকরা একটি বিস্তৃত, বৈচিত্র্যপূর্ণ মূল্যায়ন করেছেন, কিন্তু পৃথক সিস্টেমের বিশদ তুলনা নয়।

উল্লিখিত ফলাফল উপলব্ধ উৎসে সংখ্যাসূচকের পরিবর্তে দিকনির্দেশক। লেখকরা বলেছেন যে তারা প্রম্পটের প্রতি যথেষ্ট সংবেদনশীলতা, আণবিক প্রতিনিধিত্বের উপর নির্ভরতা এবং টাস্ক পরিবার জুড়ে অসম কর্মক্ষমতা খুঁজে পেয়েছেন। ব্যবহারিক পরিভাষায়, বিমূর্ত যুক্তি দেয় যে একটি রসায়ন বেঞ্চমার্ক বিন্যাসে একটি মডেলের ফলাফলকে স্বয়ংক্রিয়ভাবে অন্যান্য বিন্যাস জুড়ে স্থিতিশীল রাসায়নিক যুক্তির প্রমাণ হিসাবে গণ্য করা উচিত নয়। উত্সটি প্রতিষ্ঠিত করে না কেন নির্দিষ্ট মডেলগুলি সংবেদনশীল ছিল বা কোনও সিস্টেম ধারাবাহিকভাবে অন্যদের তুলনায় পারফর্ম করেছে কিনা।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

একটি স্থির বিন্যাস ব্যবহার করে রসায়নের বেঞ্চমার্কগুলি একটি মডেলকে ব্যবহারিক ব্যবহারের চেয়ে আরও বেশি সক্ষম দেখাতে পারে। ChemDIRT-এর কেন্দ্রীয় অবদান, উত্স অনুসারে, একটি একক প্রমিত পরীক্ষার বাইরে একটি রসায়ন ব্যবস্থার সম্মুখীন হতে পারে এমন তারতম্যের অধীনে দৃঢ়তা পরিমাপ করা। রসায়ন এলএলএম স্থিতিশীল ফলাফল দেয় বা শব্দ এবং ইনপুট বিন্যাসের উপর অত্যধিক নির্ভরশীল কিনা তা বিচার করার জন্য গবেষকদের এবং ব্যবহারকারীদের একটি ভাল ভিত্তি দিতে পারে।

প্রধান তাত্পর্য হল পদ্ধতিগত। একটি রসায়ন এলএলএম সঠিকভাবে উত্তর দিতে পারে যখন একটি সমস্যা একটি পরিচিত আকারে উপস্থাপিত হয় যখন শব্দের পরিবর্তন বা অণুটি কীভাবে এনকোড করা হয় তার পরিবর্তনের পরে একটি ভিন্ন বা ভুল উত্তর তৈরি করে। যদি সেই আচরণটি পরিমাপ করা না হয়, একটি মানদণ্ড হস্তান্তরযোগ্য রাসায়নিক যুক্তির মতো ফর্ম্যাট পরিচিতিকে পুরস্কৃত করতে পারে। ChemDIRT-এর নকশা নির্ভুলতার পাশাপাশি ধারাবাহিকতাকে মূল্যায়নের বস্তু হিসেবে বিবেচনা করে সেই ফাঁকটিকে সরাসরি লক্ষ্য করে।

গবেষকদের সিস্টেমের তুলনা করার জন্য এটি গুরুত্বপূর্ণ। একটি একক বেঞ্চমার্ক স্কোর অসম ক্ষমতা লুকিয়ে রাখতে পারে: একটি মডেল কিছু রসায়নের কাজে ভালো করতে পারে এবং অন্যদের ক্ষেত্রে খারাপভাবে করতে পারে, অথবা শুধুমাত্র নির্দিষ্ট উপস্থাপনার জন্য দৃঢ়ভাবে পারফর্ম করতে পারে। টাস্ক ফ্যামিলি জুড়ে অসম পারফরম্যান্সের উত্সের প্রতিবেদনটি পরামর্শ দেয় যে সামগ্রিক স্কোরগুলি যত্ন সহকারে ব্যাখ্যা করা উচিত। একটি বৈচিত্রপূর্ণ পরীক্ষা মডেল ডেভেলপারদের সনাক্ত করতে সাহায্য করতে পারে যেখানে অতিরিক্ত প্রশিক্ষণ, উপস্থাপনা পরিচালনা বা সুরক্ষার প্রয়োজন, যদিও বিমূর্তটি দেখায় না যে কোন হস্তক্ষেপগুলি পর্যবেক্ষণ করা দুর্বলতাগুলিকে সমাধান করবে।

এআই-সহায়তা বৈজ্ঞানিক কাজ বিবেচনা করা লোকেদের জন্যও বিষয়টি গুরুত্বপূর্ণ। রসায়ন মডেলগুলি তথ্য সংগঠিত করতে, প্রযুক্তিগত প্রশ্নের উত্তর দিতে বা গবেষণার সিদ্ধান্তগুলিকে সমর্থন করতে ব্যবহার করা যেতে পারে, তবে উত্সটি দেখায় না যে ChemDIRT কর্মক্ষমতা পরীক্ষাগার বা উত্পাদন পরিবেশে সাফল্যের পূর্বাভাস দেয়। বেঞ্চমার্ক বিভ্রান্তির দৃঢ়তা মূল্যায়নের গুণমান সম্পর্কে দরকারী প্রমাণ; এটি নিজেই প্রমাণ নয় যে একটি মডেল অতত্ত্বাবধানহীন বৈজ্ঞানিক সিদ্ধান্তের জন্য নিরাপদ।

বিস্তৃত AI ক্ষেত্রের জন্য, কাগজটি ব্যাখ্যা করে যে কেন ডোমেন-নির্দিষ্ট মূল্যায়ন সাধারণ ভাষা-মডেল স্কোরে হ্রাস করা যায় না। রসায়নে বিশেষ উপস্থাপনা এবং কাজের ধরন রয়েছে যা সাধারণ প্রশ্ন-উত্তর পরীক্ষা দ্বারা লুকানো ব্যর্থতার মোডগুলিকে প্রকাশ করতে পারে। উত্সটি সংকীর্ণ উপসংহারটিকে সমর্থন করে যে ChemDIRT রসায়ন-LLM আচরণ পরীক্ষা করার জন্য আরও বৈচিত্র্যপূর্ণ উপায় সরবরাহ করে। এটি প্রতিষ্ঠিত করে না যে বেঞ্চমার্কটি নির্দিষ্ট বা এর ফলাফলগুলি প্রতিটি বৈজ্ঞানিক ডোমেনে প্রযোজ্য।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

পরবর্তী কি দেখতে

কাগজটি একটি arXiv প্রিপ্রিন্ট, এবং সরবরাহকৃত উৎসে শুধুমাত্র এর বিমূর্ততা রয়েছে। এটি মূল্যায়ন করা মডেল, টাস্ক বিভাগ, আণবিক উপস্থাপনা, ডেটাসেটের আকার, সংখ্যাসূচক ফলাফল বা তুলনা পদ্ধতি সনাক্ত করে না। ফলাফলের শক্তি এবং সাধারণতা মূল্যায়ন করার জন্য এই বিবরণগুলি প্রয়োজন। ফলো-আপ স্ক্রুটিনির পরীক্ষা করা উচিত যে ChemDIRT পুনরুত্পাদনযোগ্য কিনা, এর বিভ্রান্তিগুলি প্রকৃত রসায়নের কার্যপ্রবাহকে প্রতিফলিত করে কিনা এবং যে মডেলগুলি বেঞ্চমার্কে ধারাবাহিকভাবে সম্পাদন করে তাও পরীক্ষাগার, ক্লিনিকাল বা শিল্প কার্যগুলিতে নির্ভরযোগ্যভাবে সম্পাদন করে কিনা।

প্রথম অজানা হল বেঞ্চমার্কের রচনা। সরবরাহ করা arXiv পৃষ্ঠাটি শিরোনাম এবং বিমূর্ত দেয় কিন্তু কাগজের সম্পূর্ণ পদ্ধতি নয়, তাই পাঠকরা নির্ধারণ করতে পারে না কোন আটটি রসায়ন টাস্ক বিভাগ ব্যবহার করা হয়েছিল, কীভাবে আণবিক উপস্থাপনাগুলি নির্বাচন করা হয়েছিল, বা কীভাবে নির্দেশের বৈচিত্রগুলি তৈরি করা হয়েছিল। এই পছন্দগুলি পরীক্ষাটি বাস্তবসম্মত দৃঢ়তা বা প্রধানত কৃত্রিম বিন্যাস পরিবর্তনের সংবেদনশীলতা পরিমাপ করে কিনা তা প্রভাবিত করবে।

দ্বিতীয় অজানা মূল্যায়নের স্কেল এবং তুলনাযোগ্যতা। উত্সটি বলে যে লেখকরা ওপেন- এবং ক্লোজ-সোর্স মডেলগুলি বেঞ্চমার্ক করেছেন, তবে এটি তাদের সনাক্ত করে না বা কতগুলি সিস্টেম পরীক্ষা করা হয়েছিল তা জানায় না। এটি কোন সংখ্যাসূচক প্রভাব আকার, অনিশ্চয়তা অনুমান বা পরিসংখ্যানগত পরীক্ষা প্রদান করে না। এই বিশদ বিবরণগুলি ছাড়া, মডেল-টু-মডেল পার্থক্য, কাজের অসুবিধা বা সম্ভাব্য ডেটা দূষণের বিরুদ্ধে "পর্যাপ্ত" প্রম্পট সংবেদনশীলতা এবং প্রতিনিধিত্ব নির্ভরতা স্বাধীনভাবে ওজন করা যায় না।

তৃতীয় প্রশ্ন বাহ্যিক বৈধতা. ChemDIRT-এর নিয়ন্ত্রিত বৈচিত্র জুড়ে সামঞ্জস্যপূর্ণ একটি মডেল এখনও বেঞ্চমার্ক দ্বারা প্রতিনিধিত্ব না করা সেটিংসে রাসায়নিকভাবে ভুল বা অনিরাপদ সুপারিশ করতে পারে। ভবিষ্যত কাজের পরীক্ষা করা উচিত যে বেঞ্চমার্কের স্কোরগুলি বিশেষজ্ঞের রায়, পরীক্ষামূলকভাবে যাচাইকৃত ফলাফল বা বাস্তব রসায়ন কর্মপ্রবাহের কর্মক্ষমতার সাথে সম্পর্কযুক্ত কিনা। স্বাধীন প্রতিলিপি মডেল সংস্করণ এবং ডেটাসেট জুড়ে রিপোর্ট করা নিদর্শনগুলি বজায় থাকে কিনা তা নির্ধারণ করতেও সাহায্য করবে।

পরিশেষে, ChemDIRT একটি ভাগ করা মূল্যায়ন সংস্থান হয়ে ওঠে বা একটি এক-কাগজের প্রস্তাব থেকে যায় কিনা তা দেখুন। বেঞ্চমার্ক ডেটা, কোড বা মূল্যায়ন জোতা সর্বজনীনভাবে উপলব্ধ কিনা তা উৎসটি উল্লেখ করে না। এই বাদ দেওয়া অবিলম্বে যাচাইকরণ এবং ব্যবহারিক গ্রহণ সীমিত. যতক্ষণ না সম্পূর্ণ কাগজ এবং সমর্থনকারী উপকরণগুলি পরীক্ষা করা হয়, ততক্ষণ পর্যন্ত সবচেয়ে সংরক্ষিত উপসংহার হল ChemDIRT একটি অর্থপূর্ণ মূল্যায়ন সমস্যা চিহ্নিত করে এবং অস্থিরতার প্রমাণ রিপোর্ট করে, যখন সেই অস্থিরতার মাত্রা এবং বাস্তব-বিশ্বের পরিণতিগুলি প্রতিষ্ঠিত করা বাকি থাকে।

সম্পর্কিত গাইড এবং কুইজ

এআই মডেল ব্যাখ্যা করা হয়েছেChatGPT ও এলএলএমএআই প্রশিক্ষণএআই নীতিশাস্ত্রআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?