কি হয়েছে
একটি arXiv পেপার এজেন্টিক টুল আনলার্নিং প্রবর্তন করে, ভাষা-মডেল এজেন্টদের জন্য ডিজাইন করা একটি কাঠামো যা বহিরাগত সরঞ্জামগুলিকে কল করতে পারে। লেখকরা যুক্তি দেন যে প্রচলিত অশিক্ষা একটি মডেলের তথ্যের সরাসরি প্রত্যাহারকে দমন করতে পারে এজেন্টকে ওয়েব অনুসন্ধান, পুনরুদ্ধার বা ডাটাবেস অনুসন্ধানের মাধ্যমে একই তথ্য পুনরুদ্ধার করতে বাধা না দিয়ে।
কাগজ একটি ব্যর্থতা মোড বর্ণনা করে এটি টুল-মধ্যস্থতা পুনরুদ্ধার কল. একটি প্রচলিত ভাষার মডেলে, অশিক্ষা সাধারণত পরীক্ষা করে মূল্যায়ন করা হয় যে মডেলটি এখনও তার পরামিতিগুলি থেকে একটি মনোনীত লক্ষ্যকে সরাসরি স্মরণ করতে পারে কিনা। লেখকরা যুক্তি দেন যে এই মূল্যায়নটি এমন একজন এজেন্টের জন্য অসম্পূর্ণ যার উত্তর টুল কল এবং বাহ্যিক পর্যবেক্ষণের উপর নির্ভর করতে পারে। এই ধরনের একটি এজেন্ট মেমরি থেকে লক্ষ্য বলতে ব্যর্থ হতে পারে কিন্তু একটি বহিরাগত উৎসের মাধ্যমে একই তথ্য পুনরুদ্ধার করতে পারে। পার্থক্যটি গুরুত্বপূর্ণ কারণ মডেলের অভ্যন্তরীণ প্রতিক্রিয়া পরিবর্তিত হয়ে গেলেও পর্যবেক্ষণযোগ্য উত্তর উপলব্ধ থাকতে পারে। সেই সেটিংয়ে, মডেলটিকে মূল্যায়ন না করে তার ক্রিয়াকলাপ মূল্যায়ন করলে লক্ষ্য পুনরুদ্ধার করা রুটটি মিস হতে পারে।
প্রস্তাবিত পদ্ধতি, এজেন্টিক টুল আনলার্নিং এর দুটি ধাপ রয়েছে। প্রথমত, সিস্টেমটি সরাসরি প্রত্যাহার দমন করার উদ্দেশ্যে প্যারামেট্রিক জ্ঞান অশিক্ষা প্রয়োগ করে। দ্বিতীয়ত, এটি সিমুলেটেড টুল-অগমেন্টেড পরিবেশে ট্র্যাজেক্টোরি-লেভেল রিইনফোর্সমেন্ট লার্নিং ব্যবহার করে। কাগজের বিমূর্ত অনুসারে, এই পর্যায়টি লক্ষ্য-সন্ধানী সরঞ্জামের আচরণ এবং চূড়ান্ত উত্তরে ফাঁস উভয়কেই শাস্তি দেয়। লক্ষ্য হল এজেন্টের ক্রিয়াকলাপের মাধ্যমে পুনরুদ্ধার হ্রাস করা, শুধুমাত্র মডেল ওজন পরিবর্তনের মাধ্যমে নয়। এটি এজেন্টের সিদ্ধান্তের ক্রমকে অশিক্ষার সমস্যার অংশ করে তোলে, যার মধ্যে তথ্য খোঁজার পছন্দ এবং যেভাবে পুনরুদ্ধার করা উপাদান একটি প্রতিক্রিয়াতে অন্তর্ভুক্ত করা হয়।
লেখকরা বিভিন্ন ভাষা-মডেল আর্কিটেকচার জুড়ে RWKU এবং MUSE অশিক্ষার বেঞ্চমার্কের উপর পরীক্ষার রিপোর্ট করেছেন। তারা বলে যে পদ্ধতিটি নির্ধারিত লক্ষ্য ভুলে যাওয়া এবং উপলব্ধ থাকা উচিত এমন জ্ঞানের জন্য স্বাভাবিক উপযোগিতা বজায় রাখার মধ্যে একটি ভাল ভারসাম্য অর্জন করে। সরবরাহকৃত উত্সটি সংখ্যাসূচক ফলাফল, মডেলের নাম, প্রশিক্ষণের খরচ, বেসলাইন তুলনা বা সিমুলেটেড সরঞ্জামগুলির বিশদ প্রদান করে না, তাই রিপোর্ট করা উন্নতির শক্তি এবং সুযোগ শুধুমাত্র বিমূর্ত থেকে মূল্যায়ন করা যায় না। এই বাদ দেওয়া ফলাফলগুলিকে রিপোর্ট করা পরীক্ষা-নিরীক্ষার সাথে একটি গবেষণা প্রস্তাব হিসাবে সবচেয়ে ভালভাবে বোঝা যায়, বরং প্রমাণ হিসাবে যে পদ্ধতিটি স্থাপন করা সিস্টেম জুড়ে বৈধ করা হয়েছে।
কেন এটা গুরুত্বপূর্ণ
কাগজটি এমন সিস্টেমগুলির জন্য একটি ব্যবহারিক নিরাপত্তা এবং গোপনীয়তার সমস্যা হাইলাইট করে যা বহিরাগত সরঞ্জামগুলির সাথে ভাষার মডেলগুলিকে একত্রিত করে। মডেল পরামিতি থেকে জ্ঞান অপসারণ যথেষ্ট নাও হতে পারে যদি একজন এজেন্ট এখনও তার পার্শ্ববর্তী সরঞ্জামগুলির মাধ্যমে লক্ষ্যটি সনাক্ত করতে বা পুনর্গঠন করতে পারে।
ফাইন্ডিং গুরুত্বপূর্ণ কারণ টুল অ্যাক্সেস পরিবর্তন করে AI সিস্টেমের জন্য কিছু ভুলে যাওয়া মানে কী। একটি মডেল আর তথ্যের একটি অংশ সরাসরি এনকোড বা পুনরুত্পাদন করতে পারে না, তবুও সম্পূর্ণ এজেন্ট একটি সংযুক্ত ডাটাবেস অনুসন্ধান, পুনরুদ্ধার বা অনুসন্ধান করে এটি তৈরি করতে পারে। ব্যক্তিগত, মালিকানা বা অন্যথায় সীমাবদ্ধ তথ্য পরিচালনাকারী সিস্টেমগুলির জন্য, মূল্যায়নের প্রাসঙ্গিক ইউনিট তাই বিচ্ছিন্ন মডেলের পরিবর্তে সম্পূর্ণ এজেন্ট কর্মপ্রবাহ হতে পারে। এই বিস্তৃত দৃষ্টিভঙ্গি সম্পূর্ণ পথের মাধ্যমে তথ্য অনুসরণ করে যা একটি উত্তর তৈরি করতে পারে, মডেল প্যারামিটারগুলিকে একমাত্র সম্ভাব্য উত্স হিসাবে বিবেচনা করার পরিবর্তে।
সংস্থাগুলি কীভাবে মুছে ফেলা বা অপসারণের দাবিগুলিকে ব্যাখ্যা করে তার জন্যও পার্থক্যের প্রভাব রয়েছে৷ যদি একটি অনুরোধ একটি নির্দিষ্ট লক্ষ্য উত্পাদন থেকে একটি এজেন্ট প্রতিরোধ করার উদ্দেশ্যে হয়, শুধুমাত্র মডেল পরামিতি পরিবর্তন একটি বিকল্প পথ খোলা রেখে যেতে পারে। কাগজটি প্রতিষ্ঠিত করে না যে কোনও স্থাপন করা সিস্টেম বর্তমানে এইভাবে ব্যর্থ হয়েছে, তবে এটি পরীক্ষা করার জন্য একটি কংক্রিট মূল্যায়ন ফ্রেম সরবরাহ করে যে কোনও এজেন্টের সরঞ্জামগুলি একটি অশিক্ষা পদ্ধতিকে দুর্বল করে কিনা। এই ফ্রেমটি একত্রিত সিস্টেমটি এখনও যা পেতে পারে তার পরিবর্তন থেকে মডেলটি যা স্মরণ করে তার পরিবর্তনকে আলাদা করতে সহায়তা করতে পারে। এটি ব্যবহারকারীদের বাস্তবিকভাবে পর্যবেক্ষণ করতে পারে এমন আচরণের সাথে সংযুক্ত একটি অপসারণ দাবির সুযোগও রাখে।
প্রস্তাবিত উদ্দেশ্য একটি কঠিন প্রকৌশল বাণিজ্য বন্ধ আছে. একজন এজেন্টকে যে তথ্য ধরে রাখতে হবে সেই বিষয়ে প্রশ্নের উত্তর দেওয়ার জন্য প্রায়ই টুল ব্যবহার করা প্রয়োজন। অত্যধিক সরঞ্জাম-সন্ধানীকে শাস্তি দেওয়া দরকারী আচরণের ক্ষতি করতে পারে, যখন খুব কম শাস্তি দেওয়া ভুলে যাওয়া লক্ষ্য পুনরুদ্ধারযোগ্য হতে পারে। রক্ষিত জ্ঞান সংরক্ষণের কাগজের বিবৃত উদ্দেশ্য এই বাণিজ্য বন্ধকে সুস্পষ্ট করে তোলে, কিন্তু উত্সটি দেখায় না যে পদ্ধতিটি অস্পষ্ট অনুরোধ, পরোক্ষ প্রশ্ন বা ওভারল্যাপিং তথ্য ধারণকারী সরঞ্জামগুলিকে কতটা ভালভাবে পরিচালনা করে। একটি দরকারী পদ্ধতি তাই অবাঞ্ছিত রুটকে সীমাবদ্ধ করতে হবে যখন টুল ব্যবহারকে সমর্থন করে যা বৈধ থাকে, একটি ভারসাম্য যা একা বিমূর্ত থেকে অনুমান করা যায় না।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
পরবর্তী কি দেখতে
কেন্দ্রীয় প্রশ্ন হল রিপোর্ট করা পদ্ধতিটি কাগজের সিমুলেটেড পরিবেশ এবং বেঞ্চমার্কের বাইরে সাধারণীকরণ করে কিনা। টার্গেট তথ্য, টুল কনফিগারেশন, মডেল আর্কিটেকচার, পরিমাপ করা ট্রেড-অফ এবং পদ্ধতিটি বৈধ টুল ব্যবহার ব্যাহত না করে নির্ভরযোগ্যভাবে কাজ করে কিনা সে সম্পর্কে আরও বিশদ প্রয়োজন।
সম্পূর্ণ কাগজটি পরিষ্কার করা উচিত যে সফল ভুলে যাওয়া হিসাবে কী গণনা করা হয়। গুরুত্বপূর্ণ বিশদগুলির মধ্যে রয়েছে যে মূল্যায়ন পরীক্ষা শুধুমাত্র সঠিক লক্ষ্য পুনরুৎপাদন বা প্যারাফ্রেজ, পরোক্ষ উত্তর এবং বহু-পদক্ষেপ পুনর্গঠন করে কিনা। এটিও দেখানো উচিত যে পদ্ধতিটি কীভাবে সম্পর্কিত ধরে রাখা জ্ঞানের বৈধ পুনরুদ্ধার থেকে নিষিদ্ধ লক্ষ্য-সন্ধানকে আলাদা করে, যেহেতু সেই পার্থক্যটি নির্ধারণ করবে যে পদ্ধতিটি ব্যবহারিক কিনা। মূল্যায়ন নকশা শিরোনাম ফলাফল হিসাবে ততটা গুরুত্বপূর্ণ হবে: একটি সংকীর্ণ পরীক্ষা দেখাতে পারে যে একটি নির্দিষ্ট প্রতিক্রিয়া অবরুদ্ধ করা হয়েছে তা না দেখিয়ে যে অন্তর্নিহিত তথ্য অন্য পথ দিয়ে পৌঁছানো যাবে না। পরিষ্কার সংজ্ঞা ভুলে যাওয়া এবং ইউটিলিটির মধ্যে রিপোর্ট করা ভারসাম্যকে ব্যাখ্যা করা সহজ করে তুলবে।
প্রতিলিপি গুরুত্বপূর্ণ হবে কারণ রিপোর্ট করা পরীক্ষাগুলি RWKU এবং MUSE এবং সিমুলেটেড টুল-বর্ধিত পরিবেশ ব্যবহার করে। লেখকদের প্রশিক্ষণ সেটআপের বাইরে পরিচালিত মূল্যায়ন সহ পাঠকদের বিভিন্ন সরঞ্জামের ধরন, পুনরুদ্ধার সিস্টেম, ডেটাবেস এবং মডেল পরিবারগুলির সাথে পরীক্ষাগুলি সন্ধান করা উচিত। বিমূর্ত কোড, পরিবেশ বা প্রশিক্ষিত মডেল উপলব্ধ কিনা তা বলে না, তাই প্রজননযোগ্যতা বর্তমানে অজানা। স্বাধীন পরীক্ষা পদ্ধতিটি সিমুলেটেড সরঞ্জামগুলি তথ্য প্রকাশ করার নির্দিষ্ট উপায়ের উপর নির্ভর করে কিনা বা আশেপাশের সিস্টেমটি ভিন্নভাবে কনফিগার করা হলে এর সীমাবদ্ধতাগুলি কার্যকর থাকে কিনা তা নির্ধারণ করতে সহায়তা করবে। সেই তুলনা ছাড়া, পদ্ধতির সাধারণতা একটি উন্মুক্ত প্রশ্ন থেকে যায়।
ভবিষ্যত মূল্যায়ন দীর্ঘ এজেন্ট ট্র্যাজেক্টরির উপর নিরাপত্তা এবং উপযোগ উভয় পরিমাপ করা উচিত. একটি সিস্টেম যা সংক্ষিপ্ত পরীক্ষায় সরাসরি ফুটোকে ব্লক করে তা ভিন্নভাবে আচরণ করতে পারে যখন এটি পরিকল্পনা করতে পারে, পুনরায় চেষ্টা করতে পারে, বিভিন্ন সরঞ্জাম কল করতে পারে বা আংশিক পর্যবেক্ষণ একত্রিত করতে পারে। এজেন্টিক টুল আনলার্নিং টুল সূচী বা ডাটাবেসে কপি করা তথ্যকে সম্বোধন করতে পারে কিনা এবং তাদের আশেপাশের সিস্টেমগুলিকে পুনরায় প্রশিক্ষণ না দিয়ে মোতায়েন করা এজেন্টদের ক্ষেত্রে প্রয়োগ করা যেতে পারে কিনা তাও উৎসটি খোলা থাকে। এই প্রশ্নগুলি মডেল-স্তরের পদ্ধতিকে বিস্তৃত পরিবেশের সাথে সংযুক্ত করে যেখানে পুনরুদ্ধার ঘটতে পারে। তারা এও ইঙ্গিত করে যে কেন একটি সফল প্রদর্শনী এজেন্ট কী প্রকাশ করতে অস্বীকার করে এবং কী দরকারী তথ্য পুনরুদ্ধার করতে থাকে উভয়ই পরীক্ষা করতে হবে।