কি হয়েছে
25 অগাস্ট arXiv-এ জমা দেওয়া একটি পেপার পরীক্ষা করে যে কীভাবে ভাষা-মডেল এজেন্টরা নেটওয়ার্ক, মাল্টি-এজেন্ট সিস্টেমে একে অপরকে প্ররোচিত করে। এর নিয়ন্ত্রিত টেস্টবেড চারটি এলএলএম ব্যাকবোন, পাঁচটি গ্রাফ স্ট্রাকচার এবং 55টি নীতি বিবৃতি কভার করে। লেখকরা রিপোর্ট করেছেন যে নেটওয়ার্ক টপোলজি, প্রতিযোগিতা, বিষয় এবং প্রতিটি মডেলের পূর্বের অবস্থানের সাথে প্ররোচনা পরিবর্তিত হয়।
উৎসটি বৃহৎ ভাষার মডেল এজেন্টদের মধ্যে প্ররোচনাকে ক্রমবর্ধমান গুরুত্বপূর্ণ কিন্তু কম পরিমাপযোগ্য ক্ষমতা হিসেবে বর্ণনা করে। লেখকরা একটি নিয়ন্ত্রিত টেস্টবেড তৈরি করেছেন যেখানে কিছু এজেন্ট লক্ষ্য-নির্দেশিত প্ররোচনাকারী এবং অন্যরা তথ্য গ্রহণ, রিলে বা প্রতিক্রিয়া জানাতে পারে। বিমূর্ত অনুসারে নেটওয়ার্কগুলি বাস্তব-বিশ্বের অহং-নেটওয়ার্ক টপোলজিতে ভিত্তি করে তৈরি করা হয়েছিল, কিন্তু এখানে দেওয়া উৎসটি সুনির্দিষ্ট গ্রাফ নির্মাণ বা মিথস্ক্রিয়া প্রোটোকল ব্যাখ্যা করে না।
চারটি এলএলএম ব্যাকবোন, পাঁচটি গ্রাফ এবং 55টি নীতি বিবৃতি জুড়ে, পেপারটি রিপোর্ট করে যে প্ররোচনার গতিশীলতা বিভিন্ন ইন্টারঅ্যাক্টিং ফ্যাক্টরের উপর নির্ভর করে। এর মধ্যে রয়েছে নেটওয়ার্কের টপোলজি, এজেন্টরা প্রতিযোগিতা করছে কিনা, আলোচনার বিষয় এবং মডেলের পূর্বের বিশ্বাস বা প্রবণতা। বিমূর্তটি পৃথক মডেলের নাম, প্রতিটি দৌড়ে এজেন্টের সংখ্যা, বা সেই কারণগুলির জন্য তুলনামূলক প্রভাবের আকার প্রদান করে না।
লেখকরা রিপোর্ট করেছেন যে সরাসরি এক্সপোজার ছিল প্রতিযোগী রানের পরবর্তী রাউন্ডে অবস্থান পরিবর্তনের একটি নির্ভরযোগ্য ভবিষ্যদ্বাণী। সমবয়সীদের দ্বারা রিলে করা বার্তাগুলির একটি ছোট কিন্তু পরিমাপযোগ্য প্রভাব ছিল। এই অনুসন্ধানটি প্রমাণ হিসাবে উপস্থাপন করা হয়েছে যে এজেন্টদের প্ররোচিত করার জন্য নিয়োগ করা হয়নি তারা এখনও নেটওয়ার্কের মাধ্যমে প্ররোচনামূলক শক্তি প্রেরণ করতে পারে, এমনকি যখন তারা একটি যুক্তির মূল উত্স হিসাবে না হয়ে মধ্যস্থতাকারী হিসাবে কাজ করছে।
কাগজটি এজেন্টরা কী পরিকল্পনা করেছিল, তারা কী বলেছিল এবং কী অনুসন্ধানগুলি সনাক্ত করেছে তার মধ্যে একটি ব্যবধানও রিপোর্ট করে। পরিকল্পিত কৌশলগুলি শুধুমাত্র আংশিকভাবে সম্পাদিত বার্তাগুলিতে উপলব্ধি করা হয়েছিল, কর্মের পছন্দগুলি বার্তার বিষয়বস্তু থেকে বিচ্ছিন্ন হতে পারে এবং প্ররোচনাকারীরা খুব কমই স্পষ্টভাবে গবেষকদের অনুসন্ধানের দ্বারা সনাক্ত করা অবস্থানের পরিবর্তনগুলিকে স্পষ্টভাবে বলেছেন। বিমূর্তটি নির্দিষ্ট করে না যে কীভাবে প্রোবগুলি সুপ্ত বা উদ্ভূত অবস্থান পরিমাপ করেছে, বা কীভাবে গবেষকরা সেই পরিমাপগুলিকে বৈধ করেছেন।
কেন এটা গুরুত্বপূর্ণ
সমীক্ষাটি পরামর্শ দেয় যে একজন এজেন্টের দৃশ্যমান বার্তা তার অন্তর্নিহিত অবস্থান পরিবর্তিত হয়েছে কিনা বা কারা এটিকে প্রভাবিত করেছে তা পুরোপুরি প্রকাশ নাও করতে পারে। এটি এমন সিস্টেমের জন্য গুরুত্বপূর্ণ যেখানে এজেন্টরা বিতর্ক করে, গবেষণার সমন্বয় সাধন করে, ব্যবহারকারীদের অনুকরণ করে বা তথ্যের মধ্যস্থতা করে, কারণ প্রভাব বিস্তার করতে পারে এজেন্টদের মাধ্যমে যাকে রাজি করানোর জন্য নিয়োগ করা হয়নি।
ব্যবহারিক সমস্যা হল পর্যবেক্ষণযোগ্যতা। একটি একক চ্যাটবট বিনিময়ে, একজন পর্যালোচক পাঠ্যটি পরিদর্শন করতে পারেন এবং বিচার করতে পারেন যে এটিতে একটি প্ররোচিত যুক্তি রয়েছে কিনা। একটি মাল্টি-এজেন্ট সিস্টেমে, যাইহোক, প্রভাব বৃত্তাকার এবং পথ জুড়ে জমা হতে পারে। একটি মডেল সরাসরি এক্সপোজারের পরে, অন্য এজেন্টের কাছ থেকে একটি রিলে শোনার পরে, বা একটি ক্রিয়া নির্বাচন করার পরে তার প্রতিক্রিয়া পরিবর্তন করতে পারে যা তার লিখিত বার্তায় পরিবর্তনটি স্পষ্টভাবে প্রকাশ করে না।
এই পার্থক্য বিতর্ক, গবেষণা সমন্বয়, ব্যবহারকারী সিমুলেশন এবং তথ্য মধ্যস্থতার জন্য ব্যবহৃত এজেন্ট সিস্টেমের নকশা এবং নিরীক্ষাকে প্রভাবিত করতে পারে। যদি একটি মূল্যায়ন শুধুমাত্র চূড়ান্ত পাঠ্য রেকর্ড করে, তবে এটি মিস করতে পারে কোন এজেন্ট একটি প্রভাবশালী দাবি প্রবর্তন করেছে, কোন এজেন্ট এটিকে প্রশস্ত করেছে এবং চূড়ান্ত পদক্ষেপটি এমন একটি পরিবর্তন প্রতিফলিত করেছে যা প্রকাশ্যে স্বীকার করা হয়নি। কাগজের যুক্তি তাই পরিমাপ এবং জবাবদিহিতা সম্পর্কে একটি দাবির পরিবর্তে যে স্থাপন করা সিস্টেমগুলি ইতিমধ্যে একটি নির্দিষ্ট জনসাধারণের ঘটনা ঘটাচ্ছে।
টপোলজির রিপোর্ট করা ভূমিকা সিস্টেম ডিজাইনের সাথেও প্রাসঙ্গিক। এজেন্টদের বিন্যাস নির্ধারণ করে কে কোন বার্তাগুলি দেখতে পাবে এবং কীভাবে তথ্য ভ্রমণ করতে পারে৷ যদি নেটওয়ার্ক গঠন প্ররোচনার ফলাফল পরিবর্তন করে, তাহলে এজেন্ট যোগ করা বা তাদের যোগাযোগের লিঙ্ক পরিবর্তন করা আচরণ পরিবর্তন করতে পারে এমনকি যখন অন্তর্নিহিত মডেল এবং প্রম্পট একই থাকে। কোন টপোলজি সবচেয়ে নিরাপদ বা ম্যানিপুলেশনের জন্য সবচেয়ে প্রতিরোধী সেই উৎসটি প্রতিষ্ঠিত করে না।
ফলাফলগুলি একটি arXiv প্রিপ্রিন্ট থেকে গবেষণা দাবি হিসাবে উপস্থাপন করা হয়েছে, বাস্তব-বিশ্বের সামাজিক প্ররোচনার স্বাধীনভাবে যাচাইকৃত প্রমাণ হিসাবে নয়। বিমূর্তটি পিয়ার রিভিউ, মানুষের বৈধতা, স্থাপনার শর্ত বা পর্যবেক্ষণকৃত অবস্থান পরিবর্তনের স্থায়িত্ব সম্পর্কে কোন তথ্য দেয় না। পাঠকদের কাজটিকে একটি প্রস্তাবিত মূল্যায়নের দিক হিসাবে বিবেচনা করা উচিত যা রিপোর্ট করা পরীক্ষাগুলির দ্বারা সমর্থিত, মানুষ বা উত্পাদন AI সিস্টেমগুলি কীভাবে আচরণ করে তার পরিমাপ হিসাবে নয়।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
crm_get_transaction(id='4092').An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
পরবর্তী কি দেখতে
কাগজটি মূল্যায়নের জন্য আহ্বান করে যা বিশ্বাসের অনুসন্ধান, এক্সপোজার প্রোভেনেন্স এবং অ্যাকশন লগগুলিকে একত্রিত করে। গুরুত্বপূর্ণ অজানাগুলির মধ্যে রয়েছে পরীক্ষিত মডেলগুলির পরিচয় এবং সংস্করণ, নেটওয়ার্কগুলির আকার এবং গঠন, রিপোর্ট করা অবস্থান পরিবর্তনের শক্তি এবং অধ্যবসায়, এবং ফলাফলগুলি স্থাপন করা সিস্টেম বা মানব অংশগ্রহণকারীদের কাছে স্থানান্তরিত হয় কিনা।
লেখকরা প্ররোচনাকে ট্র্যাজেক্টোরি- এবং এক্সপোজার-লেভেল প্রক্রিয়া হিসাবে মূল্যায়ন করার সুপারিশ করেন। এর জন্য প্রতিটি এজেন্ট কী সম্মুখীন হয়েছিল, কখন এটির সম্মুখীন হয়েছিল এবং অন্য কোন এজেন্ট তথ্য রিলে করেছে তার একটি অ্যাকাউন্ট বজায় রাখতে হবে। এক্সপোজার প্রোভেন্যান্স বিভিন্ন সহকর্মীদের মাধ্যমে প্রেরিত প্রভাব থেকে সরাসরি প্রভাবকে আলাদা করতে সাহায্য করতে পারে, যখন অ্যাকশন লগগুলি দেখাতে পারে যে এজেন্ট ভিন্নভাবে কাজ করেছে কিনা এমনকি যখন এর পাঠ্য একটি পরিবর্তিত অবস্থান প্রকাশ করেনি।
বিশ্বাসের অনুসন্ধানগুলি দেখার জন্য আরেকটি ক্ষেত্র। বিমূর্তটি বলে যে প্ররোবগুলি সনাক্ত করা হয়েছে এমন অবস্থানের পরিবর্তনগুলিকে অনুপ্রাণিতকারীরা খুব কমই বলেছেন, যা বোঝায় যে সাধারণ পাঠ্য পরিদর্শন আন্দোলনকে অবমূল্যায়ন করতে পারে। এই প্রোবগুলি একটি অর্থপূর্ণ অভ্যন্তরীণ বা আচরণগত পরিবর্তন পরিমাপ করে কিনা, প্রম্পট এবং মডেল জুড়ে ফলাফলগুলি কতটা স্থিতিশীল এবং প্রোবগুলি নিজেরাই মিথস্ক্রিয়াকে বিকৃত করতে পারে কিনা তা নির্ধারণ করতে ভবিষ্যতের কাজ করতে হবে।
রিপোর্ট করা প্রভাব টেস্টবেডের উপর কতটা নির্ভর করে তা উৎস খোলা থাকে। কাগজটি বাস্তব-বিশ্বের অহং নেটওয়ার্কে ভিত্তি করে নীতি বিবৃতি এবং গ্রাফ কাঠামো ব্যবহার করে, তবে বিবৃতিগুলি রাজনৈতিকভাবে সংবেদনশীল ছিল কিনা, সেগুলি কতটা কঠিন ছিল, বা এজেন্টদের প্রাথমিক অবস্থানগুলি কীভাবে বরাদ্দ করা হয়েছিল তা বিমূর্তটি উল্লেখ করে না। এটি সরাসরি এবং পিয়ার-রিলে প্রভাবের মাত্রা বা পরবর্তী রাউন্ডের পরেও পরিবর্তনগুলি অব্যাহত রয়েছে কিনা তা রিপোর্ট করে না।
উচ্চ-স্টেকের স্থাপনায় ফলাফলগুলি প্রয়োগ করার আগে আরও প্রমাণের প্রয়োজন হবে। দরকারী ফলো-আপ পরীক্ষাগুলি বৃহত্তর এবং দীর্ঘ-চলমান নেটওয়ার্ক, বিভিন্ন মডেল পরিবার, বিভিন্ন নির্দেশাবলী এবং সরঞ্জাম অ্যাক্সেস এবং লোকেদের জড়িত মিথস্ক্রিয়া পরীক্ষা করবে। এই ফলাফলগুলি উপলব্ধ না হওয়া পর্যন্ত, উত্স থেকে স্পষ্ট ব্যবহারিক পাঠ হল যে মাল্টি-এজেন্ট অডিটগুলি চূড়ান্ত আউটপুটগুলির পাশাপাশি বার্তা প্রকাশের ইতিহাস এবং অ্যাকশন ট্রেসগুলিকে সংরক্ষণ করতে হবে।