কি হয়েছে
25 অগাস্ট arXiv-এ জমা দেওয়া একটি প্রিপ্রিন্ট শ্রেণীবদ্ধ LLM এজেন্টদের জন্য "স্ব-বর্ধিতকরণ" প্রস্তাব করে: একজন এজেন্ট একটি টাস্ক সমাধান করার সম্ভাবনা অনুমান করে যখন এটি এখনও যুক্তি করে এবং একটি শক্তিশালী মডেলের হাতে নিয়ন্ত্রণ করে যখন প্রত্যাশিত সুবিধা খরচকে সমর্থন করে। কাগজটি এটিকে প্রজন্মের আগে রাউটিং এবং একটি প্রতিক্রিয়া সম্পূর্ণ হওয়ার পরে যাচাইকরণের সাথে তুলনা করে।
কাগজটি শ্রেনীক্রমিক এলএলএম এজেন্টদের একটি নির্দিষ্ট সমস্যা পরীক্ষা করে: শুধুমাত্র কোন মডেলটি একটি কাজ পরিচালনা করবে তা নয়, তবে যখন একটি দুর্বল মডেল থামবে এবং সাহায্যের জন্য একটি শক্তিশালী মডেলকে জিজ্ঞাসা করবে। এর প্রস্তাবিত শাসন প্রজন্মের সময় কাজ করে। একজন এজেন্ট তার সফলতার চূড়ান্ত সম্ভাবনার একটি অনলাইন অনুমান তৈরি করে এবং যখন সেই অনুমানটি খরচ-সংবেদনশীল থ্রেশহোল্ডের নিচে নেমে আসে তখন একটি উত্তর সম্পূর্ণ করার আগে বাড়তে পারে। এটি উৎস দ্বারা বর্ণিত কেন্দ্রীয় প্রযুক্তিগত অবদান।
লেখকরা সিদ্ধান্তটিকে বায়েসিয়ান সর্বোত্তম-স্টপিং সমস্যা হিসাবে প্রণয়ন করেছেন। দক্ষতার অনুমান হল একটি শেখা উত্তর, যার পর্যাপ্ত পরিসংখ্যান শুধুমাত্র কাঁচা আউটপুট এনট্রপির পরিবর্তে লেবেলযুক্ত ট্রাজেক্টোরি থেকে আসে। কাগজটি বদ্ধ আকারে একটি মায়োপিক বৃদ্ধির থ্রেশহোল্ড প্রাপ্ত করে এবং সর্বোত্তম নীতিকে চিহ্নিত করতে গতিশীল প্রোগ্রামিং ব্যবহার করে। এটি একটি প্রমাণের প্রতিবেদন করে যে নীতিটি একটি সময়-পরিবর্তিত থ্রেশহোল্ড নীতি যা কাঁচা সংকেতের উপর একটি আকৃতি অনুমান আরোপ না করে।
উৎস বেশ কিছু তাত্ত্বিক ফলাফল রিপোর্ট. এটি বলে যে ওরাকল বিশ্বাস সংকেতের চেরনফ-তথ্য হারে তাত্পর্যপূর্ণভাবে পৃথক করে, যে অনুশোচনাটি পোস্টেরিয়র ক্রমাঙ্কন দ্বারা নিয়ন্ত্রিত হয় এবং n লেবেলযুক্ত ক্রমাঙ্কন ট্র্যাজেক্টোরিজগুলির সাথে প্রশিক্ষিত একটি প্লাগ-ইন নীতি 1/sqrt(n) হারে হ্রাস পাওয়ার জন্য অনুশোচনা করে৷ একটি নিয়ন্ত্রিত সিমুলেশন অধ্যয়ন সেই হার সহ তত্ত্বের ভবিষ্যদ্বাণীগুলি নিশ্চিত করে। কাগজটিতে 257 MBPP কোডিং টাস্কে Qwen2.5-Coder 1.5B-to-7B ক্যাসকেড ব্যবহার করে একটি বাস্তব-মডেল বৈধতা অন্তর্ভুক্ত রয়েছে। এই বৈধতা তিনটি প্রাক-নিবন্ধিত ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করেছে: বর্ধিতকরণ সীমান্ত সমান খরচে পোস্ট-হক রাউটিংকে ছাড়িয়ে গেছে, এবং ক্রমবর্ধমান সক্ষমতার বিশ্বাস প্রজন্মের সময়কালে আরও বৈষম্যমূলক হয়ে উঠেছে। উত্সটি তৃতীয় ভবিষ্যদ্বাণীটি সনাক্ত করে না বা বিমূর্তভাবে ব্যাখ্যা করে না কেন এটি নিশ্চিত করা হয়নি।
কেন এটা গুরুত্বপূর্ণ
যদি পদ্ধতিটি সাধারণীকরণ করা হয়, এটি এজেন্ট সিস্টেমগুলিকে সক্ষমতা, লেটেন্সি এবং মডেল-ব্যবহারের খরচের ভারসাম্যের জন্য আরও সময়োপযোগী উপায় দিতে পারে। প্রমাণ এখনও প্রাথমিক: কাগজের বাস্তব-মডেল পরীক্ষা 257 MBPP টাস্কে একটি Qwen2.5-Coder 1.5B-to-7B ক্যাসকেড ব্যবহার করেছে এবং তিনটি প্রাক-নিবন্ধিত ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করেছে।
ব্যবহারিক সমস্যা হল একটি এআই এজেন্টের মধ্যে সম্পদ বরাদ্দ করা। একটি সিস্টেম যা সর্বদা একটি শক্তিশালী মডেল ব্যবহার করে সক্ষমতা উন্নত করতে পারে তবে আরও অনুমান সংস্থান গ্রহণ করতে পারে। একটি সিস্টেম যা একটি দুর্বল মডেলের প্রতি প্রতিশ্রুতিবদ্ধ হয় যতক্ষণ না এটি শেষ না হয় সময় নষ্ট করতে পারে বা একটি পরিহারযোগ্য ব্যর্থতা তৈরি করতে পারে। স্ব-বর্ধিতকরণ সিদ্ধান্তটি যুক্তি প্রক্রিয়ার মধ্যে স্থাপন করার চেষ্টা করে, সিস্টেমটিকে থামানোর সুযোগ দেয় যখন তার নিজস্ব প্রমাণ পরামর্শ দেয় যে চালিয়ে যাওয়া অর্থ প্রদানের সম্ভাবনা কম।
ক্রমাঙ্কনের উপর কাগজের জোর দেওয়া গুরুত্বপূর্ণ কারণ বৃদ্ধি যোগ্যতা অনুমানের মানের উপর নির্ভর করে। একটি কনফিডেন্স সিগন্যাল যা খারাপভাবে ক্যালিব্রেট করা হয় তা একটি এজেন্টকে খুব ঘন ঘন বাড়তে পারে, খরচ বাড়াতে পারে, বা খুব কমই, দুর্বল উত্তরগুলিকে পাস করতে দেয়। রিপোর্ট করা অনুশোচনা গ্যারান্টি ভাষা মডেলের সার্বজনীনভাবে নির্ভরযোগ্য সম্পত্তি হিসাবে বৃদ্ধিকে উপস্থাপন করার পরিবর্তে সেই ক্রমাঙ্কনের সাথে কর্মক্ষমতাকে সংযুক্ত করে।
বাস্তব-মডেল যাচাইকরণে সমান-খরচের তুলনা সম্ভাব্যভাবে কার্যকর কারণ এটি সীমাহীন অতিরিক্ত মডেল কলের সাথে সিস্টেমের তুলনা করার পরিবর্তে একটি কংক্রিট স্থাপনার ট্রেডঅফকে লক্ষ্য করে। যাইহোক, রিপোর্ট করা মূল্যায়ন সংকীর্ণ। এটি একটি মডেল পরিবার, উৎসে বর্ণিত একটি ছোট-থেকে-মাঝারি ক্যাসকেড কনফিগারেশন এবং 257টি MBPP টাস্ক কভার করে। বিমূর্তটি পরম সাফল্যের হার, সঠিক খরচ হিসাব, লাভের আকার, বা নন-কোডিং কাজ থেকে প্রমাণ প্রদান করে না। সুতরাং এটি পদ্ধতিতে আগ্রহকে সমর্থন করে, একটি উপসংহার নয় যে শ্রেণিবদ্ধ এজেন্টরা সাধারণত কখন সাহায্য চাইতে হবে তা জানে।
ফলাফলটি ডায়নামিক কম্পিউটেশনের দিকে এজেন্ট ডিজাইনের একটি বৃহত্তর পরিবর্তনের সাথেও ফিট করে: প্রতিটি কাজে কতটা যুক্তি, যাচাই বা মডেল ক্ষমতা ব্যয় করতে হবে তা সিস্টেমগুলিকে সিদ্ধান্ত নিতে হতে পারে। এই কাগজটি সেই সিদ্ধান্তের একটি সংস্করণের জন্য একটি আনুষ্ঠানিক কাঠামো অবদান রাখে। ফ্রেমওয়ার্কটি নির্ভরযোগ্য পর্যবেক্ষণের সাথে বাস্তবায়িত করা যায় কিনা এবং অতিরিক্ত ক্রমাঙ্কন ডেটা, সিদ্ধান্তের ওভারহেড এবং হ্যান্ডঅফ জটিলতা আরও ভাল ফলাফল দ্বারা ন্যায়সঙ্গত কিনা তার উপর এর সর্বজনীন মূল্য নির্ভর করবে।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
পরবর্তী কি দেখতে
মূল প্রশ্ন হল যে শেখা দক্ষতা অনুমান কাগজের নিয়ন্ত্রিত সেটিং এর বাইরে মডেল, কাজ এবং পরিবেশ জুড়ে ক্রমাঙ্কিত থাকে কিনা। স্বাধীন প্রতিলিপির বৃহত্তর এবং আরও বৈচিত্র্যময় কাজের চাপ, অপ্রমাণিত ভবিষ্যদ্বাণী, বৃদ্ধির ত্রুটি এবং প্রজন্মের সময় নিয়ন্ত্রণ স্থানান্তরের ব্যবহারিক খরচ পরীক্ষা করা উচিত।
MBPP-এর বাইরে এবং Qwen2.5-Coder 1.5B-to-7B ক্যাসকেডের বাইরে পোস্ট-হক রাউটিং-এ রিপোর্ট করা সুবিধা টিকে আছে কিনা তা প্রতিলিপিটি প্রতিষ্ঠিত করা উচিত। দরকারী পরীক্ষাগুলি কাজের অসুবিধা, মডেল জোড়া, ডোমেন এবং আপেক্ষিক মূল্য বা বৃদ্ধির দেরীতে পরিবর্তিত হবে। উত্স নিজেই সেই পরীক্ষাগুলি রিপোর্ট করে না, তাই তাদের অনুপস্থিতি ব্যর্থতার প্রমাণের পরিবর্তে একটি অর্থবহ অজানা।
অনিশ্চিত পূর্ব-নিবন্ধিত ভবিষ্যদ্বাণী বিশেষ মনোযোগের দাবি রাখে। বিমূর্তটি বলে যে তিনটি ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করা হয়েছিল তবে অবশিষ্ট ভবিষ্যদ্বাণীর নাম বা ফলাফল বর্ণনা করে না। পাঠকদের সম্পূর্ণ কাগজ, প্রকাশিত কোড এবং ডেটা, বা ফলো-আপ কাজের সন্ধান করা উচিত যা স্পষ্ট করে যে কী পরীক্ষা করা হয়েছিল, কেন ভবিষ্যদ্বাণী ব্যর্থ হয়েছিল এবং ব্যর্থতা তত্ত্ব, সংকেত বা বাস্তবায়নের সীমাবদ্ধতার দিকে নির্দেশ করে কিনা।
ভবিষ্যত মূল্যায়নের জন্য ভুল ক্যালিব্রেশনের ক্ষতিকারক রূপ পরিমাপ করা উচিত, শুধুমাত্র গড় কাজের সাফল্য নয়। একজন এজেন্ট অপ্রয়োজনীয়ভাবে সহজ কাজগুলিকে বাড়িয়ে তুলতে পারে, কঠিন কাজগুলিতে বাড়াতে ব্যর্থ হতে পারে, বা শক্তিশালী মডেল সাহায্য করার জন্য নিয়ন্ত্রণ স্থানান্তর করতে খুব দেরি করতে পারে। উত্সটি একটি অনুশোচনা কাঠামো স্থাপন করে কিন্তু বিমূর্তভাবে, এই অপারেশনাল ত্রুটির প্রকারগুলি পরিমাপ করে না বা বিতরণ শিফটের অধীনে পদ্ধতিটি কীভাবে আচরণ করে তা দেখায় না।
কাগজটি কাজের সাথে সম্পর্কিত কোড এবং ডেটা তালিকাভুক্ত করে, যা স্বাধীন পরীক্ষা করা সম্ভব করতে পারে, কিন্তু উত্সটি লিঙ্কগুলি প্রদান করে না বা প্রকাশের বিষয়বস্তু বর্ণনা করে না। যাচাইকরণের জন্য ক্রমাঙ্কন পদ্ধতি, লেবেলযুক্ত ট্রাজেক্টোরিজ, খরচ মডেল, প্রাক-নিবন্ধন, সিমুলেশন সেটআপ এবং 257-টাস্কের বৈধতা ঘিরে পরিসংখ্যানগত অনিশ্চয়তা পরীক্ষা করা উচিত। ততক্ষণ পর্যন্ত, সবচেয়ে শক্তিশালী সমর্থিত উপসংহার হল যে প্রিপ্রিন্টটি প্রতিশ্রুতিশীল কিন্তু সীমিত অভিজ্ঞতামূলক প্রমাণ সহ মধ্য-প্রজন্মের বৃদ্ধির জন্য একটি আনুষ্ঠানিক, পরীক্ষাযোগ্য পদ্ধতির প্রস্তাব করে।