সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

প্রিপ্রিন্ট এলএলএম এজেন্টদের যখন আরও শক্তিশালী সাহায্যের প্রয়োজন হয় তখন চিনতে পারে তাদের জন্য একটি বেইসিয়ান উপায় প্রস্তাব করে

একটি নতুন প্রিপ্রিন্ট অধ্যয়নকারী এজেন্ট যা যুক্তির সময় একটি শক্তিশালী ভাষা মডেলে নিয়ন্ত্রণ স্থানান্তর করতে পারে, তাত্ত্বিক গ্যারান্টি এবং সীমিত Qwen2.5-কোডার বৈধতার সাথে একটি Bayesian স্টপিং নিয়মের সমন্বয় করে।

5 min readRead the primary source
Source-page capture accompanying Preprint proposes a Bayesian way for LLM agents to recognize when they need stronger help
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2608.24087
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

বড় ভাষা মডেল (LLM)
টেক্সট তৈরি এবং বিশ্লেষণ করার জন্য বিশাল টেক্সট কর্পোরার উপর প্রশিক্ষিত একটি ভাষা মডেল।
ক্রমাঙ্কন
একটি মডেলের আত্মবিশ্বাসের স্কোর প্রকৃত শুদ্ধতার সম্ভাব্যতার সাথে কতটা ভালোভাবে মেলে।
অনুমান
রানটাইম ফেজ যেখানে একটি প্রশিক্ষিত মডেল ভবিষ্যদ্বাণী বা আউটপুট তৈরি করে।
নিজেকে পরীক্ষা করুনএআই এজেন্ট কুইজ

কি হয়েছে

25 অগাস্ট arXiv-এ জমা দেওয়া একটি প্রিপ্রিন্ট শ্রেণীবদ্ধ LLM এজেন্টদের জন্য "স্ব-বর্ধিতকরণ" প্রস্তাব করে: একজন এজেন্ট একটি টাস্ক সমাধান করার সম্ভাবনা অনুমান করে যখন এটি এখনও যুক্তি করে এবং একটি শক্তিশালী মডেলের হাতে নিয়ন্ত্রণ করে যখন প্রত্যাশিত সুবিধা খরচকে সমর্থন করে। কাগজটি এটিকে প্রজন্মের আগে রাউটিং এবং একটি প্রতিক্রিয়া সম্পূর্ণ হওয়ার পরে যাচাইকরণের সাথে তুলনা করে।

কাগজটি শ্রেনীক্রমিক এলএলএম এজেন্টদের একটি নির্দিষ্ট সমস্যা পরীক্ষা করে: শুধুমাত্র কোন মডেলটি একটি কাজ পরিচালনা করবে তা নয়, তবে যখন একটি দুর্বল মডেল থামবে এবং সাহায্যের জন্য একটি শক্তিশালী মডেলকে জিজ্ঞাসা করবে। এর প্রস্তাবিত শাসন প্রজন্মের সময় কাজ করে। একজন এজেন্ট তার সফলতার চূড়ান্ত সম্ভাবনার একটি অনলাইন অনুমান তৈরি করে এবং যখন সেই অনুমানটি খরচ-সংবেদনশীল থ্রেশহোল্ডের নিচে নেমে আসে তখন একটি উত্তর সম্পূর্ণ করার আগে বাড়তে পারে। এটি উৎস দ্বারা বর্ণিত কেন্দ্রীয় প্রযুক্তিগত অবদান।

লেখকরা সিদ্ধান্তটিকে বায়েসিয়ান সর্বোত্তম-স্টপিং সমস্যা হিসাবে প্রণয়ন করেছেন। দক্ষতার অনুমান হল একটি শেখা উত্তর, যার পর্যাপ্ত পরিসংখ্যান শুধুমাত্র কাঁচা আউটপুট এনট্রপির পরিবর্তে লেবেলযুক্ত ট্রাজেক্টোরি থেকে আসে। কাগজটি বদ্ধ আকারে একটি মায়োপিক বৃদ্ধির থ্রেশহোল্ড প্রাপ্ত করে এবং সর্বোত্তম নীতিকে চিহ্নিত করতে গতিশীল প্রোগ্রামিং ব্যবহার করে। এটি একটি প্রমাণের প্রতিবেদন করে যে নীতিটি একটি সময়-পরিবর্তিত থ্রেশহোল্ড নীতি যা কাঁচা সংকেতের উপর একটি আকৃতি অনুমান আরোপ না করে।

উৎস বেশ কিছু তাত্ত্বিক ফলাফল রিপোর্ট. এটি বলে যে ওরাকল বিশ্বাস সংকেতের চেরনফ-তথ্য হারে তাত্পর্যপূর্ণভাবে পৃথক করে, যে অনুশোচনাটি পোস্টেরিয়র ক্রমাঙ্কন দ্বারা নিয়ন্ত্রিত হয় এবং n লেবেলযুক্ত ক্রমাঙ্কন ট্র্যাজেক্টোরিজগুলির সাথে প্রশিক্ষিত একটি প্লাগ-ইন নীতি 1/sqrt(n) হারে হ্রাস পাওয়ার জন্য অনুশোচনা করে৷ একটি নিয়ন্ত্রিত সিমুলেশন অধ্যয়ন সেই হার সহ তত্ত্বের ভবিষ্যদ্বাণীগুলি নিশ্চিত করে। কাগজটিতে 257 MBPP কোডিং টাস্কে Qwen2.5-Coder 1.5B-to-7B ক্যাসকেড ব্যবহার করে একটি বাস্তব-মডেল বৈধতা অন্তর্ভুক্ত রয়েছে। এই বৈধতা তিনটি প্রাক-নিবন্ধিত ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করেছে: বর্ধিতকরণ সীমান্ত সমান খরচে পোস্ট-হক রাউটিংকে ছাড়িয়ে গেছে, এবং ক্রমবর্ধমান সক্ষমতার বিশ্বাস প্রজন্মের সময়কালে আরও বৈষম্যমূলক হয়ে উঠেছে। উত্সটি তৃতীয় ভবিষ্যদ্বাণীটি সনাক্ত করে না বা বিমূর্তভাবে ব্যাখ্যা করে না কেন এটি নিশ্চিত করা হয়নি।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

যদি পদ্ধতিটি সাধারণীকরণ করা হয়, এটি এজেন্ট সিস্টেমগুলিকে সক্ষমতা, লেটেন্সি এবং মডেল-ব্যবহারের খরচের ভারসাম্যের জন্য আরও সময়োপযোগী উপায় দিতে পারে। প্রমাণ এখনও প্রাথমিক: কাগজের বাস্তব-মডেল পরীক্ষা 257 MBPP টাস্কে একটি Qwen2.5-Coder 1.5B-to-7B ক্যাসকেড ব্যবহার করেছে এবং তিনটি প্রাক-নিবন্ধিত ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করেছে।

ব্যবহারিক সমস্যা হল একটি এআই এজেন্টের মধ্যে সম্পদ বরাদ্দ করা। একটি সিস্টেম যা সর্বদা একটি শক্তিশালী মডেল ব্যবহার করে সক্ষমতা উন্নত করতে পারে তবে আরও অনুমান সংস্থান গ্রহণ করতে পারে। একটি সিস্টেম যা একটি দুর্বল মডেলের প্রতি প্রতিশ্রুতিবদ্ধ হয় যতক্ষণ না এটি শেষ না হয় সময় নষ্ট করতে পারে বা একটি পরিহারযোগ্য ব্যর্থতা তৈরি করতে পারে। স্ব-বর্ধিতকরণ সিদ্ধান্তটি যুক্তি প্রক্রিয়ার মধ্যে স্থাপন করার চেষ্টা করে, সিস্টেমটিকে থামানোর সুযোগ দেয় যখন তার নিজস্ব প্রমাণ পরামর্শ দেয় যে চালিয়ে যাওয়া অর্থ প্রদানের সম্ভাবনা কম।

ক্রমাঙ্কনের উপর কাগজের জোর দেওয়া গুরুত্বপূর্ণ কারণ বৃদ্ধি যোগ্যতা অনুমানের মানের উপর নির্ভর করে। একটি কনফিডেন্স সিগন্যাল যা খারাপভাবে ক্যালিব্রেট করা হয় তা একটি এজেন্টকে খুব ঘন ঘন বাড়তে পারে, খরচ বাড়াতে পারে, বা খুব কমই, দুর্বল উত্তরগুলিকে পাস করতে দেয়। রিপোর্ট করা অনুশোচনা গ্যারান্টি ভাষা মডেলের সার্বজনীনভাবে নির্ভরযোগ্য সম্পত্তি হিসাবে বৃদ্ধিকে উপস্থাপন করার পরিবর্তে সেই ক্রমাঙ্কনের সাথে কর্মক্ষমতাকে সংযুক্ত করে।

বাস্তব-মডেল যাচাইকরণে সমান-খরচের তুলনা সম্ভাব্যভাবে কার্যকর কারণ এটি সীমাহীন অতিরিক্ত মডেল কলের সাথে সিস্টেমের তুলনা করার পরিবর্তে একটি কংক্রিট স্থাপনার ট্রেডঅফকে লক্ষ্য করে। যাইহোক, রিপোর্ট করা মূল্যায়ন সংকীর্ণ। এটি একটি মডেল পরিবার, উৎসে বর্ণিত একটি ছোট-থেকে-মাঝারি ক্যাসকেড কনফিগারেশন এবং 257টি MBPP টাস্ক কভার করে। বিমূর্তটি পরম সাফল্যের হার, সঠিক খরচ হিসাব, ​​লাভের আকার, বা নন-কোডিং কাজ থেকে প্রমাণ প্রদান করে না। সুতরাং এটি পদ্ধতিতে আগ্রহকে সমর্থন করে, একটি উপসংহার নয় যে শ্রেণিবদ্ধ এজেন্টরা সাধারণত কখন সাহায্য চাইতে হবে তা জানে।

ফলাফলটি ডায়নামিক কম্পিউটেশনের দিকে এজেন্ট ডিজাইনের একটি বৃহত্তর পরিবর্তনের সাথেও ফিট করে: প্রতিটি কাজে কতটা যুক্তি, যাচাই বা মডেল ক্ষমতা ব্যয় করতে হবে তা সিস্টেমগুলিকে সিদ্ধান্ত নিতে হতে পারে। এই কাগজটি সেই সিদ্ধান্তের একটি সংস্করণের জন্য একটি আনুষ্ঠানিক কাঠামো অবদান রাখে। ফ্রেমওয়ার্কটি নির্ভরযোগ্য পর্যবেক্ষণের সাথে বাস্তবায়িত করা যায় কিনা এবং অতিরিক্ত ক্রমাঙ্কন ডেটা, সিদ্ধান্তের ওভারহেড এবং হ্যান্ডঅফ জটিলতা আরও ভাল ফলাফল দ্বারা ন্যায়সঙ্গত কিনা তার উপর এর সর্বজনীন মূল্য নির্ভর করবে।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

পরবর্তী কি দেখতে

মূল প্রশ্ন হল যে শেখা দক্ষতা অনুমান কাগজের নিয়ন্ত্রিত সেটিং এর বাইরে মডেল, কাজ এবং পরিবেশ জুড়ে ক্রমাঙ্কিত থাকে কিনা। স্বাধীন প্রতিলিপির বৃহত্তর এবং আরও বৈচিত্র্যময় কাজের চাপ, অপ্রমাণিত ভবিষ্যদ্বাণী, বৃদ্ধির ত্রুটি এবং প্রজন্মের সময় নিয়ন্ত্রণ স্থানান্তরের ব্যবহারিক খরচ পরীক্ষা করা উচিত।

MBPP-এর বাইরে এবং Qwen2.5-Coder 1.5B-to-7B ক্যাসকেডের বাইরে পোস্ট-হক রাউটিং-এ রিপোর্ট করা সুবিধা টিকে আছে কিনা তা প্রতিলিপিটি প্রতিষ্ঠিত করা উচিত। দরকারী পরীক্ষাগুলি কাজের অসুবিধা, মডেল জোড়া, ডোমেন এবং আপেক্ষিক মূল্য বা বৃদ্ধির দেরীতে পরিবর্তিত হবে। উত্স নিজেই সেই পরীক্ষাগুলি রিপোর্ট করে না, তাই তাদের অনুপস্থিতি ব্যর্থতার প্রমাণের পরিবর্তে একটি অর্থবহ অজানা।

অনিশ্চিত পূর্ব-নিবন্ধিত ভবিষ্যদ্বাণী বিশেষ মনোযোগের দাবি রাখে। বিমূর্তটি বলে যে তিনটি ভবিষ্যদ্বাণীর মধ্যে দুটি নিশ্চিত করা হয়েছিল তবে অবশিষ্ট ভবিষ্যদ্বাণীর নাম বা ফলাফল বর্ণনা করে না। পাঠকদের সম্পূর্ণ কাগজ, প্রকাশিত কোড এবং ডেটা, বা ফলো-আপ কাজের সন্ধান করা উচিত যা স্পষ্ট করে যে কী পরীক্ষা করা হয়েছিল, কেন ভবিষ্যদ্বাণী ব্যর্থ হয়েছিল এবং ব্যর্থতা তত্ত্ব, সংকেত বা বাস্তবায়নের সীমাবদ্ধতার দিকে নির্দেশ করে কিনা।

ভবিষ্যত মূল্যায়নের জন্য ভুল ক্যালিব্রেশনের ক্ষতিকারক রূপ পরিমাপ করা উচিত, শুধুমাত্র গড় কাজের সাফল্য নয়। একজন এজেন্ট অপ্রয়োজনীয়ভাবে সহজ কাজগুলিকে বাড়িয়ে তুলতে পারে, কঠিন কাজগুলিতে বাড়াতে ব্যর্থ হতে পারে, বা শক্তিশালী মডেল সাহায্য করার জন্য নিয়ন্ত্রণ স্থানান্তর করতে খুব দেরি করতে পারে। উত্সটি একটি অনুশোচনা কাঠামো স্থাপন করে কিন্তু বিমূর্তভাবে, এই অপারেশনাল ত্রুটির প্রকারগুলি পরিমাপ করে না বা বিতরণ শিফটের অধীনে পদ্ধতিটি কীভাবে আচরণ করে তা দেখায় না।

কাগজটি কাজের সাথে সম্পর্কিত কোড এবং ডেটা তালিকাভুক্ত করে, যা স্বাধীন পরীক্ষা করা সম্ভব করতে পারে, কিন্তু উত্সটি লিঙ্কগুলি প্রদান করে না বা প্রকাশের বিষয়বস্তু বর্ণনা করে না। যাচাইকরণের জন্য ক্রমাঙ্কন পদ্ধতি, লেবেলযুক্ত ট্রাজেক্টোরিজ, খরচ মডেল, প্রাক-নিবন্ধন, সিমুলেশন সেটআপ এবং 257-টাস্কের বৈধতা ঘিরে পরিসংখ্যানগত অনিশ্চয়তা পরীক্ষা করা উচিত। ততক্ষণ পর্যন্ত, সবচেয়ে শক্তিশালী সমর্থিত উপসংহার হল যে প্রিপ্রিন্টটি প্রতিশ্রুতিশীল কিন্তু সীমিত অভিজ্ঞতামূলক প্রমাণ সহ মধ্য-প্রজন্মের বৃদ্ধির জন্য একটি আনুষ্ঠানিক, পরীক্ষাযোগ্য পদ্ধতির প্রস্তাব করে।

সম্পর্কিত গাইড এবং কুইজ

এআই এজেন্টএআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?