সংবাদে ফিরে যান
উদ্ভাবনAI Understanding ব্রিফিং

কাগজ এআই এজেন্ট মেমরিকে বাসি হওয়া থেকে রক্ষা করার জন্য সংস্করণযুক্ত চুক্তির প্রস্তাব করে

একটি নতুন arXiv পেপার রিপোর্ট করেছে যে সংস্করণ স্ট্যাম্প এবং সারি-স্তরের উচ্ছেদ এআই এজেন্টদের সার্ভার-সাইড পরিবর্তনের পরে পুনরুদ্ধারের পরামর্শ পুনরুদ্ধার করতে সাহায্য করতে পারে নিঃশব্দে পুরানো সংশোধনগুলি প্রয়োগ না করে।

6 min readRead the primary source
Source-page capture accompanying Paper proposes versioned contracts to keep AI agent memory from going stale
প্রাথমিক-উৎস নথিউৎস রেকর্ড করা হয়েছে
প্রকাশক
arxiv.org
উৎস লিঙ্ক
arxiv.orghttps://arxiv.org/abs/2609.00243
উত্স প্রকার
প্রাথমিক নথি - একটি অফিসিয়াল ঘোষণা, কাগজ, ফাইলিং বা প্রথম পক্ষের পৃষ্ঠা যা আমরা সরাসরি পড়ি।
প্রসঙ্গএটি 60 সেকেন্ডে বুঝুন

এখানে শুরু করুন

মূল পদ

মেমরি (এজেন্ট মেমরি)
সঞ্চিত প্রসঙ্গ একটি এআই এজেন্ট ধারাবাহিকতা উন্নত করতে বিভিন্ন ধাপ বা সেশন জুড়ে ব্যবহার করে।
এআই এজেন্ট
একটি সফ্টওয়্যার সিস্টেম যা লক্ষ্য অর্জনের জন্য পর্যবেক্ষণ, যুক্তি এবং পদক্ষেপ নিতে পারে, প্রায়শই সরঞ্জাম এবং মেমরি ব্যবহার করে।
API (অ্যাপ্লিকেশন প্রোগ্রামিং ইন্টারফেস)
একটি সফ্টওয়্যার সিস্টেমের জন্য একটি কাঠামোগত উপায় অন্য সিস্টেমে অনুরোধ পাঠাতে এবং প্রতিক্রিয়াগুলি গ্রহণ করার জন্য।
নিজেকে পরীক্ষা করুনএআই এজেন্ট কুইজ

কি হয়েছে

গবেষক মাইকেল উ এবং আরকুইমিডিস ক্যানেডো প্রস্তাব করেছেন "অবৈধ চুক্তি", AI এজেন্টদের জন্য একটি প্রোটোকল স্তর যা এপিসোড জুড়ে API ত্রুটিগুলি থেকে পুনরুদ্ধারের পরামর্শগুলি ক্যাশে করে৷ চুক্তিগুলি প্রতিটি পরামর্শের সাথে সংস্করণ স্ট্যাম্প এবং ক্যাশেবিলিটি ইঙ্গিত সংযুক্ত করে যাতে ক্লায়েন্টরা বৈধ থাকা এন্ট্রিগুলি সংরক্ষণ করে সার্ভার-সাইড ডেটা ড্রিফ্টের পরে বাসি এন্ট্রিগুলি সরিয়ে ফেলতে পারে।

কাগজটি এআই এজেন্টদের সম্বোধন করে যারা API ত্রুটির সম্মুখীন হওয়ার পরে পুনরুদ্ধারের পরামর্শগুলি ধরে রাখে। এর কেন্দ্রীয় উদ্বেগ হল যে একটি উপদেশ যা একটি পর্বে কাজ করেছে তা সার্ভার-সাইড ডেটা পরিবর্তনের পরে ভুল হয়ে যেতে পারে। প্রতিটি পর্বে একটি ফিক্স পুনরায় প্রাপ্ত করা সেই ব্যর্থতার মোড এড়াতে পারে, তবে লেখকরা বলেছেন এটি ক্যাশিং থেকে সঞ্চয় ফিরিয়ে দেয়। তাদের প্রস্তাবিত সমাধান, যাকে অবৈধকরণ চুক্তি বলা হয়, ক্যাশেকে একটি আলাদা ব্লক হিসাবে বিবেচনা করার পরিবর্তে প্রতিটি পুনরুদ্ধারের পরামর্শে প্রোটোকল মেটাডেটা যোগ করে।

চুক্তি সংস্করণ স্ট্যাম্প এবং ক্যাশেবিলিটি ইঙ্গিত প্রস্তাবনা সংযুক্ত. ক্লায়েন্ট তখনও বৈধ এন্ট্রি রাখার সময় পরিবর্তিত ডেটার সাথে যুক্ত এন্ট্রিগুলিকে উচ্ছেদ করতে পারে। লেখকরা ফলস্বরূপ সঞ্চয়কে বৈধতার মধ্যে আলাদা করেন—ক্যাশে করা পরামর্শের ভগ্নাংশ যা একটি ড্রিফট ইভেন্টের পরে সঠিক থাকে—এবং সম্মতি—যে ভগ্নাংশটি একজন পরিকল্পনাকারী তার প্রথম প্রচেষ্টায় সঠিকভাবে প্রয়োগ করে। কাগজটি বলে যে বৈধতা প্রোটোকল দ্বারা নির্ধারিত হয় এবং বিক্রেতা-স্বাধীন, যখন সম্মতি পরিকল্পনাকারী মডেলের উপর নির্ভর করে।

মূল্যায়ন সাতটি মডেল, তিনটি পরিবেশন পথ, দুটি ডোমেন এবং আনুমানিক 9,400টি পর্ব কভার করেছে। বিমূর্ত প্রতিবেদনে বলা হয়েছে যে সারি-স্তরের অবৈধতা মডেল জুড়ে 0 থেকে 66.7 শতাংশের মধ্যে সম্মতি বৃদ্ধি করেছে; তিনটি মডেল 55.6 এবং 66.7 পয়েন্টের মধ্যে লাভ দেখেছে। সাতটি মডেলের মধ্যে চারটি বেসলাইন টোকেন খরচের 29% থেকে 33% পুনরুদ্ধার করেছে। কাগজটি ধারা 4.1-এ বর্ণিত সারি-স্তরের ওরাকলের অধীনে সারি গ্রানুলারিটিতে নিখুঁত উচ্ছেদ নির্ভুলতা, 1.00, রিপোর্ট করে।

ফলাফল মডেল দ্বারা তীব্রভাবে পরিবর্তিত. লেখকরা Claude হাইকু 4.5-এর জন্য অভিন্ন ওয়্যার বাইটের সাথে 100% প্রথম-ট্রাই কমপ্লায়েন্সের রিপোর্ট করেছেন, Claude সনেট 5-এর জন্য 11% বা তার চেয়ে কম। তারা সনেটের আচরণকে ইনপুট-স্কিমা রক্ষণশীলতার জন্য দায়ী করে: ক্ষেত্রগুলি থেকে মূল অনুরোধ যোগ করে এমন সংশোধনগুলি প্রত্যাখ্যান করে। বিপরীতে, টেবিল-স্তরের অবৈধকরণ সহ-অবস্থিত এন্ট্রিগুলিকে ধ্বংস করে এবং সাতটি মডেলের মধ্যে পাঁচটিতে পোস্ট-ড্রিফ্ট ফার্স্ট-ট্রাই রেট 0% এ কমিয়ে দেয়। চুক্তিটি প্রতিক্রিয়া পেলোডে 15% যোগ করেছে এবং লেখকরা মূল্যায়ন জুড়ে শূন্য চুক্তি ব্যর্থতার রিপোর্ট করেছেন।

উত্স বিবরণ: arxiv.org ↗

কেন এটা গুরুত্বপূর্ণ

কাগজটি একটি নির্ভরযোগ্যতা এবং দক্ষতার সমস্যা হিসাবে অবিরাম এজেন্ট মেমরিকে ফ্রেম করে: প্রতিবার কম্পিউটিং ফিক্সগুলি বাসি পরামর্শ এড়িয়ে যায় তবে ক্যাশিং প্রদান করতে পারে এমন টোকেন এবং মডেল-কল সঞ্চয়কে ত্যাগ করে। এর রিপোর্ট করা ফলাফলগুলি পরামর্শ দেয় যে সারি স্তরে মেমরি বাতিল করা দরকারী ক্যাশে এন্ট্রি সংরক্ষণ করতে পারে, যদিও ফলাফলগুলি একটি প্রিপ্রিন্টের মূল্যায়ন থেকে আসে এবং উত্পাদন কর্মক্ষমতা প্রতিষ্ঠা করে না।

ব্যবহারিক সমস্যাটি কেবল একজন এজেন্ট মনে রাখতে পারে কিনা তা নয়। একটি বহিরাগত পরিষেবা পরিবর্তিত হলে মেমরিটি ব্যবহার করার জন্য নিরাপদ থাকে কিনা তা হল। একটি ক্যাশে পুনরুদ্ধারের পরামর্শ বারবার যুক্তি, টোকেন ব্যবহার এবং মডেল কলগুলি হ্রাস করতে পারে, তবে আশেপাশের API বা ডেটা প্রবাহিত হলে একই শর্টকাট একটি নীরব ব্যর্থ হতে পারে। প্রস্তাবিত প্রোটোকল সতেজতা তথ্যকে পরিষেবা এবং ক্লায়েন্টের মধ্যে মিথস্ক্রিয়ার অংশ করে তোলে।

বৈধতা এবং সম্মতির মধ্যে কাগজটির পার্থক্য দরকারী কারণ এটি দুটি ভিন্ন ব্যর্থতার উত্সকে পৃথক করে। একটি প্রোটোকল সনাক্ত করতে পারে কোন ক্যাশে করা এন্ট্রিগুলি বাতিল করা উচিত, তবুও একজন এজেন্ট এখনও একটি বৈধ পরামর্শ প্রয়োগ করতে ব্যর্থ হতে পারে৷ হাইকু 4.5 এবং সনেট 5 এর মধ্যে রিপোর্ট করা বৈসাদৃশ্য ইঙ্গিত করে যে প্রোটোকল ডিজাইন একা নির্ধারণ করতে পারে না যে সংরক্ষিত মেমরি থেকে একজন পরিকল্পনাকারী উপকৃত হয় কিনা। মডেল আচরণ একটি পৃথক অপারেশনাল সীমাবদ্ধতা অবশেষ.

রিপোর্ট করা সারি-স্তরের ফলাফলগুলি এমন সিস্টেমগুলির জন্য একটি সম্ভাব্য নকশা নীতির পরামর্শ দেয় যা একসাথে একাধিক পুনরুদ্ধারের পরামর্শ সংরক্ষণ করে: শুধুমাত্র প্রভাবিত এন্ট্রিগুলিকে বাতিল করে যখন প্রোটোকল তাদের সনাক্ত করতে পারে। সারণী-স্তরের তুলনা কাগজের পরীক্ষাগুলির মধ্যে ফলস্বরূপ কারণ বিস্তৃত অবৈধকরণ সম্পর্কহীন এন্ট্রিগুলিকে সরিয়ে দেয় এবং বেশিরভাগ পরীক্ষিত মডেলগুলিতে শূন্য-পরবর্তী-প্রবাহের প্রথম-ট্রাই হার তৈরি করে। এই অনুসন্ধান, যদি প্রতিলিপি করা হয়, দীর্ঘ-চলমান এজেন্টদের খরচ এবং নির্ভরযোগ্যতার জন্য গুরুত্বপূর্ণ হবে।

দক্ষতার দাবিও আবদ্ধ। লেখকরা চারটি মডেলের বেসলাইন টোকেন খরচের 29% থেকে 33% পুনরুদ্ধারের রিপোর্ট করেছেন, সাতটি নয়, এবং প্রোটোকল প্রতিক্রিয়া পেলোডগুলিতে 15% যোগ করে। উত্সটি বলে না যে কীভাবে এই খরচগুলি লেটেন্সি, ব্যান্ডউইথ, পরিকাঠামো ব্যয় বা উত্পাদনে ব্যবহারকারী-দৃশ্যমান নির্ভরযোগ্যতায় অনুবাদ করে। বা বিমূর্তটি প্রতিষ্ঠিত করে না যে পরীক্ষিত ডোমেন বা পরিবেশন পাথগুলি মোতায়েন এজেন্টদের দ্বারা ব্যবহৃত API-এর পরিসরের প্রতিনিধিত্ব করে।

এটি একটি স্বাধীনভাবে যাচাইকৃত উৎপাদন ফলাফলের পরিবর্তে একটি প্রিপ্রিন্ট। উত্সটি মূল্যায়নের আকার এবং শিরোনামের ফলাফলগুলি সনাক্ত করে তবে সাতটি মডেলের মধ্যে পাঁচটির পরিচয়, দুটি ডোমেনের নাম, সঠিক প্রবাহের পরিস্থিতি, বা অনিশ্চয়তার অনুমান প্রদান করে না। নিখুঁত উচ্ছেদ নির্ভুলতা স্পষ্টভাবে একটি সারি-স্তরের ওরাকলের সাথে আবদ্ধ, তাই এটিকে প্রমাণ হিসাবে পড়া উচিত নয় যে স্থাপন করা ক্লায়েন্টরা সর্বদা জানতে পারবে কোন সারিগুলি বাসি।

Interactive Mechanism

ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে

এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
ইন্টারেক্টিভ কনসেপ্ট চেক+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

পরবর্তী কি দেখতে

মূল খোলা প্রশ্নগুলি হল প্রোটোকলটি আরও পরিকল্পনাকারী, পরিষেবা, ডোমেন এবং বাস্তব-বিশ্ব ড্রিফট প্যাটার্নের সাথে কাজ করে কিনা এবং এর 15% রেসপন্স-পেলোড ওভারহেড স্থাপন করা সিস্টেমে গ্রহণযোগ্য কিনা। আরও যাচাই-বাছাইয়ের জন্য কাগজের ওরাকল-ভিত্তিক উচ্ছেদ মূল্যায়ন, পরীক্ষিত সাতটির মধ্যে অজ্ঞাত মডেল এবং নামযুক্ত Claude মডেলগুলির মধ্যে বৃহৎ সম্মতির ব্যবধানের কারণগুলিও পরীক্ষা করা উচিত।

প্রতিলিপিটি পরীক্ষা করা উচিত যে সংস্করণ-স্ট্যাম্প বৈধতা নির্ধারক থাকে কিনা যখন পরিষেবাগুলি বিভিন্ন হারে স্কিমা, শব্দার্থবিদ্যা বা ডেটা পরিবর্তন করে। কাগজটি প্রতিটি মডেল এবং সার্ভিং পাথ এবং শূন্য চুক্তি ব্যর্থতা জুড়ে অভিন্ন বৈধতার ফলাফলের প্রতিবেদন করে, তবে সেই ফলাফলটি কতটা বিস্তৃতভাবে প্রযোজ্য তা নির্ধারণ করার জন্য উত্সটি যথেষ্ট বিশদে ড্রিফট ইভেন্টের পরিসর বর্ণনা করে না।

মডেল-সাইড কমপ্লায়েন্স আলাদা তদন্তের দাবি রাখে। Claude হাইকু 4.5 এবং 11% বা তার নিচে Claude সনেট 5-এ 100% প্রথম-ট্রাই কমপ্লায়েন্সের মধ্যে রিপোর্ট করা ব্যবধান প্রস্তাব করে যে এজেন্টরা একই প্রোটোকল পেলোডকে ভিন্নভাবে ব্যাখ্যা করতে পারে। ভবিষ্যত মূল্যায়নের দ্বারা স্পষ্ট করা উচিত যে সমস্যাটি নামযুক্ত মডেলগুলির জন্য নির্দিষ্ট কিনা, প্রম্পট বা স্কিমা ডিজাইনের জন্য, অথবা পরিকল্পনাকারীদের মধ্যে কাঠামোগতভাবে অপরিচিত সংশোধনগুলি প্রত্যাখ্যান করার একটি বিস্তৃত প্রবণতা।

খরচ ট্রেডঅফ টোকেন অতিক্রম পরিমাপ করা উচিত. একটি 15% রেসপন্স-পেলোড বৃদ্ধি পর্বের দৈর্ঘ্য, নেটওয়ার্কের অবস্থা এবং কত ঘন ঘন ক্যাশে করা পরামর্শগুলি পুনরায় ব্যবহার করা হয় তার উপর নির্ভর করে ছোট বা উপাদান হতে পারে। উৎসটি চারটি মডেলের জন্য টোকেন-খরচ পুনরুদ্ধারের প্রতিবেদন করে কিন্তু লেটেন্সি, ব্যান্ডউইথ, আর্থিক বা ব্যর্থতার হারের ফলাফল প্রদান করে না, তাই এগুলো বাস্তবায়নকারীদের জন্য অর্থবহ অজানা থেকে যায়।

মূল্যায়নের সারি-স্তরের ওরাকলটি যাচাই করার আরেকটি বিষয়। একটি ওরাকলের অধীনে নিখুঁত নির্ভুলতা প্রস্তাবিত গ্রানুলারিটির আচরণ প্রদর্শন করে যখন প্রভাবিত সারিটি পরিচিত হয়, তবে এটি প্রতিষ্ঠিত করে না যে একজন প্রকৃত ক্লায়েন্ট সাধারণ পরিষেবা সংকেত থেকে সঠিক সারি সনাক্ত করতে পারে। স্বয়ংক্রিয় সনাক্তকরণ, মিথ্যা নেতিবাচক এবং মিথ্যা ইতিবাচক সম্পর্কে প্রমাণগুলি পরীক্ষামূলক সেটআপের বাইরে কতটা রিপোর্ট করা সুবিধা বেঁচে থাকে তা নির্ধারণ করবে।

অবশেষে, একই কাজ এবং প্রবাহের অবস্থার অধীনে অবিরাম এজেন্ট অবস্থা এবং মেমরি অবৈধকরণের সাথে কাজটিকে অন্যান্য পদ্ধতির সাথে তুলনা করা উচিত। উত্সটি একটি প্রোটোকল প্রস্তাব এবং একটি রিপোর্ট করা বেঞ্চমার্ক স্থাপন করে, তবে এটি স্থাপনার প্রাপ্যতা, গ্রহণ, স্বাধীন প্রতিলিপি বা অনির্দিষ্ট বিকল্পগুলির উপর শ্রেষ্ঠত্ব স্থাপন করে না।

সম্পর্কিত গাইড এবং কুইজ

এআই এজেন্টএআই মডেল ব্যাখ্যা করা হয়েছেএআই প্রশিক্ষণএআই-এর ভবিষ্যৎআপনি যা জানেন তা পরীক্ষা করুন - একটি বিনামূল্যের এআই কুইজ চেষ্টা করুনআমাদের শব্দকোষে একটি AI শব্দ দেখুনএআই মডেল রিলিজ ট্র্যাকার অনুসরণ করুন
এই দরকারী পাওয়া গেছে?