কি হয়েছে
গবেষক মাইকেল উ এবং আরকুইমিডিস ক্যানেডো প্রস্তাব করেছেন "অবৈধ চুক্তি", AI এজেন্টদের জন্য একটি প্রোটোকল স্তর যা এপিসোড জুড়ে API ত্রুটিগুলি থেকে পুনরুদ্ধারের পরামর্শগুলি ক্যাশে করে৷ চুক্তিগুলি প্রতিটি পরামর্শের সাথে সংস্করণ স্ট্যাম্প এবং ক্যাশেবিলিটি ইঙ্গিত সংযুক্ত করে যাতে ক্লায়েন্টরা বৈধ থাকা এন্ট্রিগুলি সংরক্ষণ করে সার্ভার-সাইড ডেটা ড্রিফ্টের পরে বাসি এন্ট্রিগুলি সরিয়ে ফেলতে পারে।
কাগজটি এআই এজেন্টদের সম্বোধন করে যারা API ত্রুটির সম্মুখীন হওয়ার পরে পুনরুদ্ধারের পরামর্শগুলি ধরে রাখে। এর কেন্দ্রীয় উদ্বেগ হল যে একটি উপদেশ যা একটি পর্বে কাজ করেছে তা সার্ভার-সাইড ডেটা পরিবর্তনের পরে ভুল হয়ে যেতে পারে। প্রতিটি পর্বে একটি ফিক্স পুনরায় প্রাপ্ত করা সেই ব্যর্থতার মোড এড়াতে পারে, তবে লেখকরা বলেছেন এটি ক্যাশিং থেকে সঞ্চয় ফিরিয়ে দেয়। তাদের প্রস্তাবিত সমাধান, যাকে অবৈধকরণ চুক্তি বলা হয়, ক্যাশেকে একটি আলাদা ব্লক হিসাবে বিবেচনা করার পরিবর্তে প্রতিটি পুনরুদ্ধারের পরামর্শে প্রোটোকল মেটাডেটা যোগ করে।
চুক্তি সংস্করণ স্ট্যাম্প এবং ক্যাশেবিলিটি ইঙ্গিত প্রস্তাবনা সংযুক্ত. ক্লায়েন্ট তখনও বৈধ এন্ট্রি রাখার সময় পরিবর্তিত ডেটার সাথে যুক্ত এন্ট্রিগুলিকে উচ্ছেদ করতে পারে। লেখকরা ফলস্বরূপ সঞ্চয়কে বৈধতার মধ্যে আলাদা করেন—ক্যাশে করা পরামর্শের ভগ্নাংশ যা একটি ড্রিফট ইভেন্টের পরে সঠিক থাকে—এবং সম্মতি—যে ভগ্নাংশটি একজন পরিকল্পনাকারী তার প্রথম প্রচেষ্টায় সঠিকভাবে প্রয়োগ করে। কাগজটি বলে যে বৈধতা প্রোটোকল দ্বারা নির্ধারিত হয় এবং বিক্রেতা-স্বাধীন, যখন সম্মতি পরিকল্পনাকারী মডেলের উপর নির্ভর করে।
মূল্যায়ন সাতটি মডেল, তিনটি পরিবেশন পথ, দুটি ডোমেন এবং আনুমানিক 9,400টি পর্ব কভার করেছে। বিমূর্ত প্রতিবেদনে বলা হয়েছে যে সারি-স্তরের অবৈধতা মডেল জুড়ে 0 থেকে 66.7 শতাংশের মধ্যে সম্মতি বৃদ্ধি করেছে; তিনটি মডেল 55.6 এবং 66.7 পয়েন্টের মধ্যে লাভ দেখেছে। সাতটি মডেলের মধ্যে চারটি বেসলাইন টোকেন খরচের 29% থেকে 33% পুনরুদ্ধার করেছে। কাগজটি ধারা 4.1-এ বর্ণিত সারি-স্তরের ওরাকলের অধীনে সারি গ্রানুলারিটিতে নিখুঁত উচ্ছেদ নির্ভুলতা, 1.00, রিপোর্ট করে।
ফলাফল মডেল দ্বারা তীব্রভাবে পরিবর্তিত. লেখকরা Claude হাইকু 4.5-এর জন্য অভিন্ন ওয়্যার বাইটের সাথে 100% প্রথম-ট্রাই কমপ্লায়েন্সের রিপোর্ট করেছেন, Claude সনেট 5-এর জন্য 11% বা তার চেয়ে কম। তারা সনেটের আচরণকে ইনপুট-স্কিমা রক্ষণশীলতার জন্য দায়ী করে: ক্ষেত্রগুলি থেকে মূল অনুরোধ যোগ করে এমন সংশোধনগুলি প্রত্যাখ্যান করে। বিপরীতে, টেবিল-স্তরের অবৈধকরণ সহ-অবস্থিত এন্ট্রিগুলিকে ধ্বংস করে এবং সাতটি মডেলের মধ্যে পাঁচটিতে পোস্ট-ড্রিফ্ট ফার্স্ট-ট্রাই রেট 0% এ কমিয়ে দেয়। চুক্তিটি প্রতিক্রিয়া পেলোডে 15% যোগ করেছে এবং লেখকরা মূল্যায়ন জুড়ে শূন্য চুক্তি ব্যর্থতার রিপোর্ট করেছেন।
কেন এটা গুরুত্বপূর্ণ
কাগজটি একটি নির্ভরযোগ্যতা এবং দক্ষতার সমস্যা হিসাবে অবিরাম এজেন্ট মেমরিকে ফ্রেম করে: প্রতিবার কম্পিউটিং ফিক্সগুলি বাসি পরামর্শ এড়িয়ে যায় তবে ক্যাশিং প্রদান করতে পারে এমন টোকেন এবং মডেল-কল সঞ্চয়কে ত্যাগ করে। এর রিপোর্ট করা ফলাফলগুলি পরামর্শ দেয় যে সারি স্তরে মেমরি বাতিল করা দরকারী ক্যাশে এন্ট্রি সংরক্ষণ করতে পারে, যদিও ফলাফলগুলি একটি প্রিপ্রিন্টের মূল্যায়ন থেকে আসে এবং উত্পাদন কর্মক্ষমতা প্রতিষ্ঠা করে না।
ব্যবহারিক সমস্যাটি কেবল একজন এজেন্ট মনে রাখতে পারে কিনা তা নয়। একটি বহিরাগত পরিষেবা পরিবর্তিত হলে মেমরিটি ব্যবহার করার জন্য নিরাপদ থাকে কিনা তা হল। একটি ক্যাশে পুনরুদ্ধারের পরামর্শ বারবার যুক্তি, টোকেন ব্যবহার এবং মডেল কলগুলি হ্রাস করতে পারে, তবে আশেপাশের API বা ডেটা প্রবাহিত হলে একই শর্টকাট একটি নীরব ব্যর্থ হতে পারে। প্রস্তাবিত প্রোটোকল সতেজতা তথ্যকে পরিষেবা এবং ক্লায়েন্টের মধ্যে মিথস্ক্রিয়ার অংশ করে তোলে।
বৈধতা এবং সম্মতির মধ্যে কাগজটির পার্থক্য দরকারী কারণ এটি দুটি ভিন্ন ব্যর্থতার উত্সকে পৃথক করে। একটি প্রোটোকল সনাক্ত করতে পারে কোন ক্যাশে করা এন্ট্রিগুলি বাতিল করা উচিত, তবুও একজন এজেন্ট এখনও একটি বৈধ পরামর্শ প্রয়োগ করতে ব্যর্থ হতে পারে৷ হাইকু 4.5 এবং সনেট 5 এর মধ্যে রিপোর্ট করা বৈসাদৃশ্য ইঙ্গিত করে যে প্রোটোকল ডিজাইন একা নির্ধারণ করতে পারে না যে সংরক্ষিত মেমরি থেকে একজন পরিকল্পনাকারী উপকৃত হয় কিনা। মডেল আচরণ একটি পৃথক অপারেশনাল সীমাবদ্ধতা অবশেষ.
রিপোর্ট করা সারি-স্তরের ফলাফলগুলি এমন সিস্টেমগুলির জন্য একটি সম্ভাব্য নকশা নীতির পরামর্শ দেয় যা একসাথে একাধিক পুনরুদ্ধারের পরামর্শ সংরক্ষণ করে: শুধুমাত্র প্রভাবিত এন্ট্রিগুলিকে বাতিল করে যখন প্রোটোকল তাদের সনাক্ত করতে পারে। সারণী-স্তরের তুলনা কাগজের পরীক্ষাগুলির মধ্যে ফলস্বরূপ কারণ বিস্তৃত অবৈধকরণ সম্পর্কহীন এন্ট্রিগুলিকে সরিয়ে দেয় এবং বেশিরভাগ পরীক্ষিত মডেলগুলিতে শূন্য-পরবর্তী-প্রবাহের প্রথম-ট্রাই হার তৈরি করে। এই অনুসন্ধান, যদি প্রতিলিপি করা হয়, দীর্ঘ-চলমান এজেন্টদের খরচ এবং নির্ভরযোগ্যতার জন্য গুরুত্বপূর্ণ হবে।
দক্ষতার দাবিও আবদ্ধ। লেখকরা চারটি মডেলের বেসলাইন টোকেন খরচের 29% থেকে 33% পুনরুদ্ধারের রিপোর্ট করেছেন, সাতটি নয়, এবং প্রোটোকল প্রতিক্রিয়া পেলোডগুলিতে 15% যোগ করে। উত্সটি বলে না যে কীভাবে এই খরচগুলি লেটেন্সি, ব্যান্ডউইথ, পরিকাঠামো ব্যয় বা উত্পাদনে ব্যবহারকারী-দৃশ্যমান নির্ভরযোগ্যতায় অনুবাদ করে। বা বিমূর্তটি প্রতিষ্ঠিত করে না যে পরীক্ষিত ডোমেন বা পরিবেশন পাথগুলি মোতায়েন এজেন্টদের দ্বারা ব্যবহৃত API-এর পরিসরের প্রতিনিধিত্ব করে।
এটি একটি স্বাধীনভাবে যাচাইকৃত উৎপাদন ফলাফলের পরিবর্তে একটি প্রিপ্রিন্ট। উত্সটি মূল্যায়নের আকার এবং শিরোনামের ফলাফলগুলি সনাক্ত করে তবে সাতটি মডেলের মধ্যে পাঁচটির পরিচয়, দুটি ডোমেনের নাম, সঠিক প্রবাহের পরিস্থিতি, বা অনিশ্চয়তার অনুমান প্রদান করে না। নিখুঁত উচ্ছেদ নির্ভুলতা স্পষ্টভাবে একটি সারি-স্তরের ওরাকলের সাথে আবদ্ধ, তাই এটিকে প্রমাণ হিসাবে পড়া উচিত নয় যে স্থাপন করা ক্লায়েন্টরা সর্বদা জানতে পারবে কোন সারিগুলি বাসি।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
পরবর্তী কি দেখতে
মূল খোলা প্রশ্নগুলি হল প্রোটোকলটি আরও পরিকল্পনাকারী, পরিষেবা, ডোমেন এবং বাস্তব-বিশ্ব ড্রিফট প্যাটার্নের সাথে কাজ করে কিনা এবং এর 15% রেসপন্স-পেলোড ওভারহেড স্থাপন করা সিস্টেমে গ্রহণযোগ্য কিনা। আরও যাচাই-বাছাইয়ের জন্য কাগজের ওরাকল-ভিত্তিক উচ্ছেদ মূল্যায়ন, পরীক্ষিত সাতটির মধ্যে অজ্ঞাত মডেল এবং নামযুক্ত Claude মডেলগুলির মধ্যে বৃহৎ সম্মতির ব্যবধানের কারণগুলিও পরীক্ষা করা উচিত।
প্রতিলিপিটি পরীক্ষা করা উচিত যে সংস্করণ-স্ট্যাম্প বৈধতা নির্ধারক থাকে কিনা যখন পরিষেবাগুলি বিভিন্ন হারে স্কিমা, শব্দার্থবিদ্যা বা ডেটা পরিবর্তন করে। কাগজটি প্রতিটি মডেল এবং সার্ভিং পাথ এবং শূন্য চুক্তি ব্যর্থতা জুড়ে অভিন্ন বৈধতার ফলাফলের প্রতিবেদন করে, তবে সেই ফলাফলটি কতটা বিস্তৃতভাবে প্রযোজ্য তা নির্ধারণ করার জন্য উত্সটি যথেষ্ট বিশদে ড্রিফট ইভেন্টের পরিসর বর্ণনা করে না।
মডেল-সাইড কমপ্লায়েন্স আলাদা তদন্তের দাবি রাখে। Claude হাইকু 4.5 এবং 11% বা তার নিচে Claude সনেট 5-এ 100% প্রথম-ট্রাই কমপ্লায়েন্সের মধ্যে রিপোর্ট করা ব্যবধান প্রস্তাব করে যে এজেন্টরা একই প্রোটোকল পেলোডকে ভিন্নভাবে ব্যাখ্যা করতে পারে। ভবিষ্যত মূল্যায়নের দ্বারা স্পষ্ট করা উচিত যে সমস্যাটি নামযুক্ত মডেলগুলির জন্য নির্দিষ্ট কিনা, প্রম্পট বা স্কিমা ডিজাইনের জন্য, অথবা পরিকল্পনাকারীদের মধ্যে কাঠামোগতভাবে অপরিচিত সংশোধনগুলি প্রত্যাখ্যান করার একটি বিস্তৃত প্রবণতা।
খরচ ট্রেডঅফ টোকেন অতিক্রম পরিমাপ করা উচিত. একটি 15% রেসপন্স-পেলোড বৃদ্ধি পর্বের দৈর্ঘ্য, নেটওয়ার্কের অবস্থা এবং কত ঘন ঘন ক্যাশে করা পরামর্শগুলি পুনরায় ব্যবহার করা হয় তার উপর নির্ভর করে ছোট বা উপাদান হতে পারে। উৎসটি চারটি মডেলের জন্য টোকেন-খরচ পুনরুদ্ধারের প্রতিবেদন করে কিন্তু লেটেন্সি, ব্যান্ডউইথ, আর্থিক বা ব্যর্থতার হারের ফলাফল প্রদান করে না, তাই এগুলো বাস্তবায়নকারীদের জন্য অর্থবহ অজানা থেকে যায়।
মূল্যায়নের সারি-স্তরের ওরাকলটি যাচাই করার আরেকটি বিষয়। একটি ওরাকলের অধীনে নিখুঁত নির্ভুলতা প্রস্তাবিত গ্রানুলারিটির আচরণ প্রদর্শন করে যখন প্রভাবিত সারিটি পরিচিত হয়, তবে এটি প্রতিষ্ঠিত করে না যে একজন প্রকৃত ক্লায়েন্ট সাধারণ পরিষেবা সংকেত থেকে সঠিক সারি সনাক্ত করতে পারে। স্বয়ংক্রিয় সনাক্তকরণ, মিথ্যা নেতিবাচক এবং মিথ্যা ইতিবাচক সম্পর্কে প্রমাণগুলি পরীক্ষামূলক সেটআপের বাইরে কতটা রিপোর্ট করা সুবিধা বেঁচে থাকে তা নির্ধারণ করবে।
অবশেষে, একই কাজ এবং প্রবাহের অবস্থার অধীনে অবিরাম এজেন্ট অবস্থা এবং মেমরি অবৈধকরণের সাথে কাজটিকে অন্যান্য পদ্ধতির সাথে তুলনা করা উচিত। উত্সটি একটি প্রোটোকল প্রস্তাব এবং একটি রিপোর্ট করা বেঞ্চমার্ক স্থাপন করে, তবে এটি স্থাপনার প্রাপ্যতা, গ্রহণ, স্বাধীন প্রতিলিপি বা অনির্দিষ্ট বিকল্পগুলির উপর শ্রেষ্ঠত্ব স্থাপন করে না।