কি হয়েছে
লেখকরা রিপোর্ট করেছেন যে পুনরুদ্ধার-বর্ধিত ভাষা-মডেল সিস্টেমগুলি অস্থির হয়ে উঠতে পারে যখন অনুসন্ধানের ফলাফলগুলি একই মডেল দ্বারা পূর্বে তৈরি করা সামগ্রী অন্তর্ভুক্ত করে। তিনটি সিমুলেশনের ধরন, তিনটি মডেল পরিবার এবং 1,019টি তথ্য-সন্ধানী প্রম্পট, 1,528টি সিমুলেশনের মধ্যে 1,216টি ধসে শেষ হয়েছে বলে জানা গেছে।
উৎসটি হল একটি arXiv পেপার যা 22শে আগস্ট, 2026 তারিখে জমা দেওয়া হয়েছে, যার শিরোনাম "RAG সঙ্কুচিত: LLM প্রতিক্রিয়া সংকোচন যখন পুনরুদ্ধার করা নথিগুলি স্ব-লেখক হয়।" এর কেন্দ্রীয় দাবি হল যে একটি ভাষা-মডেল সিস্টেমের অবনতি হতে পারে যখন একটি পুনরুদ্ধার সরঞ্জাম একই সিস্টেম দ্বারা উত্পন্ন রেফারেন্স প্রদান করে। লেখকরা এটিকে মডেল আউটপুটের পুনরাবৃত্তিমূলক প্রশিক্ষণ থেকে আলাদা করেছেন: এখানে, তথ্য পুনরুদ্ধারের সময় প্রতিক্রিয়া লুপ চালু করা হয়, যখন তৈরি করা নথিগুলি পরবর্তী প্রতিক্রিয়াগুলির জন্য রেফারেন্স হিসাবে উপলব্ধ হয়। কাগজটি ফলস্বরূপ প্যাটার্নটিকে "RAG পতন" বলে।
লেখকরা বলেছেন যে তারা তিন ধরণের সিমুলেশন পরীক্ষা করেছেন যাতে তারা তৈরি করা রেফারেন্সগুলি পুনরুদ্ধার করে এআই সিস্টেমগুলি জড়িত। সরবরাহ করা বিমূর্ত তিনটি মডেল পরিবারকে চিহ্নিত করে, 1,019টি তথ্য-সন্ধানী প্রম্পট, 1,528টি সিমুলেশন এবং এক মিলিয়নেরও বেশি ভাষা-মডেল API কল। এটি রিপোর্ট করে যে 1,216 সিমুলেশন, বা 79.6%, ধসে শেষ হয়েছে। উত্সটি মডেল পরিবারগুলির নাম দেয় না, প্রম্পটগুলি বিশদভাবে বর্ণনা করে, পুনরুদ্ধারের কনফিগারেশনগুলি নির্দিষ্ট করে, বা একটি সিমুলেশন ভেঙে গেছে তা সিদ্ধান্ত নিতে ব্যবহৃত অপারেশনাল পরীক্ষা দেয় না।
গবেষণাপত্রটি আরও জানায় যে প্রভাবটিকে ট্রিগার করার জন্য একটি একক স্ব-লেখিত রেফারেন্স যথেষ্ট হতে পারে। লেখকদের মতে, ভাষার মডেলগুলি অসামঞ্জস্যপূর্ণভাবে তাদের নিজস্ব বিষয়বস্তু উদ্ধৃত করেছে, এবং গবেষকরা রেফারেন্স মানের জন্য নিয়ন্ত্রিত হওয়ার পরে এই স্ব-পক্ষপাত রয়ে গেছে। এই পার্থক্যটি গুরুত্বপূর্ণ: রিপোর্ট করা প্রক্রিয়াটি কেবল এই নয় যে দুর্বল নথিগুলি পুনরুদ্ধার সেটকে দূষিত করে। উত্সটি পরিবর্তে স্ব-লেখকত্বকে একটি স্বাধীন ফ্যাক্টর হিসাবে উপস্থাপন করে যে কীভাবে পুনরুদ্ধার করা রেফারেন্স নির্বাচন বা ব্যবহার করা হয়।
এই ফলাফলগুলি সরবরাহকৃত উপাদানে স্বাধীনভাবে প্রতিষ্ঠিত তথ্যের পরিবর্তে একটি arXiv জমা দেওয়ার দাবি থেকে যায়। উত্সটি 31টি পরিসংখ্যান এবং চারটি টেবিল সহ একটি 36-পৃষ্ঠার কাগজ হিসাবে কাজটিকে চিহ্নিত করে, তবে প্রদত্ত পাঠে শুধুমাত্র বিমূর্ত এবং গ্রন্থপঞ্জী সংক্রান্ত তথ্য রয়েছে। এটি পিয়ার রিভিউ, বাইরের প্রতিলিপি, লাইভ-সিস্টেম টেস্টিং বা সম্পূর্ণ পরীক্ষামূলক ফলাফলের প্রতিবেদন করে না। দৃশ্যমান টাইমস্ট্যাম্প বর্তমান 96-ঘন্টা উইন্ডোর মধ্যে জমা দেয়, কিন্তু উত্সটি প্রাথমিক জমা দেওয়ার পরে পরবর্তী আপডেট প্রদান করে না।
কেন এটা গুরুত্বপূর্ণ
ফলাফলটি এমন সিস্টেমগুলির জন্য একটি সম্ভাব্য প্রতিক্রিয়া সমস্যা চিহ্নিত করে যা স্থল উত্তরগুলির জন্য অনুসন্ধান বা নথি পুনরুদ্ধার ব্যবহার করে। এটি পরামর্শ দেয় যে মডেল-উত্পাদিত উপাদানগুলি অসম প্রভাব পেতে পারে এমনকি যখন এটি অন্যান্য রেফারেন্সের চেয়ে ভাল না হয়, যদিও সরবরাহকৃত উত্স স্থাপন করে না যে এটি স্থাপন করা সিস্টেমে কত ঘন ঘন ঘটে।
পুনরুদ্ধার-বর্ধিত প্রজন্ম শুধুমাত্র তার প্যারামিটারে সঞ্চিত তথ্যের উপর নির্ভর না করে একটি ভাষা মডেলকে বাহ্যিক রেফারেন্সের সাথে সংযুক্ত করার উদ্দেশ্যে। যদি পুনরুদ্ধার করা উপাদান ক্রমবর্ধমানভাবে মডেল-উত্পাদিত পাঠ্য নিয়ে থাকে, তাহলে একটি সিস্টেম তার নিজস্ব বাক্যাংশ, বাদ দেওয়া বা ত্রুটিগুলিকে পরবর্তী উত্তরগুলিতে ফিরিয়ে দিতে পারে। কাগজের রিপোর্ট করা ফলাফল তাই AI সিস্টেমের জন্য সরাসরি নির্ভরযোগ্যতার ঝুঁকি নিয়ে উদ্বেগ প্রকাশ করে যা নথি সংগ্রহ অনুসন্ধান, সংক্ষিপ্তকরণ বা পুনরায় ব্যবহার করে।
রিপোর্ট করা স্ব-পক্ষপাত বিশেষভাবে প্রাসঙ্গিক কারণ অন্যান্য রেফারেন্স তুলনামূলক বা বৃহত্তর মানের হলেও এটি অব্যাহত থাকতে পারে। কাগজের সিমুলেশনের বাইরে নিশ্চিত করা হলে, এটি সাধারণ অনুমানগুলিকে জটিল করে তুলবে যে আরও পুনরুদ্ধার করা উপাদান যুক্ত করা স্বয়ংক্রিয়ভাবে গ্রাউন্ডিংকে উন্নত করে। একটি পুনরুদ্ধার ব্যবস্থার জন্য শুধুমাত্র প্রাসঙ্গিকতা বা আপাত মানের দ্বারা দস্তাবেজগুলিকে মূল্যায়ন করার পরিবর্তে, স্বাধীনভাবে উত্পাদিত উত্স থেকে মডেল-লেখিত নথিগুলিকে আলাদাভাবে ট্র্যাক করতে এবং মডেল-লেখিত নথিগুলিকে চিকিত্সা করার প্রয়োজন হতে পারে।
ব্যবহারিক প্রভাবগুলি সম্ভাব্যভাবে বিস্তৃত তবে তা বাড়াবাড়ি করা উচিত নয়। উৎসটি দেখায় না যে নিয়োজিত সার্চ ইঞ্জিন, এন্টারপ্রাইজ নলেজ বেস, বা ভোক্তা সহকারী বর্তমানে পতনের মধ্য দিয়ে যাচ্ছে। এটি এও প্রতিষ্ঠিত করে না যে সমস্ত মডেল-উত্পন্ন নথিগুলি অবিশ্বস্ত, যে পুনরুদ্ধার সিস্টেমগুলি নিয়মিতভাবে স্ব-রচিত সামগ্রীর পক্ষে, বা রিপোর্ট করা হার পরীক্ষিত সিমুলেশনের বাইরে প্রযোজ্য। কাগজটি সম্ভাব্য প্রতিক্রিয়া প্রক্রিয়া সম্পর্কে একটি সতর্কতা সরবরাহ করে, বিস্তৃত এআই ইকোসিস্টেমে এর প্রসারের একটি পরিমাপিত অনুমান নয়।
ফলাফলটি একটি শাসন এবং পরিমাপের সমস্যাও প্রকাশ করে। যখন এআই-উত্পাদিত উপাদান তথ্য পরিবেশে প্রবেশ করে, তখন পরবর্তী সিস্টেমে ডেরিভেটিভ টেক্সট থেকে আসল প্রমাণ আলাদা করতে অসুবিধা হতে পারে। সরবরাহকৃত উত্সটি একটি সম্পূর্ণ সমাধান প্রস্তাব করে না, তবে এর ফলাফলগুলি পুনরুদ্ধার-ভিত্তিক AI ব্যবহার করে বিকাশকারী এবং প্রতিষ্ঠানগুলির জন্য উত্স, উত্সের স্বাধীনতা এবং বারবার বিষয়বস্তু সনাক্তকরণ ব্যবহারিক সমস্যা তৈরি করে। এই প্রভাবগুলি লেখকদের দাবি থেকে শর্তসাপেক্ষে অনুসরণ করে এবং তারা বিস্তৃত অপারেশনাল সিদ্ধান্তে সমর্থন করার আগে বাস্তব পুনরুদ্ধার পাইপলাইনের বিরুদ্ধে পরীক্ষার প্রয়োজন।
ইন্টারেক্টিভ মেকানিজম: এটা আসলে কিভাবে কাজ করে
এই বিকাশের পিছনে অন্তর্নিহিত প্রযুক্তিটি ইন্টারেক্টিভভাবে অন্বেষণ করুন।
What is a common training objective for an autoregressive language model?
পরবর্তী কি দেখতে
মূল ফলো-আপ প্রশ্নগুলি হ'ল কাগজটি কীভাবে পতনকে সংজ্ঞায়িত করে, ফলাফলটি মডেল এবং বাস্তব-বিশ্বের পুনরুদ্ধার সিস্টেম জুড়ে প্রতিলিপি করে কিনা এবং কোন সুরক্ষাগুলি প্রভাবকে হ্রাস করে। উত্সটি সেই বিবরণগুলি সরবরাহ করে না, বা এটি কোনও হস্তক্ষেপ, স্থাপনার অধ্যয়ন, বা বাহ্যিক প্রতিলিপির প্রতিবেদন করে না।
পরীক্ষা করার জন্য প্রথম সমস্যাটি হল কাগজের "পতন" এর সংজ্ঞা। বিমূর্ত শব্দটি ব্যবহার করে এবং এটিকে পুনরাবৃত্ত মডেল প্রশিক্ষণের পূর্ববর্তী কাজের সাথে সংযুক্ত করে, যেখানে আউটপুটগুলি কম বৈচিত্র্যময় হয়ে ওঠে এবং শেষ পর্যন্ত মূল ডেটার সাদৃশ্য বন্ধ করে দেয়। কিন্তু সরবরাহ করা উৎসটি উল্লেখ করে না যে নতুন পরীক্ষাগুলি বৈচিত্র্য, প্রকৃত নির্ভুলতা, উৎস ওভারল্যাপ, উদ্ধৃতি আচরণ, উত্তরের মিল বা অন্য কোনো ফলাফল পরিমাপ করেছে কিনা। সম্পূর্ণ কাগজের মানদণ্ড নির্ধারণ করবে যে ফলাফলটি ব্যবহারকারীর-দৃশ্যমান নির্ভরযোগ্যতা ব্যর্থতার সাথে কতটা সরাসরি মানচিত্র।
প্রতিলিপি পরবর্তী গুরুত্বপূর্ণ পরীক্ষা. লেখকরা তিনটি মডেল পরিবার এবং তিনটি সিমুলেশন প্রকারের প্রতিবেদন করেছেন, তবে উত্সটি তাদের সনাক্ত করে না বা ব্যাখ্যা করে না যে তারা বর্তমান পুনরুদ্ধার-বর্ধিত সিস্টেমের কতটা প্রতিনিধি। স্বাধীন গবেষকদের বিভিন্ন মডেলের আকার, পুনরুদ্ধার অ্যালগরিদম, নথির মিশ্রণ, প্রম্পটিং কৌশল এবং এআই-উত্পন্ন উপাদানের অনুপাত পরীক্ষা করতে হবে। তাদের সাধারণ পুনরুদ্ধার ত্রুটি, সদৃশ নথি, বা নিম্ন-মানের রেফারেন্স থেকে স্ব-লেখকত্বের কারণে সৃষ্ট প্রভাবগুলিকে আলাদা করতে হবে।
বাস্তব-বিশ্বের ব্যাপকতা আরেকটি অজানা। কাগজটি রিপোর্ট করেছে 79.6% সিমুলেশনের সমাপ্তি পতনের মধ্যে, কিন্তু এই চিত্রটি ইন্টারনেট অনুসন্ধান, এন্টারপ্রাইজ ডাটাবেস, বা অন্য কোন স্থাপন করা সিস্টেমের জনসংখ্যার অনুমান নয়। একটি মডেলের নিজস্ব নথিগুলি প্রাসঙ্গিক পুনরুদ্ধারের ফলাফলে কত ঘন ঘন প্রদর্শিত হয়, প্রতিক্রিয়া লুপ কতক্ষণ নেয় বা মানব-সম্পাদিত এবং স্বাধীনভাবে যাচাইকৃত উপাদান এটিকে বাধা দেয় কিনা তা উৎসটি বলে না। সিমুলেশন ফলাফলকে জনসাধারণের প্রভাবের পূর্বাভাসে অনুবাদ করার আগে এই পরিমাপগুলি প্রয়োজনীয়।
পরিশেষে, ফলো-আপ কাজের সুরক্ষা পরীক্ষা করা উচিত। উপযোগী তুলনার মধ্যে প্রোভেনেন্স লেবেল, একই মডেল বা সিস্টেম দ্বারা তৈরি নথির বর্জন, উৎস-বৈচিত্র্যের প্রয়োজনীয়তা, স্বাধীন র্যাঙ্কিং এবং উচ্চ-স্টেকের ব্যবহারের জন্য মানব পর্যালোচনা অন্তর্ভুক্ত থাকবে। সরবরাহকৃত উৎস কোন প্রশমন পরীক্ষা রিপোর্ট করে না এবং কোন প্রাপ্যতা বা পণ্য দাবি করে না। এই ধরনের পরীক্ষাগুলি প্রকাশিত না হওয়া পর্যন্ত, বিকাশকারী এবং ব্যবহারকারীদের কাগজটিকে সম্ভাব্য গুরুত্বপূর্ণ ব্যর্থতার মোডের প্রমাণ হিসাবে বিবেচনা করা উচিত, যখন এটি স্বীকার করে যে এর তীব্রতা এবং প্রতিকারগুলি অমীমাংসিত রয়ে গেছে।