পরবর্তী আপপরবর্তী গাইড
অভিভাবক নথি এবং ছোট থেকে বড় পুনরুদ্ধার
টেকনিক্যাল
প্রযুক্তিগত গাইড
প্রাসঙ্গিক পুনরুদ্ধার হল একটি RAG কৌশল যা প্রতিটি খণ্ডের জন্য একটি সংক্ষিপ্ত, ডকুমেন্ট-সচেতন ব্যাখ্যা তৈরি করে কিওয়ার্ড অনুসন্ধানের জন্য এমবেড করা এবং সূচীকরণ করার আগে, তাই একটি খণ্ডটি নিজে থেকেই পড়ার সময় অর্থবোধ করে।
এটি গুরুত্বপূর্ণ কারণ খণ্ডগুলি প্রায়শই তাদের নথি থেকে বিভক্ত হওয়ার সময় মূল তথ্য হারায়, যেমন তারা কোন কোম্পানি, পণ্য বা সময়কাল উল্লেখ করে এবং এই ক্ষতির ফলে পুনরুদ্ধারকারী সঠিক উত্তরণটি মিস করে।
স্ট্যান্ডার্ড RAG দস্তাবেজগুলিকে খণ্ডে বিভক্ত করে, প্রতিটি খণ্ডকে এম্বেড করে এবং একটি প্রশ্নের অনুরূপ খণ্ডগুলি পুনরুদ্ধার করে। সমস্যা হল যে বিভাজন রেখাচিত্রমালা প্রসঙ্গ। একটি অংশ যা বলে "কোম্পানীর আয় 3% বেড়েছে" কোন কোম্পানি বা কোন সময়কাল তা বলে না, তাই শব্দার্থিক অনুসন্ধান বা কীওয়ার্ড অনুসন্ধান তাদের নাম দেওয়া প্রশ্নের সাথে এটিকে নির্ভরযোগ্যভাবে মেলাতে পারে না। Anthropic সেপ্টেম্বর 2024-এ প্রাসঙ্গিক পুনরুদ্ধার বর্ণনা করেছে। প্রতিটি খণ্ডের জন্য, একটি ভাষা মডেলকে পুরো নথি এবং খণ্ডটি দেওয়া হয় এবং একটি সংক্ষিপ্ত প্রসঙ্গ (সাধারণত প্রায় 50 থেকে 100 টোকেন) লিখতে বলা হয় যা নথির মধ্যে অংশটি রাখে। সেই প্রসঙ্গটি খণ্ডের জন্য প্রিপেন্ডেড। সম্মিলিত পাঠ্যটি তখন দুটি সূচকে ব্যবহৃত হয়: একটি এম্বেডিং সূচক (প্রসঙ্গগত এম্বেডিং) এবং একটি BM25 কীওয়ার্ড সূচক (প্রসঙ্গগত BM25)। ক্যোয়ারী করার সময়, উভয়ের ফলাফল একত্রিত করা হয় এবং ঐচ্ছিকভাবে একজন রিরেঙ্কার শীর্ষ প্রার্থীদের পুনরায় সাজায়। Anthropic এর বিভিন্ন ডেটাসেট জুড়ে রিপোর্ট করা পরীক্ষায়, প্রাসঙ্গিক এম্বেডিং এবং প্রাসঙ্গিক BM25 স্ট্যান্ডার্ড এমবেডিংয়ের তুলনায় শীর্ষ-20 পুনরুদ্ধারের ব্যর্থতার হার প্রায় 49 শতাংশ কমিয়েছে, এবং পুনরায় র্যাঙ্কিং যোগ করার ফলে এই হ্রাস প্রায় 67 শতাংশে এসেছে। আপনার নিজের ডেটার ফলাফলগুলি আলাদা হতে পারে, তাই এটি পরিমাপ করা মূল্যবান। সূচীকরণের সময় খরচ হয়: প্রতি খণ্ডে একটি মডেল কল, প্রতিটি সম্পূর্ণ নথি সহ। প্রম্পট ক্যাশিং এটিকে অনেক সস্তা করে তোলে, কারণ নথিটি একবার ক্যাশে করা হয় এবং এর সমস্ত অংশ জুড়ে পুনরায় ব্যবহার করা হয়। এড়ানোর জন্য ভুল ধারণা: যোগ করা প্রসঙ্গটি পুনরুদ্ধারের জন্য ব্যবহার করা হয়, এবং আপনি এটি জেনারেটরে দেখাবেন কিনা তা চয়ন করতে পারেন। এটি ভাল খণ্ডকে প্রতিস্থাপন করে না, এবং মডেলের প্রসঙ্গ উইন্ডোতে মাপসই ছোট জ্ঞানের ভিত্তিগুলির জন্য, সমস্ত কিছু সরাসরি পাঠানো যেকোনো পুনরুদ্ধার পাইপলাইনের চেয়ে সহজ হতে পারে।
আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।
কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।
ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।
প্রাসঙ্গিক পুনরুদ্ধার ক্যোয়ারী সময়কে আরও নির্ভরযোগ্য করতে ইন্ডেক্সিংয়ের সময় আরও গণনা ব্যয় করার একটি বিস্তৃত প্রবণতা প্রতিফলিত করে। যেহেতু মডেল কলগুলি সস্তা হয় এবং ক্যাশিং স্ট্যান্ডার্ড হয়ে যায়, সেহেতু খণ্ডগুলিতে প্রসঙ্গ যোগ করা অনেক RAG পাইপলাইনে একটি ডিফল্ট পদক্ষেপ হয়ে উঠতে পারে৷ দীর্ঘ প্রসঙ্গ উইন্ডোগুলি ছোট সংগ্রহগুলিতে পুনরুদ্ধারের প্রয়োজনীয়তা হ্রাস করে তবে বড়গুলিতে নয়, তাই এই জাতীয় কৌশলগুলি বড় জ্ঞানের ভিত্তিগুলির জন্য প্রাসঙ্গিক থাকা উচিত। মেটাডেটা ফিল্টারিং, জ্ঞান গ্রাফ এবং দেরী-ইন্টার্যাকশন পুনরুদ্ধারের সাথে আরও সংমিশ্রণ আশা করুন, দলগুলি ফ্যাশনের পরিবর্তে পরিমাপিত রিকলের উপর ভিত্তি করে বেছে নেয়।
একটি ত্রৈমাসিক প্রতিবেদনের একটি অংশ শুধুমাত্র "আগের ত্রৈমাসিকের তুলনায় রাজস্ব বৃদ্ধি পেয়েছে 3%"; প্রাসঙ্গিক পুনরুদ্ধার আগে থেকে বোঝায় যে এটি একটি নির্দিষ্ট কোম্পানির Q2 ফাইলিং থেকে এসেছে, তাই সেই কোম্পানি এবং কোয়ার্টারের নামকরণের একটি অনুসন্ধান এটি খুঁজে পায়।
একটি কর্মচারী হ্যান্ডবুকে, "এটি 90 দিন পরে প্রযোজ্য" বলে একটি অংশ একটি উপসর্গ লাভ করে যা ব্যাখ্যা করে যে এটি দূরবর্তী কাজের যোগ্যতার বিভাগ থেকে এসেছে।
একটি সফ্টওয়্যার ডকুমেন্টেশন সহকারী প্রসঙ্গ যোগ করে উল্লেখ করে যে একটি কনফিগারেশন খণ্ড একটি API এর সংস্করণ 3 এর অন্তর্গত, সংস্করণ 2 থেকে অনুরূপ পাঠ্যের সাথে বিভ্রান্তি হ্রাস করে।
একটি সমর্থন জ্ঞান বেস উপসর্গ সমস্যা সমাধানের অংশগুলিকে তারা কভার করা পণ্য মডেলের সাথে যুক্ত করে, তাই একটি মডেল সম্পর্কে প্রশ্নগুলি অন্যটির জন্য পদক্ষেপগুলি পুনরুদ্ধার করা বন্ধ করে দেয়।
একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।
অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।
সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।
বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।
বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।
ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।
স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
প্রাসঙ্গিক পুনরুদ্ধার হল একটি RAG কৌশল যা প্রতিটি খণ্ডের জন্য একটি সংক্ষিপ্ত, ডকুমেন্ট-সচেতন ব্যাখ্যা তৈরি করে কিওয়ার্ড অনুসন্ধানের জন্য এমবেড করা এবং সূচীকরণ করার আগে, তাই একটি খণ্ডটি নিজে থেকেই পড়ার সময় অর্থবোধ করে। এটি গুরুত্বপূর্ণ কারণ খণ্ডগুলি প্রায়শই তাদের নথি থেকে বিভক্ত হওয়ার সময় মূল তথ্য হারায়, যেমন তারা কোন কোম্পানি, পণ্য বা সময়কাল উল্লেখ করে এবং এই ক্ষতির ফলে পুনরুদ্ধারকারী সঠিক উত্তরণটি মিস করে।
বিভক্ত করা আশেপাশের প্রসঙ্গকে সরিয়ে দেয়, তাই একটি বিচ্ছিন্ন অংশে কোনো প্রশ্ন জিজ্ঞাসা করা সত্তা বা সময়কাল উল্লেখ নাও করতে পারে।
মডেলটিকে সম্পূর্ণ নথি এবং খণ্ডটি দেওয়া হয় এবং একটি সংক্ষিপ্ত প্রসঙ্গ প্রদান করে যা নথির মধ্যে অংশটিকে রাখে।
পদ্ধতিটি প্রাসঙ্গিক এম্বেডিং এবং প্রাসঙ্গিক BM25 ব্যবহার করে, তারপর তাদের ফলাফলগুলিকে একত্রিত করে।
Anthropic একটি 49 শতাংশ হ্রাস সম্পর্কে রিপোর্ট করেছে, যা পুনরায় র্যাঙ্কিংয়ের সাথে প্রায় 67 শতাংশে উন্নীত হয়েছে। অন্যান্য ডেটার ফলাফল ভিন্ন হতে পারে।
প্রতিটি খণ্ডের কল সম্পূর্ণ নথি অন্তর্ভুক্ত; ভাগ করা উপসর্গ ক্যাশে বারবার সম্পূর্ণ মূল্য পরিশোধ করা এড়িয়ে যায়।
শিখতে থাকুন
এই বিষয়ের জন্য বাছাই করা আরও গাইড
পরবর্তী আপপরবর্তী গাইড
অভিভাবক নথি এবং ছোট থেকে বড় পুনরুদ্ধার
টেকনিক্যাল