প্রযুক্তিগত গাইড

প্রাসঙ্গিক পুনরুদ্ধার

প্রাসঙ্গিক পুনরুদ্ধার হল একটি RAG কৌশল যা প্রতিটি খণ্ডের জন্য একটি সংক্ষিপ্ত, ডকুমেন্ট-সচেতন ব্যাখ্যা তৈরি করে কিওয়ার্ড অনুসন্ধানের জন্য এমবেড করা এবং সূচীকরণ করার আগে, তাই একটি খণ্ডটি নিজে থেকেই পড়ার সময় অর্থবোধ করে।

  • 4 মিনিট পড়া
  • সর্বশেষ আপডেট করা হয়েছে
এই পৃষ্ঠায়4 মিনিট পড়া
  1. ওভারভিউ
  2. গভীর ডুব
  3. কৌশলগত প্রভাব
  4. প্রাসঙ্গিক পুনরুদ্ধারের ভবিষ্যত
  5. বাস্তব-বিশ্ব বাস্তবায়ন
  6. ঝুঁকি এবং প্রহরী
  7. বাস্তবায়ন রোডম্যাপ
  8. অন্বেষণ চালিয়ে যান
  9. প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ওভারভিউ

এটি গুরুত্বপূর্ণ কারণ খণ্ডগুলি প্রায়শই তাদের নথি থেকে বিভক্ত হওয়ার সময় মূল তথ্য হারায়, যেমন তারা কোন কোম্পানি, পণ্য বা সময়কাল উল্লেখ করে এবং এই ক্ষতির ফলে পুনরুদ্ধারকারী সঠিক উত্তরণটি মিস করে।

গভীর ডুব

স্ট্যান্ডার্ড RAG দস্তাবেজগুলিকে খণ্ডে বিভক্ত করে, প্রতিটি খণ্ডকে এম্বেড করে এবং একটি প্রশ্নের অনুরূপ খণ্ডগুলি পুনরুদ্ধার করে। সমস্যা হল যে বিভাজন রেখাচিত্রমালা প্রসঙ্গ। একটি অংশ যা বলে "কোম্পানীর আয় 3% বেড়েছে" কোন কোম্পানি বা কোন সময়কাল তা বলে না, তাই শব্দার্থিক অনুসন্ধান বা কীওয়ার্ড অনুসন্ধান তাদের নাম দেওয়া প্রশ্নের সাথে এটিকে নির্ভরযোগ্যভাবে মেলাতে পারে না। Anthropic সেপ্টেম্বর 2024-এ প্রাসঙ্গিক পুনরুদ্ধার বর্ণনা করেছে। প্রতিটি খণ্ডের জন্য, একটি ভাষা মডেলকে পুরো নথি এবং খণ্ডটি দেওয়া হয় এবং একটি সংক্ষিপ্ত প্রসঙ্গ (সাধারণত প্রায় 50 থেকে 100 টোকেন) লিখতে বলা হয় যা নথির মধ্যে অংশটি রাখে। সেই প্রসঙ্গটি খণ্ডের জন্য প্রিপেন্ডেড। সম্মিলিত পাঠ্যটি তখন দুটি সূচকে ব্যবহৃত হয়: একটি এম্বেডিং সূচক (প্রসঙ্গগত এম্বেডিং) এবং একটি BM25 কীওয়ার্ড সূচক (প্রসঙ্গগত BM25)। ক্যোয়ারী করার সময়, উভয়ের ফলাফল একত্রিত করা হয় এবং ঐচ্ছিকভাবে একজন রিরেঙ্কার শীর্ষ প্রার্থীদের পুনরায় সাজায়। Anthropic এর বিভিন্ন ডেটাসেট জুড়ে রিপোর্ট করা পরীক্ষায়, প্রাসঙ্গিক এম্বেডিং এবং প্রাসঙ্গিক BM25 স্ট্যান্ডার্ড এমবেডিংয়ের তুলনায় শীর্ষ-20 পুনরুদ্ধারের ব্যর্থতার হার প্রায় 49 শতাংশ কমিয়েছে, এবং পুনরায় র‌্যাঙ্কিং যোগ করার ফলে এই হ্রাস প্রায় 67 শতাংশে এসেছে। আপনার নিজের ডেটার ফলাফলগুলি আলাদা হতে পারে, তাই এটি পরিমাপ করা মূল্যবান। সূচীকরণের সময় খরচ হয়: প্রতি খণ্ডে একটি মডেল কল, প্রতিটি সম্পূর্ণ নথি সহ। প্রম্পট ক্যাশিং এটিকে অনেক সস্তা করে তোলে, কারণ নথিটি একবার ক্যাশে করা হয় এবং এর সমস্ত অংশ জুড়ে পুনরায় ব্যবহার করা হয়। এড়ানোর জন্য ভুল ধারণা: যোগ করা প্রসঙ্গটি পুনরুদ্ধারের জন্য ব্যবহার করা হয়, এবং আপনি এটি জেনারেটরে দেখাবেন কিনা তা চয়ন করতে পারেন। এটি ভাল খণ্ডকে প্রতিস্থাপন করে না, এবং মডেলের প্রসঙ্গ উইন্ডোতে মাপসই ছোট জ্ঞানের ভিত্তিগুলির জন্য, সমস্ত কিছু সরাসরি পাঠানো যেকোনো পুনরুদ্ধার পাইপলাইনের চেয়ে সহজ হতে পারে।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

প্রাসঙ্গিক পুনরুদ্ধারের ভবিষ্যত

প্রাসঙ্গিক পুনরুদ্ধার ক্যোয়ারী সময়কে আরও নির্ভরযোগ্য করতে ইন্ডেক্সিংয়ের সময় আরও গণনা ব্যয় করার একটি বিস্তৃত প্রবণতা প্রতিফলিত করে। যেহেতু মডেল কলগুলি সস্তা হয় এবং ক্যাশিং স্ট্যান্ডার্ড হয়ে যায়, সেহেতু খণ্ডগুলিতে প্রসঙ্গ যোগ করা অনেক RAG পাইপলাইনে একটি ডিফল্ট পদক্ষেপ হয়ে উঠতে পারে৷ দীর্ঘ প্রসঙ্গ উইন্ডোগুলি ছোট সংগ্রহগুলিতে পুনরুদ্ধারের প্রয়োজনীয়তা হ্রাস করে তবে বড়গুলিতে নয়, তাই এই জাতীয় কৌশলগুলি বড় জ্ঞানের ভিত্তিগুলির জন্য প্রাসঙ্গিক থাকা উচিত। মেটাডেটা ফিল্টারিং, জ্ঞান গ্রাফ এবং দেরী-ইন্টার্যাকশন পুনরুদ্ধারের সাথে আরও সংমিশ্রণ আশা করুন, দলগুলি ফ্যাশনের পরিবর্তে পরিমাপিত রিকলের উপর ভিত্তি করে বেছে নেয়।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি ত্রৈমাসিক প্রতিবেদনের একটি অংশ শুধুমাত্র "আগের ত্রৈমাসিকের তুলনায় রাজস্ব বৃদ্ধি পেয়েছে 3%"; প্রাসঙ্গিক পুনরুদ্ধার আগে থেকে বোঝায় যে এটি একটি নির্দিষ্ট কোম্পানির Q2 ফাইলিং থেকে এসেছে, তাই সেই কোম্পানি এবং কোয়ার্টারের নামকরণের একটি অনুসন্ধান এটি খুঁজে পায়।

একটি কর্মচারী হ্যান্ডবুকে, "এটি 90 দিন পরে প্রযোজ্য" বলে একটি অংশ একটি উপসর্গ লাভ করে যা ব্যাখ্যা করে যে এটি দূরবর্তী কাজের যোগ্যতার বিভাগ থেকে এসেছে।

একটি সফ্টওয়্যার ডকুমেন্টেশন সহকারী প্রসঙ্গ যোগ করে উল্লেখ করে যে একটি কনফিগারেশন খণ্ড একটি API এর সংস্করণ 3 এর অন্তর্গত, সংস্করণ 2 থেকে অনুরূপ পাঠ্যের সাথে বিভ্রান্তি হ্রাস করে।

একটি সমর্থন জ্ঞান বেস উপসর্গ সমস্যা সমাধানের অংশগুলিকে তারা কভার করা পণ্য মডেলের সাথে যুক্ত করে, তাই একটি মডেল সম্পর্কে প্রশ্নগুলি অন্যটির জন্য পদক্ষেপগুলি পুনরুদ্ধার করা বন্ধ করে দেয়।

ঝুঁকি এবং প্রহরী

  • একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

  • অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

  • সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

  1. বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

  2. বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

  3. ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

  4. স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Contextual Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

প্রাসঙ্গিক পুনরুদ্ধার কি?

প্রাসঙ্গিক পুনরুদ্ধার হল একটি RAG কৌশল যা প্রতিটি খণ্ডের জন্য একটি সংক্ষিপ্ত, ডকুমেন্ট-সচেতন ব্যাখ্যা তৈরি করে কিওয়ার্ড অনুসন্ধানের জন্য এমবেড করা এবং সূচীকরণ করার আগে, তাই একটি খণ্ডটি নিজে থেকেই পড়ার সময় অর্থবোধ করে। এটি গুরুত্বপূর্ণ কারণ খণ্ডগুলি প্রায়শই তাদের নথি থেকে বিভক্ত হওয়ার সময় মূল তথ্য হারায়, যেমন তারা কোন কোম্পানি, পণ্য বা সময়কাল উল্লেখ করে এবং এই ক্ষতির ফলে পুনরুদ্ধারকারী সঠিক উত্তরণটি মিস করে।

প্রাসঙ্গিক পুনরুদ্ধার কোন সমস্যা সমাধান করে?

বিভক্ত করা আশেপাশের প্রসঙ্গকে সরিয়ে দেয়, তাই একটি বিচ্ছিন্ন অংশে কোনো প্রশ্ন জিজ্ঞাসা করা সত্তা বা সময়কাল উল্লেখ নাও করতে পারে।

প্রতিটি খণ্ডের জন্য প্রসঙ্গ কীভাবে তৈরি হয়?

মডেলটিকে সম্পূর্ণ নথি এবং খণ্ডটি দেওয়া হয় এবং একটি সংক্ষিপ্ত প্রসঙ্গ প্রদান করে যা নথির মধ্যে অংশটিকে রাখে।

কোন দুটি সূচক Anthropic এর পদ্ধতিতে প্রাসঙ্গিক খণ্ড পাঠ গ্রহণ করে?

পদ্ধতিটি প্রাসঙ্গিক এম্বেডিং এবং প্রাসঙ্গিক BM25 ব্যবহার করে, তারপর তাদের ফলাফলগুলিকে একত্রিত করে।

Anthropic-এর রিপোর্ট করা পরীক্ষা অনুসারে, প্রাসঙ্গিক এম্বেডিং এবং প্রাসঙ্গিক BM25 শীর্ষ-20 পুনরুদ্ধার ব্যর্থতাকে মোটামুটি কতটা কমিয়েছে?

Anthropic একটি 49 শতাংশ হ্রাস সম্পর্কে রিপোর্ট করেছে, যা পুনরায় র‌্যাঙ্কিংয়ের সাথে প্রায় 67 শতাংশে উন্নীত হয়েছে। অন্যান্য ডেটার ফলাফল ভিন্ন হতে পারে।

কেন প্রম্পট ক্যাশিং প্রাসঙ্গিক পুনরুদ্ধার সস্তা করে তোলে?

প্রতিটি খণ্ডের কল সম্পূর্ণ নথি অন্তর্ভুক্ত; ভাগ করা উপসর্গ ক্যাশে বারবার সম্পূর্ণ মূল্য পরিশোধ করা এড়িয়ে যায়।

শিখতে থাকুন

সম্পর্কিত গাইড

এই বিষয়ের জন্য বাছাই করা আরও গাইড