প্রযুক্তিগত গাইড

ক্যোয়ারী পুনর্লিখন এবং বহু-কোয়েরি পুনরুদ্ধার

ক্যোয়ারী রিরাইটিং এবং মাল্টি-কোয়েরি পুনরুদ্ধার হল RAG কৌশল যা ব্যবহারকারীর প্রশ্নকে অনুসন্ধানের আগে রূপান্তরিত করে, এটিকে রিফ্রেস করে, এটিকে উপ-প্রশ্নগুলিতে ভেঙে দেয়, বা বিভিন্ন রূপ তৈরি করে এবং তাদের ফলাফলগুলি একত্রিত করে।

  • 3 মিনিট পড়া হয়েছে
  • সর্বশেষ আপডেট করা হয়েছে
এই পৃষ্ঠায়3 মিনিট পড়া হয়েছে
  1. ওভারভিউ
  2. গভীর ডুব
  3. কৌশলগত প্রভাব
  4. ক্যোয়ারী রিরাইটিং এবং মাল্টি-কোয়েরি পুনরুদ্ধারের ভবিষ্যত
  5. বাস্তব-বিশ্ব বাস্তবায়ন
  6. ঝুঁকি এবং প্রহরী
  7. বাস্তবায়ন রোডম্যাপ
  8. অন্বেষণ চালিয়ে যান
  9. প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ওভারভিউ

এগুলি গুরুত্বপূর্ণ কারণ ব্যবহারকারীরা প্রায়শই অস্পষ্ট, কথোপকথনমূলক বা বহু-অংশের প্রশ্নগুলি জিজ্ঞাসা করে যার শব্দগুলি নথির সাথে মেলে না এবং একটি ভাল ক্যোয়ারী প্রাসঙ্গিক প্যাসেজগুলিকে একক আক্ষরিক অনুসন্ধান মিস করতে পারে৷

গভীর ডুব

পুনরুদ্ধারের মান কোয়েরির উপর ব্যাপকভাবে নির্ভর করে। ব্যবহারকারীরা সংক্ষিপ্ত, অস্পষ্ট বা কথোপকথনমূলক প্রশ্ন লেখেন, যখন নথিগুলি তাদের নিজস্ব শব্দভাণ্ডার ব্যবহার করে। অনুসন্ধানের আগে ক্যোয়ারী রূপান্তর সেই ফাঁকটি বন্ধ করে দেয়। সহজতম ফর্মটি হল পুনর্লিখন: একটি LLM ব্যবহারকারীর বার্তাটিকে একটি পরিষ্কার অনুসন্ধান ক্যোয়ারীতে পরিণত করে৷ মাল্টি-টার্ন চ্যাটে এটি অপরিহার্য, যেখানে ফলো-আপ যেমন "এবং 2023 সালে?" ইতিহাস ছাড়া কিছুই বোঝায় না, তাই সিস্টেমটি কথোপকথনকে একটি স্বতন্ত্র প্রশ্নে ঘনীভূত করে। পচন একটি জটিল প্রশ্নকে উপ-প্রশ্নগুলিতে বিভক্ত করে যা আলাদাভাবে পুনরুদ্ধার করা যেতে পারে, তুলনা বা মাল্টি-হপ প্রশ্নের জন্য দরকারী। 2023 সালে Google DeepMind গবেষকদের দ্বারা বর্ণিত স্টেপ-ব্যাক প্রম্পটিং, ব্যাকগ্রাউন্ড নীতিগুলি পুনরুদ্ধার করার জন্য প্রথমে একটি আরও সাধারণ প্রশ্ন জিজ্ঞাসা করে। বহু-কোয়েরি পুনরুদ্ধার প্রশ্নের বিভিন্ন রূপ তৈরি করে, প্রতিটির জন্য একটি অনুসন্ধান চালায় এবং ফলাফলগুলিকে একত্রিত করে। LangChain এটিকে এর MultiQueryRetriever এর মাধ্যমে জনপ্রিয় করেছে। RAG-ফিউশন রেসিপ্রোকাল র‌্যাঙ্ক ফিউশন (RRF) এর সাথে একাধিক প্রশ্ন একত্রিত করে, 2009 সালে কর্ম্যাক, ক্লার্ক এবং বুয়েটচার দ্বারা বর্ণিত একটি পদ্ধতি, যা ফলাফল তালিকা জুড়ে 1/(k + র‌্যাঙ্ক) যোগ করে প্রতিটি নথির স্কোর করে। তুলনামূলক কাঁচা স্কোরের প্রয়োজন ছাড়াই বেশ কয়েকটি তালিকায় উচ্চতর দস্তাবেজগুলি শীর্ষে উঠে যায়। একটি সম্পর্কিত কৌশল, HyDE (Hypothetical Document Embeddings, Gao and colleagues, 2022), মডেলটিতে একটি অনুমানমূলক উত্তর লেখা আছে এবং প্রশ্নের পরিবর্তে এটি এম্বেড করা হয়েছে, কারণ একটি উত্তর-আকৃতির পাঠ্য প্রায়শই এমবেডিং স্পেসে বাস্তব উত্তর প্যাসেজের কাছাকাছি থাকে। ভুল ধারণা: আরও প্রশ্ন সবসময় ভাল হয় না। প্রতিটি ভেরিয়েন্ট লেটেন্সি এবং খরচ যোগ করে, এবং খারাপভাবে জেনারেট করা ভেরিয়েন্ট অপ্রাসঙ্গিক নথিতে টানতে, ব্যবহারকারীর অভিপ্রায় থেকে সরে যেতে পারে। পুনর্লিখনও তারিখ বা পণ্যের নামগুলির মতো গুরুত্বপূর্ণ সীমাবদ্ধতাগুলিকে বাদ দিতে পারে। এই পদক্ষেপগুলি অবলম্বন করার আগে বাস্তব প্রশ্নগুলিতে প্রত্যাহার এবং উত্তরের গুণমান পরিমাপ করুন।

কৌশলগত প্রভাব

খরচ ও বাজেট

আর্কিটেকচারের সিদ্ধান্তগুলি বছরের পর বছর ধরে কর্মক্ষমতা এবং অপারেটিং খরচ চালায়।

সুস্পষ্ট সিদ্ধান্ত

কারিগরি শিক্ষা দলগুলোকে সঠিক স্ট্যাক বেছে নিতে সাহায্য করে, শুধু নতুনটি নয়।

মান নিয়ন্ত্রণ

ভালো ইঞ্জিনিয়ারিং পছন্দ উৎপাদনে নির্ভরযোগ্যতার ঘটনা কমিয়ে দেয়।

ক্যোয়ারী রিরাইটিং এবং মাল্টি-কোয়েরি পুনরুদ্ধারের ভবিষ্যত

এজেন্টিক RAG ছড়িয়ে পড়ার সাথে সাথে, ক্যোয়ারী ট্রান্সফরমেশন ক্রমবর্ধমানভাবে পরিচালিত হয় মডেল দ্বারা সিদ্ধান্ত নেওয়ার জন্য যে কী অনুসন্ধান করতে হবে, ফলাফলগুলি যখন দুর্বল দেখায় তখন পুনরাবৃত্তি করে, একটি নির্দিষ্ট পুনর্লিখন পদক্ষেপের পরিবর্তে। এটি অন্তর্নিহিত ধারণা, পচন, রূপ এবং ফিউশনকে আরও গুরুত্বপূর্ণ করে তোলে যদিও সেগুলি কম দৃশ্যমান হয়। এমবেডিং মডেল এবং হাইব্রিড অনুসন্ধানের উন্নতি কিছু শব্দভান্ডারের অমিল কমায় কিন্তু অস্পষ্ট বা কথোপকথনমূলক প্রশ্নগুলি স্পষ্ট করার প্রয়োজনীয়তা দূর করে না। প্রত্যাশা করুন যে দলগুলি বেছে বেছে এই কৌশলগুলি ব্যবহার করবে, যখন একটি প্রশ্ন জটিল দেখায় বা প্রাথমিক পুনরুদ্ধার দুর্বল বলে ট্রিগার হয়, খরচের সাথে গুণমানের ভারসাম্য বজায় রাখতে।

বাস্তব-বিশ্ব বাস্তবায়ন

একটি চ্যাট সহকারী, ফলো-আপ "খন্ডকালীন কর্মীদের জন্য কি?" পূর্ববর্তী কথোপকথন ব্যবহার করে "অংশকালীন কর্মচারীদের জন্য পিতামাতার ছুটির নীতি" এর মতো একটি স্বতন্ত্র প্রশ্নে পুনরায় লেখা হয়।

দুটি ক্লাউড প্রদানকারীর মূল্যের তুলনামূলক একটি প্রশ্ন প্রতিটি প্রদানকারীর জন্য পৃথক অনুসন্ধানে বিভক্ত হয় এবং উত্তর দেওয়ার আগে ফলাফলগুলি একত্রিত করা হয়।

একটি সমর্থন বট "আমার অ্যাপ আমাকে লগ আউট করে রাখে" এর চারটি বাক্যাংশ তৈরি করে, যার মধ্যে সেশনের মেয়াদ শেষ হওয়া এবং টোকেন রিফ্রেশের মতো প্রযুক্তিগত পদগুলি রয়েছে এবং ফলাফলগুলিকে পারস্পরিক র‌্যাঙ্ক ফিউশনের সাথে ফিউজ করে৷

একজন গবেষণা সহকারী প্রথমে একটি সংকীর্ণ প্রশ্নের পিছনে সাধারণ নীতি অনুসন্ধান করার জন্য ধাপে-ব্যাক প্রম্পটিং ব্যবহার করে, তারপর নির্দিষ্ট বিবরণ পুনরুদ্ধার করে, মডেলটিকে পটভূমি এবং সুনির্দিষ্ট উভয়ই দেয়।

ঝুঁকি এবং প্রহরী

  • একটি বেঞ্চমার্ক অপ্টিমাইজ করা বৃহত্তর সিস্টেম দুর্বলতা আড়াল করতে পারে।

  • অবকাঠামো এবং রক্ষণাবেক্ষণের খরচ প্রায়ই অবমূল্যায়ন করা হয়।

  • সিস্টেমগুলি আরও জটিল হওয়ার সাথে সাথে সুরক্ষা এবং পর্যবেক্ষণযোগ্যতার ফাঁক বাড়তে পারে।

বাস্তবায়ন রোডম্যাপ

  1. বাস্তবায়নের আগে বিলম্ব, গুণমান এবং খরচের লক্ষ্য নির্ধারণ করুন।

  2. বাস্তবসম্মত লোড এবং ডেটা অবস্থার অধীনে বেঞ্চমার্ক।

  3. ত্রুটি, প্রবাহ, এবং ব্যবহারকারীর প্রভাবের জন্য যন্ত্র পর্যবেক্ষণ।

  4. স্কেল করার আগে রোলব্যাক এবং ঘটনার প্রতিক্রিয়া পাথ প্রস্তুত করুন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

ক্যোয়ারী রিরাইটিং এবং মাল্টি-কোয়েরি পুনরুদ্ধার কি?

ক্যোয়ারী রিরাইটিং এবং মাল্টি-কোয়েরি পুনরুদ্ধার হল RAG কৌশল যা ব্যবহারকারীর প্রশ্নকে অনুসন্ধানের আগে রূপান্তরিত করে, এটিকে রিফ্রেস করে, এটিকে উপ-প্রশ্নগুলিতে ভেঙে দেয়, বা বিভিন্ন রূপ তৈরি করে এবং তাদের ফলাফলগুলি একত্রিত করে। এগুলি গুরুত্বপূর্ণ কারণ ব্যবহারকারীরা প্রায়শই অস্পষ্ট, কথোপকথনমূলক বা বহু-অংশের প্রশ্নগুলি জিজ্ঞাসা করে যার শব্দগুলি নথির সাথে মেলে না এবং একটি ভাল ক্যোয়ারী প্রাসঙ্গিক প্যাসেজগুলিকে একক আক্ষরিক অনুসন্ধান মিস করতে পারে৷

মাল্টি-টার্ন চ্যাটে প্রশ্ন পুনর্লিখন কেন বিশেষভাবে গুরুত্বপূর্ণ?

একটি ফলো-আপ যেমন "এবং 2023 সালে?" একটি দরকারী স্বতন্ত্র ক্যোয়ারী হওয়ার জন্য কথোপকথনের ইতিহাস প্রয়োজন৷

কোন কৌশলটি তুলনা করা প্রতিটি আইটেমের জন্য পৃথক অনুসন্ধানে একটি তুলনা প্রশ্নকে বিভক্ত করে?

পচন জটিল বা বহু-অংশের প্রশ্নগুলিকে আলাদাভাবে পুনরুদ্ধার করা উপ-প্রশ্নগুলিতে বিভক্ত করে।

স্টেপ-ব্যাক প্রম্পটিং কি করে?

Google DeepMind গবেষকদের কাছ থেকে স্টেপ-ব্যাক প্রম্পটিং, নির্দিষ্ট করার আগে সাধারণ পটভূমি পুনরুদ্ধার করে।

পারস্পরিক র‌্যাঙ্ক ফিউশনে, কীভাবে একটি নথির স্কোর গণনা করা হয়?

RRF ডকুমেন্ট ধারণকারী প্রতিটি তালিকার উপর 1/(k + র‌্যাঙ্ক) যোগ করে, বেশ কয়েকটি তালিকায় পুরস্কৃত নথিগুলিকে উচ্চ স্থান দেওয়া হয়।

কেন RRF ভেক্টর অনুসন্ধান এবং BM25 ফলাফল মার্জ করার জন্য সুবিধাজনক?

কারণ RRF শুধুমাত্র র‌্যাঙ্ক পজিশন ব্যবহার করে, এটি সেই তালিকাগুলিকে একত্রিত করতে পারে যার কাঁচা স্কোর তুলনাযোগ্য নয়।

শিখতে থাকুন

সম্পর্কিত গাইড

এই বিষয়ের জন্য বাছাই করা আরও গাইড