ভাষা এআই গাইড

BM25 এবং আভিধানিক পুনরুদ্ধার

BM25 হল ক্লাসিক কীওয়ার্ড-ভিত্তিক র‌্যাঙ্কিং ফাংশন যা ক্যোয়ারী পদগুলি কত ঘন ঘন দেখা যায়, শব্দের বিরলতা এবং নথির দৈর্ঘ্যের জন্য সামঞ্জস্য করে ডকুমেন্ট স্কোর করে।

2 মিনিট পঠিতসর্বশেষ আপডেট করা হয়েছে

ওভারভিউ

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

গভীর ডুব

BM25 (বেস্ট ম্যাচিং 25) হল 1990 এর দশকের সম্ভাব্য ওকাপি ফ্রেমওয়ার্ক থেকে একটি ব্যাগ-অফ-শব্দ র‌্যাঙ্কিং ফাংশন। প্রতিটি ক্যোয়ারী টার্মের জন্য এটি তিনটি সংকেতকে একত্রিত করে: শব্দ ফ্রিকোয়েন্সি (কত ঘন ঘন শব্দটি একটি নথিতে প্রদর্শিত হয়, একটি প্যারামিটার k1 দ্বারা নিয়ন্ত্রিত হ্রাসকারী রিটার্ন সহ), ইনভার্স ডকুমেন্ট ফ্রিকোয়েন্সি (সংগ্রহ জুড়ে বিরল শব্দগুলি বেশি গণনা করা হয়), এবং নথি-দৈর্ঘ্য স্বাভাবিককরণ (প্যারামিটার b, তাই দীর্ঘ নথিগুলি অন্যায়ভাবে অনুকূল হয় না)। এই প্রতি-মেয়াদী স্কোরগুলি যোগ করুন এবং আপনি নথির র‌্যাঙ্ক পাবেন। এটির কোন প্রশিক্ষণের প্রয়োজন নেই এবং উল্টানো সূচীগুলির মাধ্যমে খুব দ্রুত চলে, এই কারণেই ইলাস্টিকসার্চ এবং লুসিনের মতো সার্চ ইঞ্জিনগুলি ডিফল্টরূপে এটি ব্যবহার করে৷ স্নায়ু পুনরুদ্ধারের বৃদ্ধি সত্ত্বেও, BM25 এখনও অনেক বেঞ্চমার্কে জয়লাভ করে বা টাই করে, বিশেষ করে বিরল পদ, সঠিক শনাক্তকারী এবং ডোমেনের বাইরের প্রশ্নের জন্য।

প্রযুক্তিগত অন্তর্দৃষ্টি

BM25 এর টার্ম-ফ্রিকোয়েন্সি কম্পোনেন্ট স্যাচুরেট করে: k1 প্যারামিটার ক্যাপ করে যে কতটা পুনরাবৃত্তি করা শব্দ একটি স্কোর বাড়ায়, তাই 50 বার প্রদর্শিত শব্দটি একবারের চেয়ে 50x বেশি প্রাসঙ্গিক নয়। b প্যারামিটার কাঁচা এবং দৈর্ঘ্য-স্বাভাবিক ফ্রিকোয়েন্সি মিশ্রিত করে। আইডিএফ 'দ্য'-এর মতো সাধারণ শব্দের ওজন কমায় এবং স্বতন্ত্র শব্দগুলোকে পুরস্কৃত করে। কারণ এটি প্রতিটি শব্দকে তার নথির তালিকায় একটি উল্টানো সূচক ম্যাপিং করে কাজ করে, স্কোরিং শুধুমাত্র ক্যোয়ারী পদ সম্বলিত নথিতে স্পর্শ করে, এটি অত্যন্ত দক্ষ করে তোলে।

কৌশলগত প্রভাব

গতি এবং স্কেল

ভাষার কর্মপ্রবাহ ধারাবাহিকতাকে ত্যাগ না করে দ্রুত অগ্রসর হতে পারে।

অ্যাক্সেস এবং পৌঁছানো

এটি ভাষা এবং যোগাযোগ শৈলী জুড়ে অ্যাক্সেস প্রসারিত করে।

সুস্পষ্ট সিদ্ধান্ত

অটোমেশন পুনরাবৃত্তি পরিচালনা করার সময় দলগুলি বিচারে আরও বেশি সময় ব্যয় করতে পারে।

BM25 এবং আভিধানিক পুনরুদ্ধারের ভবিষ্যত

BM25 অদৃশ্য হওয়ার সম্ভাবনা নেই; পরিবর্তে এটি হাইব্রিড পুনরুদ্ধারের স্নায়ু পদ্ধতির সাথে ক্রমবর্ধমানভাবে যুক্ত হচ্ছে, যেখানে আভিধানিক এবং ঘন স্কোরগুলি একত্রিত হয় (প্রায়শই পারস্পরিক র‌্যাঙ্ক ফিউশনের মাধ্যমে)। SPLADE-এর মতো স্প্যার্স মডেলগুলি BM25-শৈলীর স্প্যার্সিটিকে নিউরাল টার্ম ওয়েটিং এর সাথে মিশ্রিত করে, এবং BM25 প্রায়শই নিউরাল রিরেঙ্কারের আগে প্রথম-পর্যায়ের পুনরুদ্ধার হিসাবে কাজ করে। এর গতি, ব্যাখ্যাযোগ্যতা এবং শূন্য প্রশিক্ষণ খরচ উত্পাদন অনুসন্ধানে একটি স্থায়ী ভূমিকার গ্যারান্টি দেয়।

বাস্তব-বিশ্ব বাস্তবায়ন

Elasticsearch, OpenSearch, এবং Apache Lucene/Solr-এ ডিফল্ট প্রাসঙ্গিকতা র‌্যাঙ্কিং

প্রথম-পর্যায়ের প্রার্থী পুনরুদ্ধার যা দুই-পর্যায়ের অনুসন্ধানে একটি ধীর স্নায়ু পুনরুদ্ধার করে

কোড এবং লগ অনুসন্ধান যেখানে সঠিক শনাক্তকারী এবং ত্রুটি কোড অবিকল মেলে

DPR এর মত ঘন পুনরুদ্ধারকারীদের প্রশিক্ষণের জন্য কঠিন নেতিবাচক উদাহরণ খনির

ঝুঁকি এবং প্রহরী

হ্যালুসিনেটেড ফ্যাক্টগুলি শান্তভাবে রিপোর্ট, সমর্থন প্রবাহ, বা গবেষণা আউটপুট প্রবেশ করতে পারে।

প্রম্পট সংবেদনশীলতা অনুরূপ অনুরোধ জুড়ে অসামঞ্জস্যপূর্ণ ফলাফল তৈরি করতে পারে।

অ্যাক্সেস কন্ট্রোল দুর্বল হলে সংবেদনশীল পাঠ্য ডেটা উন্মুক্ত হতে পারে।

বাস্তবায়ন রোডম্যাপ

1

রোলআউট করার আগে আউটপুট ফর্ম্যাট, টোন এবং মানের মান নির্ধারণ করুন।

2

যখনই নির্ভুলতা গুরুত্বপূর্ণ তখন বিশ্বস্ত উত্সের সাথে গ্রাউন্ড প্রতিক্রিয়া।

3

উচ্চ-স্টেকের আউটপুটগুলির জন্য একটি মানব পর্যালোচনা চেকপয়েন্ট রাখুন।

4

ব্যর্থতার নিদর্শনগুলি ট্র্যাক করুন এবং প্রম্পট বা ওয়ার্কফ্লোগুলিকে নিয়মিতভাবে পুনরায় প্রশিক্ষণ দিন।

অন্বেষণ চালিয়ে যান

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

কুইজ শুরু করুন

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

পরবর্তী গাইড

ColBERT দেরী মিথস্ক্রিয়া পুনরুদ্ধার

প্রায়শই জিজ্ঞাসিত প্রশ্নাবলী

What is BM25 and Lexical Retrieval?

BM25 হল ক্লাসিক কীওয়ার্ড-ভিত্তিক র‌্যাঙ্কিং ফাংশন যা ক্যোয়ারী পদগুলি কত ঘন ঘন দেখা যায়, শব্দের বিরলতা এবং নথির দৈর্ঘ্যের জন্য সামঞ্জস্য করে ডকুমেন্ট স্কোর করে। কয়েক দশক পুরানো, এটি অনুসন্ধানের জন্য একটি উল্লেখযোগ্যভাবে শক্তিশালী এবং সর্বব্যাপী বেসলাইন হিসাবে রয়ে গেছে।

BM25 প্রাথমিকভাবে নথি র‌্যাঙ্ক করার জন্য কী ব্যবহার করে?

BM25 একটি প্রাসঙ্গিক স্কোরে টার্ম ফ্রিকোয়েন্সি, ইনভার্স ডকুমেন্ট ফ্রিকোয়েন্সি (টার্ম রেরিটি) এবং ডকুমেন্ট-লেংথ নরমালাইজেশনকে একত্রিত করে।

বিএম25-এ ইনভার্স ডকুমেন্ট ফ্রিকোয়েন্সি (আইডিএফ) কী ভূমিকা পালন করে?

IDF পুরষ্কারের শর্তাবলী যা সংগ্রহে বিরল এবং কম ওজনের সাধারণ শব্দ, যেহেতু বিরল ম্যাচগুলি আরও তথ্যপূর্ণ।

কেন BM25 নথি-দৈর্ঘ্য স্বাভাবিককরণ (b প্যারামিটার) প্রয়োগ করে?

স্বাভাবিকীকরণ ছাড়া, দীর্ঘ নথি আরও মেয়াদী ম্যাচ জমা হবে; b প্যারামিটার দৈর্ঘ্যের জন্য সামঞ্জস্য করে তাই তুলনা ন্যায্য।

কোন ডেটা স্ট্রাকচার BM25কে স্কেলে দ্রুত করে তোলে?

একটি ইনভার্টেড ইনডেক্স BM25 শুধুমাত্র ডকুমেন্ট স্কোর করতে দেয় যেগুলিতে ক্যোয়ারী টার্ম রয়েছে, যা পুনরুদ্ধারকে খুব দক্ষ করে তোলে।