PANDUAN AI Bahasa

BM25 dan Pengambilan Leksikal

BM25 adalah fungsi pemeringkatan berbasis kata kunci klasik yang menilai dokumen berdasarkan seberapa sering istilah kueri muncul, disesuaikan dengan kelangkaan istilah dan panjang dokumen.

2 min readTerakhir diperbarui

Ikhtisar

Decades old, it remains a remarkably strong and ubiquitous baseline for search.

Menyelam Lebih Dalam

BM25 (Pencocokan Terbaik 25) adalah fungsi pemeringkatan sekantong kata dari kerangka kerja probabilistik Okapi pada tahun 1990-an. Untuk setiap istilah kueri, ini menggabungkan tiga sinyal: frekuensi istilah (seberapa sering kata muncul dalam dokumen, dengan hasil yang semakin berkurang dikontrol oleh parameter k1), frekuensi dokumen terbalik (kata-kata yang lebih jarang di seluruh koleksi dihitung lebih banyak), dan normalisasi panjang dokumen (parameter b, sehingga dokumen yang panjang tidak disukai secara tidak adil). Jumlahkan skor per semester ini dan Anda mendapatkan peringkat dokumen tersebut. Itu tidak memerlukan pelatihan dan berjalan sangat cepat melalui indeks terbalik, itulah sebabnya mesin pencari seperti Elasticsearch dan Lucene menggunakannya secara default. Meskipun terdapat peningkatan dalam pengambilan saraf, BM25 masih unggul atau setara dalam banyak tolok ukur, terutama untuk istilah langka, pengidentifikasi tepat, dan kueri di luar domain.

Wawasan Teknis

Komponen frekuensi istilah BM25 jenuh: parameter k1 membatasi jumlah kata yang diulang meningkatkan skor, sehingga istilah yang muncul 50 kali tidak 50x lebih relevan dari satu kali. Parameter b memadukan frekuensi mentah dan frekuensi yang dinormalisasi panjang. IDF mengurangi kata-kata umum seperti 'the' dan memberi penghargaan pada kata-kata yang berbeda. Karena beroperasi pada indeks terbalik yang memetakan setiap kata ke daftar dokumennya, penilaian hanya menyentuh dokumen yang berisi istilah kueri, sehingga sangat efisien.

Dampak Strategis

Kecepatan dan skala

Alur kerja bahasa dapat berjalan lebih cepat tanpa mengorbankan konsistensi.

Access and reach

Ini memperluas akses lintas bahasa dan gaya komunikasi.

Clearer decisions

Tim dapat menghabiskan lebih banyak waktu untuk melakukan penilaian sementara otomatisasi menangani pengulangan.

Masa Depan BM25 dan Pengambilan Leksikal

BM25 kemungkinan besar tidak akan hilang; sebaliknya, metode ini semakin dipasangkan dengan metode saraf dalam pengambilan hibrid, yang menggabungkan skor leksikal dan skor padat (seringkali melalui fusi peringkat timbal balik). Model renggang yang dipelajari seperti SPLADE memadukan ketersebaran gaya BM25 dengan pembobotan istilah saraf, dan BM25 sering kali berfungsi sebagai pengambil tahap pertama sebelum pemeringkatan ulang saraf. Kecepatan, kemampuan interpretasi, dan biaya pelatihan nol menjamin peran yang bertahan lama dalam pencarian produksi.

Implementasi Dunia Nyata

Peringkat relevansi default di Elasticsearch, OpenSearch, dan Apache Lucene/Solr

Pengambilan kandidat tahap pertama yang memberi masukan pada pemeringkatan ulang saraf yang lebih lambat dalam pencarian dua tahap

Pencarian kode dan log di mana pengidentifikasi dan kode kesalahan yang tepat harus sama persis

Menambang contoh-contoh negatif yang sulit untuk melatih anjing retriever padat seperti DPR

Risiko & Pagar Pembatas

Fakta-fakta yang dihalusinasi dapat secara diam-diam masuk ke dalam laporan, aliran dukungan, atau keluaran penelitian.

Sensitivitas yang cepat dapat menimbulkan hasil yang tidak konsisten pada permintaan serupa.

Data teks sensitif mungkin terekspos jika kontrol akses lemah.

Peta Jalan Implementasi

1

Tentukan format output, nada, dan standar kualitas sebelum peluncuran.

2

Dasarkan respons dengan sumber tepercaya kapan pun akurasi penting.

3

Pertahankan pos pemeriksaan tinjauan manusia untuk keluaran berisiko tinggi.

4

Lacak pola kegagalan dan latih kembali perintah atau alur kerja secara teratur.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the BM25 and Lexical Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Pengambilan Interaksi Terlambat ColBERT

Pertanyaan yang sering diajukan

What is BM25 and Lexical Retrieval?

BM25 adalah fungsi pemeringkatan berbasis kata kunci klasik yang menilai dokumen berdasarkan seberapa sering istilah kueri muncul, disesuaikan dengan kelangkaan istilah dan panjang dokumen. Berusia puluhan tahun, ini masih menjadi dasar pencarian yang sangat kuat dan ada di mana-mana.

Apa yang terutama digunakan BM25 untuk menentukan peringkat dokumen?

BM25 menggabungkan frekuensi istilah, frekuensi dokumen terbalik (kelangkaan istilah), dan normalisasi panjang dokumen menjadi skor relevansi.

Apa peran frekuensi dokumen terbalik (IDF) di BM25?

IDF memberi penghargaan pada istilah-istilah yang jarang ditemukan di seluruh koleksi dan mengurangi kata-kata umum, karena kecocokan yang jarang terjadi lebih informatif.

Mengapa BM25 menerapkan normalisasi panjang dokumen (parameter b)?

Tanpa normalisasi, dokumen yang lebih panjang akan menghasilkan lebih banyak kecocokan istilah; parameter b menyesuaikan panjangnya sehingga perbandingannya adil.

Struktur data apa yang membuat BM25 cepat dalam skala besar?

Indeks terbalik memungkinkan BM25 menilai hanya dokumen yang berisi istilah kueri, sehingga pengambilan menjadi sangat efisien.