BM25 และการดึงคำศัพท์
BM25 เป็นฟังก์ชันการจัดอันดับตามคำหลักแบบคลาสสิก ซึ่งจะให้คะแนนเอกสารตามความถี่ที่คำค้นหาปรากฏขึ้น ปรับตามความหายากของคำ และความยาวของเอกสาร
ภาพรวม
Decades old, it remains a remarkably strong and ubiquitous baseline for search.
เจาะลึก
BM25 (การจับคู่ที่ดีที่สุด 25) เป็นฟังก์ชันการจัดอันดับแบบกลุ่มคำจากกรอบ Okapi ที่น่าจะเป็นของทศวรรษ 1990 สำหรับคำค้นหาแต่ละคำจะรวมสัญญาณสามอย่าง: ความถี่ของคำ (ความถี่ที่คำนั้นปรากฏในเอกสาร โดยที่ผลตอบแทนลดลงซึ่งควบคุมโดยพารามิเตอร์ k1) ความถี่ของเอกสารผกผัน (คำที่หายากในคอลเลคชันมีจำนวนมากกว่า) และการทำให้เป็นมาตรฐานความยาวเอกสาร (พารามิเตอร์ b ดังนั้นเอกสารที่ยาวจึงไม่ได้รับความนิยมอย่างไม่ยุติธรรม) รวมคะแนนต่อภาคเรียนเหล่านี้แล้วคุณจะได้อันดับของเอกสาร ไม่จำเป็นต้องฝึกฝนและทำงานเร็วมากผ่านดัชนีแบบกลับด้าน ซึ่งเป็นเหตุผลว่าทำไมเสิร์ชเอ็นจิ้นอย่าง Elasticsearch และ Lucene จึงใช้มันเป็นค่าเริ่มต้น แม้ว่าการดึงข้อมูลระบบประสาทจะเพิ่มขึ้น แต่ BM25 ก็ยังคงชนะหรือเชื่อมโยงกับเกณฑ์มาตรฐานหลายประการ โดยเฉพาะอย่างยิ่งสำหรับคำที่หายาก ตัวระบุที่แน่นอน และการสืบค้นนอกโดเมน
ข้อมูลเชิงลึกทางเทคนิค
องค์ประกอบความถี่ของคำของ BM25 อิ่มตัว: พารามิเตอร์ k1 จะจำกัดจำนวนคำที่ซ้ำกันเพื่อเพิ่มคะแนน ดังนั้นคำที่ปรากฏ 50 ครั้งจึงไม่มีความเกี่ยวข้องมากกว่าหนึ่งครั้งถึง 50 เท่า พารามิเตอร์ b ผสมผสานความถี่ดิบและความถี่ที่ทำให้เป็นมาตรฐานตามความยาว IDF ลดน้ำหนักคำทั่วไปเช่น 'the' และให้รางวัลคำที่มีลักษณะเฉพาะ เนื่องจากทำงานโดยใช้ดัชนีแบบกลับหัวซึ่งแมปแต่ละคำกับรายการเอกสาร การให้คะแนนจึงสัมผัสเฉพาะเอกสารที่มีเงื่อนไขการสืบค้นเท่านั้น ทำให้มีประสิทธิภาพอย่างยิ่ง
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ
เข้าถึงและเข้าถึง
ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร
การตัดสินใจที่ชัดเจนยิ่งขึ้น
ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ
อนาคตของ BM25 และการดึงคำศัพท์
BM25 ไม่น่าจะหายไป; แต่กลับจับคู่กับวิธีการทางประสาทมากขึ้นในการดึงข้อมูลแบบผสม โดยที่คะแนนคำศัพท์และคะแนนหนาแน่นถูกหลอมรวมเข้าด้วยกัน (มักผ่านการหลอมรวมอันดับซึ่งกันและกัน) แบบจำลองกระจัดกระจายที่เรียนรู้ เช่น SPLADE ผสมผสานความกระจัดกระจายแบบ BM25 กับการถ่วงน้ำหนักระยะประสาท และ BM25 มักทำหน้าที่เป็นตัวดึงข้อมูลระยะแรก ก่อนที่จะจัดลำดับใหม่ของระบบประสาท ความเร็ว การตีความได้ และต้นทุนการฝึกอบรมเป็นศูนย์รับประกันบทบาทที่ยั่งยืนในการค้นหาการผลิต
การใช้งานจริงในโลกแห่งความเป็นจริง
การจัดอันดับความเกี่ยวข้องเริ่มต้นใน Elasticsearch, OpenSearch และ Apache Lucene/Solr
การดึงข้อมูลผู้สมัครในระยะแรกซึ่งจะป้อนการจัดเรียงใหม่ของระบบประสาทที่ช้าลงในการค้นหาแบบสองขั้นตอน
การค้นหาโค้ดและบันทึกโดยที่ตัวระบุและรหัสข้อผิดพลาดต้องตรงกันทุกประการ
ขุดตัวอย่างเชิงลบอย่างหนักเพื่อฝึกสุนัขพันธุ์หนาแน่นเช่น DPR
ความเสี่ยงและรั้ว
ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ
ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน
ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ
แผนงานการดำเนินงาน
กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว
การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ
รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง
ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the BM25 and Lexical Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การดึงข้อมูลปฏิสัมพันธ์ล่าช้าของ ColBERT
คำถามที่พบบ่อย
What is BM25 and Lexical Retrieval?
BM25 เป็นฟังก์ชันการจัดอันดับตามคำหลักแบบคลาสสิก ซึ่งจะให้คะแนนเอกสารตามความถี่ที่คำค้นหาปรากฏขึ้น ปรับตามความหายากของคำ และความยาวของเอกสาร มีอายุหลายทศวรรษ แต่ยังคงเป็นพื้นฐานสำหรับการค้นหาที่แข็งแกร่งและแพร่หลายอย่างน่าทึ่ง
BM25 ใช้เพื่อจัดอันดับเอกสารเป็นหลักอย่างไร
BM25 รวมความถี่ของคำศัพท์ ความถี่ของเอกสารผกผัน (ความหายากของคำศัพท์) และการทำให้ความยาวเอกสารเป็นมาตรฐานให้เป็นคะแนนความเกี่ยวข้อง
ความถี่ของเอกสารผกผัน (IDF) มีบทบาทอย่างไรใน BM25
IDF ให้รางวัลคำศัพท์ที่ไม่ค่อยพบในคอลเลกชันและลดน้ำหนักคำทั่วไป เนื่องจากการจับคู่ที่หายากจะให้ความรู้มากกว่า
เหตุใด BM25 จึงใช้การปรับมาตรฐานความยาวเอกสาร (พารามิเตอร์ b)
หากไม่มีการทำให้เป็นมาตรฐาน เอกสารที่ยาวขึ้นจะสะสมการจับคู่ระยะยาวมากขึ้น พารามิเตอร์ b จะปรับความยาวเพื่อให้การเปรียบเทียบมีความยุติธรรม
โครงสร้างข้อมูลใดที่ทำให้ BM25 ทำงานได้รวดเร็วในวงกว้าง
ดัชนีแบบกลับด้านช่วยให้ BM25 ให้คะแนนเฉพาะเอกสารที่มีเงื่อนไขการสืบค้น ทำให้การดึงข้อมูลมีประสิทธิภาพมาก