คู่มือ AI ภาษา

ความเกี่ยวข้องส่วนเพิ่มสูงสุด

Maximum Marginal Relevance (MMR) เป็นวิธีการจัดอันดับใหม่ที่สร้างสมดุลระหว่างความเกี่ยวข้องของผลลัพธ์กับความแตกต่างจากผลลัพธ์ที่เลือกไว้แล้ว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because pure relevance ranking often returns near-duplicate passages that waste space in a RAG context window.

เจาะลึก

เมื่อระบบค้นหาให้คะแนนเอกสารตามความเกี่ยวข้องกับข้อความค้นหาเพียงอย่างเดียว ผลลัพธ์อันดับต้นๆ มักจะซ้ำซ้อน — มีข้อความห้าข้อความที่พูดสิ่งเดียวกันทั้งหมด MMR ซึ่งแนะนำโดย Carbonell และ Goldstein ในปี 1998 แก้ไขปัญหานี้โดยเลือกผลลัพธ์ทีละรายการ ในแต่ละขั้นตอน ระบบจะเลือกตัวเลือกที่จะเพิ่มการผสมผสานแบบถ่วงน้ำหนักให้ได้สูงสุด โดย lambda คูณความเกี่ยวข้องกับแบบสอบถาม ลบ (1 ลบ lambda) คูณความคล้ายคลึงสูงสุดกับสิ่งที่เลือกไว้แล้ว แลมบ์ดาที่อยู่ใกล้ 1 ให้ความสำคัญกับความเกี่ยวข้องอย่างแท้จริง ใกล้ 0 มันชอบความหลากหลาย ในยุคที่ดึงข้อมูลมาเสริม MMR ได้รับความนิยมในการดึงข้อมูลชุดข้อมูลที่หลากหลาย ดังนั้นโมเดลภาษาจึงเห็นหลักฐานเสริมแทนที่จะแสดงข้อเท็จจริงเดียวกันซ้ำ ปรับปรุงความครอบคลุมโดยไม่ต้องขยายบริบท

ข้อมูลเชิงลึกทางเทคนิค

MMR เป็นอัลกอริธึมที่โลภและวนซ้ำ ทั้งความเกี่ยวข้องและความคล้ายคลึงกันระหว่างเอกสารมักจะคำนวณเป็นความคล้ายคลึงโคไซน์ระหว่างเวกเตอร์ที่ฝัง สูตรการให้คะแนนคือ: MMR = argmax สำหรับเอกสารที่เหลือของ [ lambda * sim(doc, query) - (1 - lambda) * max sim(doc, Selected) ] เนื่องจากจะมีการประเมินใหม่กับชุดที่เลือกที่เพิ่มขึ้นในแต่ละรอบ จึงขึ้นอยู่กับลำดับและดำเนินการในการเปรียบเทียบความคล้ายคลึงกันประมาณ O(k*n) สำหรับการเลือก k รายการจากผู้สมัคร n ราย

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของความเกี่ยวข้องส่วนเพิ่มสูงสุด

MMR ยังคงเป็นค่าเริ่มต้นที่ไม่รุนแรงในไคลเอนต์ฐานข้อมูลเวกเตอร์ เช่น LangChain และ Chroma โดยที่มันถูกนำเสนอเป็นโหมดการดึงข้อมูลบรรทัดเดียว ระบบในอนาคตจะจับคู่กับวัตถุประสงค์การเรียนรู้ที่หลากหลายมากขึ้น การเลือกตามคลัสเตอร์ และตัวเข้ารหัสข้ามตัวจัดลำดับใหม่ที่ตัดสินความแปลกใหม่ในเชิงความหมายมากกว่าระยะทางโคไซน์ เมื่อหน้าต่างบริบทเติบโตขึ้น การเน้นเปลี่ยนจากการประหยัดพื้นที่ไปเป็นการรวบรวมหลักฐานเสริมอย่างแท้จริง โดยรักษาการเลือกที่คำนึงถึงความหลากหลาย เช่น MMR ให้มีความเกี่ยวข้องแม้ว่ากำลังการผลิตดิบจะมีมากมายก็ตาม

การใช้งานจริงในโลกแห่งความเป็นจริง

แชทบอต RAG ใช้การดึงข้อมูล MMR ดังนั้น 5 ส่วนแรกจึงครอบคลุมแง่มุมต่างๆ ของนโยบาย แทนที่จะเป็น 5 บทถอดความในย่อหน้าเดียวกัน

เครื่องมือสรุปการวิจัยใช้ MMR เพื่อเลือกข้อความที่ลดการทับซ้อนกัน ทำให้เกิดบทสรุปที่กว้างขึ้นและซ้ำกันน้อยลง

ผู้รวบรวมข่าวจัดอันดับบทความด้วย MMR เพื่อนำเสนอการรายงานข่าวที่หลากหลายของเหตุการณ์ แทนที่จะเป็นช่องทางสิบแห่งที่เล่าเรื่องลวดเรื่องเดียว

ตัวดึงข้อมูลร้านค้าเวกเตอร์ของ LangChain เปิดเผย search_type='mmr' ด้วย fetch_k และ lambda_mult เพื่อกระจายเอกสารที่ส่งคืน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Maximum Marginal Relevance quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การปราบปรามที่ไม่สูงสุด

คำถามที่พบบ่อย

What is Maximum Marginal Relevance?

Maximum Marginal Relevance (MMR) เป็นวิธีการจัดอันดับใหม่ที่สร้างสมดุลระหว่างความเกี่ยวข้องของผลลัพธ์กับความแตกต่างจากผลลัพธ์ที่เลือกไว้แล้ว เป็นเรื่องสำคัญเนื่องจากการจัดอันดับความเกี่ยวข้องอย่างแท้จริงมักจะส่งกลับข้อความที่เกือบจะซ้ำกันซึ่งทำให้เปลืองพื้นที่ในหน้าต่างบริบท RAG

ปัญหาหลัก MMR ได้รับการออกแบบมาเพื่อแก้ไขคืออะไร?

MMR กล่าวถึงแนวโน้มของการจัดอันดับที่เกี่ยวข้องเท่านั้นเพื่อแสดงผลลัพธ์จำนวนมากที่บอกว่าเป็นสิ่งเดียวกัน โดยให้รางวัลแก่สิ่งแปลกใหม่

ในสูตร MMR ค่าแลมบ์ดาใกล้ 1 เน้นย้ำถึงอะไร

ความเกี่ยวข้องของน้ำหนักแลมบ์ดา ใกล้ 1 คำว่าความเกี่ยวข้องมีอิทธิพลเหนือ ในขณะที่ใกล้ 0 คำว่าความหลากหลาย (ความคล้ายคลึงกันต่ำ) มีอิทธิพลเหนือ

MMR เลือกผลลัพธ์อย่างไร?

MMR เป็นวิธีการทำซ้ำอย่างละโมบ: การเลือกแต่ละครั้งจะเพิ่มความเกี่ยวข้องสูงสุด ลบด้วยความคล้ายคลึงสูงสุดกับรายการที่เลือกไว้แล้ว

การวัดความคล้ายคลึงแบบใดที่ใช้กันมากที่สุดภายใน MMR สำหรับการฝังข้อความ

ความคล้ายคลึงโคไซน์ระหว่างเวกเตอร์ที่ฝังเป็นตัวเลือกมาตรฐานสำหรับทั้งความเกี่ยวข้องของแบบสอบถามและการเปรียบเทียบระหว่างเอกสารใน MMR

เหตุใด MMR จึงมีประโยชน์อย่างยิ่งในการสร้างการเรียกข้อมูลเสริม (RAG)

ด้วยการกระจายชิ้นส่วนที่ดึงมา MMR ช่วยให้แบบจำลองเห็นหลักฐานที่หลากหลาย แทนที่จะเห็นข้อเท็จจริงเดียวกันซ้ำๆ เพื่อปรับปรุงความครอบคลุม