คู่มือ AI ภาษา

การดึงข้อมูลทางหนาแน่น

Dense Passage Retrieval (DPR) ค้นหาข้อความที่เกี่ยวข้องโดยการเปรียบเทียบความหมายของคำถามและข้อความเป็นเวกเตอร์ตัวเลข ไม่ใช่คำที่ตรงกัน

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

สิ่งสำคัญคือสามารถดึงคำตอบที่ถูกต้องได้แม้ว่าแบบสอบถามและเอกสารจะใช้คำศัพท์เป็นศูนย์ก็ตาม

เจาะลึก

DPR เปิดตัวโดย Facebook AI ในปี 2020 ใช้ตัวเข้ารหัส BERT แยกกันสองตัว: ตัวเข้ารหัสคำถามและตัวเข้ารหัสข้อความ แต่ละข้อความจะเปลี่ยนข้อความเป็นเวกเตอร์หนาแน่นที่มีความยาวคงที่ (มักจะเป็นขนาด 768) ความเกี่ยวข้องคือผลคูณดอทระหว่างเวกเตอร์คำถามและเวกเตอร์ข้อความ ดังนั้นการดึงข้อมูลจึงกลายเป็นการค้นหาเพื่อนบ้านที่ใกล้ที่สุดอย่างรวดเร็วเหนือการฝังข้อความที่คำนวณไว้ล่วงหน้า แบบจำลองนี้ได้รับการฝึกฝนโดยมีวัตถุประสงค์เชิงเปรียบเทียบ: ดึงเวกเตอร์ของข้อความที่ถูกต้องใกล้กับคำถามแล้วผลักเวกเตอร์ที่ไม่ถูกต้องออกไป โดยใช้ค่าลบแบบแบตช์บวกกับค่าลบแบบฮาร์ดที่ขุดได้จาก BM25 ในเกณฑ์มาตรฐาน QA แบบโอเพ่นโดเมน เช่น คำถามทั่วไป DPR เอาชนะ BM25 ที่มีความโดดเด่นมายาวนานด้วยอัตรากำไรที่มาก ซึ่งแสดงให้เห็นว่าการจับคู่ความหมายที่เรียนรู้อาจมีประสิทธิภาพเหนือกว่าการค้นหาคำหลักในการตอบคำถาม

ข้อมูลเชิงลึกทางเทคนิค

DPR เป็นตัวเข้ารหัสแบบคู่: โดยจะเข้ารหัสแบบสอบถามและแต่ละข้อความแยกจากกัน ดังนั้นเวกเตอร์ข้อความทั้งหมดจึงถูกคำนวณเพียงครั้งเดียวและจัดเก็บไว้ในดัชนีเวกเตอร์ (เช่น FAISS) ในเวลาสืบค้น คุณจะเข้ารหัสคำถามเท่านั้น จากนั้นจึงเรียกใช้การค้นหาเพื่อนบ้านที่ใกล้ที่สุดโดยประมาณ การฝึกอบรมอาศัยผลเชิงลบในแบตช์ - ข้อความอื่นๆ ในมินิแบตช์เดียวกันทำหน้าที่เป็นตัวอย่างเชิงลบที่เกือบจะไม่มีค่าใช้จ่าย ซึ่งช่วยให้คู่ที่เป็นบวกหนึ่งคู่สร้างการเปรียบเทียบที่ตัดกันมากมายได้อย่างมีประสิทธิภาพ

ผลกระทบเชิงกลยุทธ์

ความเร็วและขนาด

ขั้นตอนการทำงานของภาษาสามารถดำเนินไปได้เร็วขึ้นโดยไม่กระทบต่อความสม่ำเสมอ

เข้าถึงและเข้าถึง

ขยายการเข้าถึงภาษาและรูปแบบการสื่อสาร

การตัดสินใจที่ชัดเจนยิ่งขึ้น

ทีมสามารถใช้เวลามากขึ้นในการตัดสิน ในขณะที่ระบบอัตโนมัติจัดการกับการทำซ้ำ

อนาคตของการดึงข้อมูลเส้นทางหนาแน่น

ขณะนี้การดึงข้อมูลแบบหนาแน่นเป็นรากฐานของไปป์ไลน์การสร้างการดึงข้อมูลแบบเสริมส่วนใหญ่ที่ป้อนโมเดลภาษาขนาดใหญ่ การวิจัยกำลังมุ่งสู่ระบบไฮบริดที่หลอมรวมคะแนนหนาแน่นและคำศัพท์ โมเดลการโต้ตอบล่าช้า เช่น ColBERT ที่เก็บเวกเตอร์ต่อโทเค็นเพื่อการจับคู่ที่ละเอียดยิ่งขึ้น และการฝังที่ปรับแต่งตามคำสั่งที่ปรับให้เข้ากับงานหลายอย่าง คาดว่าจะมีโปรแกรมเข้ารหัสที่มีราคาถูกกว่า หลายภาษา และมีบริบทที่ยาวกว่า รวมถึงการฝึกอบรมผู้ดึงข้อมูลร่วมกับเครื่องกำเนิดไฟฟ้าที่พวกเขาให้บริการอย่างเข้มงวดยิ่งขึ้น

การใช้งานจริงในโลกแห่งความเป็นจริง

ระบบตอบคำถามแบบเปิดโดเมนที่ดึงข้อความ Wikipedia ที่รองรับก่อนที่ LLM จะเขียนคำตอบ

ค้นหาเอกสารระดับองค์กรโดยที่พนักงานถามคำถามทั่วไปและรับย่อหน้าที่เกี่ยวข้องแม้ว่าจะไม่มีคำหลักที่ตรงทั้งหมดก็ตาม

บอทสนับสนุนลูกค้าดึงข้อมูลบทความในศูนย์ช่วยเหลือที่ถูกต้องจากการร้องเรียนที่ถอดความ

แชทบอทที่ดึงข้อมูลมาเสริมจะตอบสนองพื้นฐานในฐานความรู้ส่วนตัวเพื่อลดอาการประสาทหลอน

ความเสี่ยงและรั้ว

ข้อเท็จจริงที่หลอนประสาทสามารถเข้าสู่รายงาน กระแสสนับสนุน หรือผลการวิจัยได้อย่างเงียบๆ

ความละเอียดอ่อนของการแจ้งเตือนสามารถสร้างผลลัพธ์ที่ไม่สอดคล้องกันในคำขอที่คล้ายกัน

ข้อมูลข้อความที่ละเอียดอ่อนอาจถูกเปิดเผยหากการควบคุมการเข้าถึงอ่อนแอ

แผนงานการดำเนินงาน

1

กำหนดรูปแบบเอาต์พุต โทนเสียง และมาตรฐานคุณภาพก่อนเปิดตัว

2

การตอบสนองภาคพื้นดินกับแหล่งข้อมูลที่เชื่อถือได้เมื่อใดก็ตามที่ความแม่นยำมีความสำคัญ

3

รักษาจุดตรวจสอบการตรวจสอบโดยมนุษย์สำหรับผลลัพธ์ที่มีเดิมพันสูง

4

ติดตามรูปแบบความล้มเหลวและฝึกอบรมพร้อมท์หรือเวิร์กโฟลว์เป็นประจำ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Dense Passage Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การดึงข้อมูลปฏิสัมพันธ์ล่าช้าของ ColBERT

คำถามที่พบบ่อย

การเรียกคืน Dense Passage คืออะไร

Dense Passage Retrieval (DPR) ค้นหาข้อความที่เกี่ยวข้องโดยการเปรียบเทียบความหมายของคำถามและข้อความเป็นเวกเตอร์ตัวเลข ไม่ใช่คำที่ตรงกัน สิ่งสำคัญคือสามารถดึงคำตอบที่ถูกต้องได้แม้ว่าแบบสอบถามและเอกสารจะใช้คำศัพท์เป็นศูนย์ก็ตาม

แนวคิดหลักเบื้องหลัง Dense Passage Retrieval คืออะไร

DPR จับคู่ทั้งข้อความค้นหาและข้อความลงในเวกเตอร์ที่มีความหนาแน่นสูง และวัดความเกี่ยวข้องตามความคล้ายคลึงกัน (ผลคูณดอท) โดยจับความหมายมากกว่าคำที่ทับซ้อนกัน

DPR ใช้สถาปัตยกรรม 'bi-encoder' นั่นหมายความว่าอย่างไร?

ตัวเข้ารหัสแบบคู่มีตัวเข้ารหัสอิสระสำหรับคำถามและข้อความ ดังนั้นเวกเตอร์ข้อความจึงสามารถคำนวณล่วงหน้าและจัดทำดัชนีล่วงหน้าได้

เหตุใดจึงสามารถคำนวณเวกเตอร์ข้อความล่วงหน้าใน DPR ได้

เนื่องจากตัวเข้ารหัสข้อความไม่ได้ขึ้นอยู่กับข้อความค้นหา การฝังข้อความทั้งหมดจึงสามารถคำนวณและจัดเก็บไว้ล่วงหน้าได้ เหลือเพียงข้อความค้นหาที่จะเข้ารหัสในเวลาค้นหา

เคล็ดลับการฝึกอบรมใดที่ทำให้ DPR สร้างตัวอย่างเชิงลบจำนวนมากได้ในราคาถูก

คำเชิงลบในชุดจะถือว่าข้อความอื่นๆ ในชุดย่อยเป็นคำเชิงลบสำหรับคำถามที่กำหนด ทำให้เกิดคู่ที่ตัดกันจำนวนมากอย่างมีประสิทธิภาพ

เครื่องมือใดที่มักใช้เพื่อทำให้การค้นหาเพื่อนบ้านที่ใกล้ที่สุดของ DPR ทำได้รวดเร็วในวงกว้าง

ดัชนีเวกเตอร์เช่น FAISS ทำการค้นหาเพื่อนบ้านที่ใกล้ที่สุดโดยประมาณอย่างรวดเร็วเหนือข้อความที่ฝังไว้ล่วงหน้าหลายล้านรายการ