Truy xuất lối đi dày đặc
Truy xuất đoạn văn dày đặc (DPR) tìm thấy văn bản có liên quan bằng cách so sánh ý nghĩa của câu hỏi và đoạn văn dưới dạng vectơ số, không khớp với các từ.
Tổng quan
Nó quan trọng vì nó có thể lấy câu trả lời đúng ngay cả khi truy vấn và tài liệu không có từ vựng chung.
Lặn sâu
DPR, được Facebook AI giới thiệu vào năm 2020, sử dụng hai bộ mã hóa BERT riêng biệt: một bộ mã hóa câu hỏi và một bộ mã hóa đoạn văn. Mỗi biến văn bản thành một vectơ dày đặc có độ dài cố định (thường là 768 chiều). Mức độ liên quan là tích số chấm giữa vectơ câu hỏi và vectơ đoạn văn, do đó việc truy xuất trở thành tìm kiếm lân cận gần nhất nhanh chóng trên các phần nhúng đoạn văn được tính toán trước. Mô hình được đào tạo với mục tiêu tương phản: kéo vectơ của đoạn văn bên phải đến gần câu hỏi và đẩy vectơ sai ra xa, sử dụng các âm bản theo đợt cộng với các âm bản cứng được khai thác từ BM25. Trên các điểm chuẩn QA trong miền mở như Câu hỏi tự nhiên, DPR đã đánh bại BM25 chiếm ưu thế từ lâu với tỷ suất lợi nhuận lớn, cho thấy rằng kết hợp ngữ nghĩa đã học có thể vượt trội hơn so với tìm kiếm từ khóa để trả lời câu hỏi.
Hiểu biết kỹ thuật
DPR là một bộ mã hóa hai chiều: nó mã hóa truy vấn và từng đoạn văn một cách độc lập, do đó tất cả các vectơ đoạn văn được tính toán một lần và được lưu trữ trong một chỉ mục vectơ (ví dụ: FAISS). Tại thời điểm truy vấn, bạn chỉ mã hóa câu hỏi, sau đó chạy tìm kiếm lân cận gần nhất. Quá trình đào tạo dựa trên các đoạn âm bản theo lô - các đoạn khác trong cùng một đoạn nhỏ đóng vai trò là các ví dụ âm bản gần như miễn phí, điều này cho phép một cặp dương tính tạo ra nhiều so sánh tương phản một cách hiệu quả.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của việc thu hồi lối đi dày đặc
Truy xuất dày đặc hiện là nền tảng cho hầu hết các quy trình tạo thế hệ truy xuất tăng cường cung cấp cho các mô hình ngôn ngữ lớn. Nghiên cứu đang hướng tới các hệ thống kết hợp kết hợp các điểm số từ vựng và dày đặc, các mô hình tương tác muộn như ColBERT giữ các vectơ trên mỗi mã thông báo để khớp tốt hơn và các phần nhúng được điều chỉnh theo hướng dẫn để thích ứng với nhiều tác vụ. Mong đợi các bộ mã hóa ngữ cảnh dài hơn, đa ngôn ngữ và rẻ hơn, cộng với việc đào tạo những người truy tìm chặt chẽ hơn với các trình tạo mà chúng phục vụ.
Triển khai trong thế giới thực
Các hệ thống trả lời câu hỏi trong miền mở hỗ trợ các đoạn Wikipedia trước khi LLM viết câu trả lời
Tìm kiếm tài liệu doanh nghiệp nơi nhân viên đặt câu hỏi tự nhiên và nhận các đoạn văn có liên quan ngay cả khi không có từ khóa chính xác
Các bot hỗ trợ khách hàng truy xuất bài viết phù hợp trong trung tâm trợ giúp từ một khiếu nại được diễn giải
Các chatbot được tăng cường khả năng truy xuất sẽ tạo nền tảng cho các phản hồi trong cơ sở kiến thức riêng tư để giảm ảo giác
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Dense Passage Retrieval quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
ColBERT Truy xuất tương tác muộn
Câu hỏi thường gặp
Truy xuất Dense Passage là gì?
Truy xuất đoạn văn dày đặc (DPR) tìm thấy văn bản có liên quan bằng cách so sánh ý nghĩa của câu hỏi và đoạn văn dưới dạng vectơ số, không khớp với các từ. Điều này quan trọng vì nó có thể truy xuất câu trả lời đúng ngay cả khi truy vấn và tài liệu không có từ vựng nào.
Ý tưởng cốt lõi đằng sau việc Truy xuất đường đi dày đặc là gì?
DPR ánh xạ cả truy vấn và đoạn văn thành các vectơ dày đặc và đo lường mức độ liên quan bằng độ giống nhau của chúng (tích chấm), nắm bắt ý nghĩa thay vì chồng chéo các từ.
DPR sử dụng kiến trúc 'bộ mã hóa kép'. Điều đó có nghĩa là gì?
Bộ mã hóa kép có các bộ mã hóa độc lập cho các câu hỏi và đoạn văn, do đó vectơ đoạn văn có thể được tính toán trước và lập chỉ mục trước thời hạn.
Tại sao các vectơ đoạn văn có thể được tính toán trước trong DPR?
Vì bộ mã hóa đoạn văn không phụ thuộc vào truy vấn nên tất cả các phần nhúng đoạn văn có thể được tính toán trước và lưu trữ, chỉ để lại truy vấn được mã hóa tại thời điểm tìm kiếm.
Thủ thuật đào tạo nào cho phép DPR tạo ra nhiều ví dụ tiêu cực với chi phí thấp?
Các câu phủ định theo đợt coi các đoạn văn khác trong một loạt nhỏ là những câu phủ định cho một câu hỏi nhất định, tạo ra nhiều cặp tương phản một cách hiệu quả.
Công cụ nào thường được sử dụng để giúp tìm kiếm lân cận gần nhất của DPR nhanh chóng trên quy mô lớn?
Các chỉ mục vectơ như FAISS thực hiện tìm kiếm lân cận gần nhất một cách nhanh chóng trên hàng triệu phần nhúng đoạn văn được tính toán trước.