HƯỚNG DẪN KỸ THUẬT

Viết lại truy vấn và truy xuất nhiều truy vấn

Viết lại truy vấn và truy xuất nhiều truy vấn là các kỹ thuật RAG biến đổi câu hỏi của người dùng trước khi tìm kiếm, bằng cách diễn đạt lại, chia thành các câu hỏi phụ hoặc tạo ra một số biến thể và hợp nhất các kết quả của chúng.

  • Đọc trong 3 phút
  • Cập nhật lần cuối
Trên trang nàyĐọc trong 3 phút
  1. Tổng quan
  2. Lặn sâu
  3. Tác động chiến lược
  4. Tương lai của việc viết lại truy vấn và truy xuất nhiều truy vấn
  5. Triển khai trong thế giới thực
  6. Rủi ro & lan can
  7. Lộ trình thực hiện
  8. Tiếp tục khám phá
  9. Câu hỏi thường gặp

Tổng quan

Chúng quan trọng vì người dùng thường hỏi những câu hỏi mơ hồ, mang tính đàm thoại hoặc nhiều phần mà cách diễn đạt không khớp với tài liệu và một truy vấn tốt hơn có thể hiển thị các đoạn có liên quan mà một tìm kiếm theo nghĩa đen sẽ bỏ lỡ.

Lặn sâu

Chất lượng truy xuất phụ thuộc rất nhiều vào truy vấn. Người dùng viết các câu hỏi ngắn, mơ hồ hoặc mang tính đàm thoại, trong khi tài liệu sử dụng từ vựng riêng của họ. Chuyển đổi truy vấn sẽ thu hẹp khoảng cách đó trước khi tìm kiếm diễn ra. Hình thức đơn giản nhất là viết lại: LLM biến thông điệp của người dùng thành một truy vấn tìm kiếm rõ ràng hơn. Điều này rất cần thiết trong trò chuyện nhiều lượt, trong đó những phần tiếp theo như "và vào năm 2023?" không có ý nghĩa gì nếu không có lịch sử nên hệ thống sẽ cô đọng cuộc trò chuyện thành một truy vấn độc lập. Phân tách chia một câu hỏi phức tạp thành các câu hỏi phụ có thể được truy xuất riêng biệt, hữu ích cho việc so sánh hoặc các câu hỏi có nhiều bước nhảy. Lời nhắc lùi lại, được các nhà nghiên cứu Google DeepMind mô tả vào năm 2023, đặt một câu hỏi tổng quát hơn trước tiên để truy xuất các nguyên tắc cơ bản. Truy xuất nhiều truy vấn tạo ra một số biến thể của câu hỏi, thực hiện tìm kiếm cho từng biến thể và hợp nhất các kết quả. LangChain đã phổ biến điều này với MultiQueryRetriever. RAG-Fusion kết hợp nhiều truy vấn với phản ứng tổng hợp xếp hạng đối ứng (RRF), một phương pháp được Cormack, Clarke và Buettcher mô tả vào năm 2009, phương pháp này chấm điểm từng tài liệu bằng cách tính tổng 1/(k + xếp hạng) trên các danh sách kết quả. Các tài liệu xuất hiện ở vị trí cao trong một số danh sách sẽ được đưa lên hàng đầu mà không cần điểm thô tương đương. Một kỹ thuật liên quan, HyDE (Nhúng tài liệu giả thuyết, Gao và đồng nghiệp, 2022), yêu cầu mô hình viết một câu trả lời giả định và nhúng câu trả lời đó thay vì câu hỏi, vì văn bản có hình câu trả lời thường nằm gần với các đoạn trả lời thực hơn trong không gian nhúng. Quan niệm sai lầm: nhiều truy vấn hơn không phải lúc nào cũng tốt hơn. Mỗi biến thể đều tăng thêm độ trễ và chi phí, đồng thời các biến thể được tạo kém có thể đi chệch khỏi mục đích của người dùng, kéo theo các tài liệu không liên quan. Việc viết lại cũng có thể loại bỏ các ràng buộc quan trọng như ngày tháng hoặc tên sản phẩm. Đo lường khả năng thu hồi và chất lượng câu trả lời cho các câu hỏi thực tế trước khi áp dụng các bước này.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của việc viết lại truy vấn và truy xuất nhiều truy vấn

Khi RAG tác nhân lan rộng, việc chuyển đổi truy vấn ngày càng được xử lý bằng mô hình quyết định nội dung cần tìm kiếm, lặp lại khi kết quả có vẻ yếu, thay vì bằng bước viết lại cố định. Điều đó làm cho các ý tưởng cơ bản, sự phân rã, các biến thể và sự hợp nhất trở nên quan trọng hơn ngay cả khi chúng trở nên ít được nhìn thấy hơn. Những cải tiến trong mô hình nhúng và tìm kiếm kết hợp làm giảm một số từ vựng không khớp nhưng không loại bỏ nhu cầu làm rõ các câu hỏi mơ hồ hoặc đàm thoại. Yêu cầu các nhóm sử dụng các kỹ thuật này một cách có chọn lọc, được kích hoạt khi một truy vấn có vẻ phức tạp hoặc khả năng truy xuất ban đầu yếu, để cân bằng giữa chất lượng và chi phí.

Triển khai trong thế giới thực

Trong trợ lý trò chuyện, phần tiếp theo "đối với nhân viên bán thời gian thì sao?" được viết lại thành một truy vấn độc lập, chẳng hạn như "chính sách nghỉ phép của cha mẹ đối với nhân viên bán thời gian" bằng cách sử dụng cuộc hội thoại trước đó.

Câu hỏi so sánh giá của hai nhà cung cấp dịch vụ đám mây được chia thành các tìm kiếm riêng biệt cho từng nhà cung cấp và kết quả được kết hợp trước khi trả lời.

Bot hỗ trợ tạo ra bốn cụm từ "ứng dụng của tôi liên tục khiến tôi đăng xuất", bao gồm các thuật ngữ kỹ thuật như hết hạn phiên và làm mới mã thông báo, đồng thời kết hợp các kết quả với phản ứng tổng hợp thứ hạng đối ứng.

Trợ lý nghiên cứu sử dụng nhắc nhở lùi lại để trước tiên tìm kiếm nguyên tắc chung đằng sau một câu hỏi hẹp, sau đó truy xuất các chi tiết cụ thể, cung cấp cho mô hình cả thông tin cơ bản và chi tiết cụ thể.

Rủi ro & lan can

  • Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

  • Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

  • Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

  1. Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

  2. Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

  3. Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

  4. Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Query Rewriting and Multi-Query Retrieval quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

Viết lại truy vấn và truy xuất nhiều truy vấn là gì?

Viết lại truy vấn và truy xuất nhiều truy vấn là các kỹ thuật RAG biến đổi câu hỏi của người dùng trước khi tìm kiếm, bằng cách diễn đạt lại, chia thành các câu hỏi phụ hoặc tạo ra một số biến thể và hợp nhất các kết quả của chúng. Chúng quan trọng vì người dùng thường hỏi những câu hỏi mơ hồ, mang tính đàm thoại hoặc nhiều phần mà cách diễn đạt không khớp với tài liệu và một truy vấn tốt hơn có thể hiển thị các đoạn có liên quan mà một tìm kiếm theo nghĩa đen sẽ bỏ lỡ.

Tại sao việc viết lại truy vấn lại đặc biệt quan trọng trong trò chuyện nhiều lượt?

Phần tiếp theo như "và vào năm 2023?" cần lịch sử hội thoại để trở thành một truy vấn độc lập hữu ích.

Kỹ thuật nào chia câu hỏi so sánh thành các tìm kiếm riêng biệt cho từng mục được so sánh?

Phân tách các câu hỏi phức tạp hoặc nhiều phần thành các câu hỏi phụ được truy xuất riêng biệt.

Nhắc lùi bước có tác dụng gì?

Lời nhắc lùi lại, từ các nhà nghiên cứu Google DeepMind, lấy thông tin cơ bản chung trước thông tin cụ thể.

Trong hợp nhất xếp hạng đối ứng, điểm của tài liệu được tính như thế nào?

RRF tính tổng 1/(k + xếp hạng) trên mỗi danh sách chứa tài liệu, khen thưởng các tài liệu được xếp hạng cao trong một số danh sách.

Tại sao RRF thuận tiện cho việc hợp nhất tìm kiếm vector và kết quả BM25?

Vì RRF chỉ sử dụng các vị trí xếp hạng nên nó có thể kết hợp các danh sách có điểm thô không thể so sánh được.