HƯỚNG DẪN AI về ngôn ngữ

Bộ mã hóa chéo và bộ mã hóa kép

Mô hình thần kinh so sánh văn bản theo hai cách: bộ mã hóa kép nhúng từng phần riêng biệt để tìm kiếm nhanh, trong khi bộ mã hóa chéo đọc cả hai văn bản cùng nhau để có độ chính xác cao hơn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Sự lựa chọn này định hình sự cân bằng giữa tốc độ và độ chính xác trong mọi hệ thống tìm kiếm và truy xuất hiện đại.

Lặn sâu

Cả hai kiến ​​trúc đều trả lời 'hai văn bản có liên quan như thế nào?', nhưng chúng khác nhau ở chỗ các văn bản gặp nhau. Bộ mã hóa kép chạy từng câu thông qua máy biến áp một cách độc lập, tạo ra một vectơ cố định cho mỗi văn bản; độ tương tự khi đó là tích số chấm rẻ tiền hoặc cosine giữa các vectơ. Vì vectơ có thể được tính toán trước và lưu trữ nên bộ mã hóa kép có thể mở rộng tới hàng triệu tài liệu và cơ sở dữ liệu vectơ điện. Thay vào đó, một bộ mã hóa chéo sẽ ghép cả hai văn bản (tài liệu [CLS] truy vấn [SEP]) và cung cấp chúng thông qua mô hình với nhau, cho phép mọi mã thông báo tham dự với mọi mã thông báo khác trước khi xuất ra một điểm liên quan duy nhất. Sự chú ý đầy đủ này nắm bắt các tương tác chi tiết mà bộ mã hóa hai bỏ lỡ, do đó, bộ mã hóa chéo có độ chính xác cao hơn rõ rệt nhưng không thể tính toán trước bất kỳ thứ gì và phải chạy một lần trên mỗi cặp.

Hiểu biết kỹ thuật

Sự khác biệt cốt lõi là phạm vi chú ý. Trong bộ mã hóa kép, khả năng tự chú ý không bao giờ vượt qua giữa hai đầu vào, do đó, việc nhúng tài liệu không phụ thuộc vào truy vấn và có thể tái sử dụng. Trong bộ mã hóa chéo, sự chú ý kéo dài chuỗi đã nối, làm cho truy vấn điểm số phụ thuộc vào. Thang chi phí tương ứng: xếp hạng N tài liệu cần N đường biến áp đầy đủ cho bộ mã hóa chéo so với N so sánh vectơ giá rẻ cho bộ mã hóa hai chiều sau một mã hóa truy vấn.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của bộ mã hóa chéo và bộ mã hóa kép

Mẫu chủ đạo là truy xuất-sau đó-xếp hạng kết hợp: bộ mã hóa hai tìm nạp vài trăm ứng cử viên từ hàng triệu, sau đó bộ mã hóa chéo sắp xếp lại các kết quả hàng đầu. Các mô hình tương tác muộn như ColBERT phân chia sự khác biệt bằng cách lưu trữ các vectơ trên mỗi mã thông báo và quá trình chưng cất ngày càng huấn luyện các bộ mã hóa hai chiều nhỏ gọn để bắt chước các phán đoán của bộ mã hóa chéo. Mong đợi các công cụ xếp hạng lại rẻ hơn và sự tích hợp chặt chẽ hơn của cả hai giai đoạn vào các quy trình tạo thế hệ tăng cường truy xuất.

Triển khai trong thế giới thực

Cơ sở dữ liệu vectơ sử dụng các phần nhúng bộ mã hóa hai chiều để truy xuất 200 đoạn văn ứng cử viên hàng đầu từ hàng triệu tài liệu trong một phần nghìn giây

Trình sắp xếp lại bộ mã hóa chéo sẽ sắp xếp lại 200 ứng viên đó trước khi họ được đưa vào chatbot RAG, cải thiện đáng kể mức độ liên quan của câu trả lời

Sentence-Transformers cung cấp bộ mã hóa hai chiều đã được huấn luyện trước (để tìm kiếm ngữ nghĩa) và bộ mã hóa chéo (để sắp xếp lại và tính điểm STS)

Tính năng phát hiện câu hỏi trùng lặp trên diễn đàn Hỏi & Đáp sử dụng bộ mã hóa chéo để khớp từng cặp có độ chính xác cao trên danh sách rút gọn

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Cross-Encoders vs Bi-Encoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Mô hình BERT và bộ mã hóa

Câu hỏi thường gặp

Bộ mã hóa chéo và bộ mã hóa kép là gì?

Mô hình thần kinh so sánh văn bản theo hai cách: bộ mã hóa kép nhúng từng phần riêng biệt để tìm kiếm nhanh, trong khi bộ mã hóa chéo đọc cả hai văn bản cùng nhau để có độ chính xác cao hơn. Sự lựa chọn này định hình sự cân bằng giữa tốc độ và độ chính xác trong mọi hệ thống tìm kiếm và truy xuất hiện đại.

Sự khác biệt về kiến ​​trúc được xác định giữa bộ mã hóa chéo và bộ mã hóa hai chiều là gì?

Bộ mã hóa chéo nối cả hai đầu vào và để sự chú ý kéo dài toàn bộ chuỗi; bộ mã hóa kép mã hóa từng văn bản riêng biệt thành các vectơ riêng biệt.

Tại sao bộ mã hóa kép có thể mở rộng tới hàng triệu tài liệu một cách hiệu quả?

Bởi vì mỗi tài liệu được mã hóa độc lập nên vectơ của nó có thể được sử dụng lại trên tất cả các truy vấn và có thể được lập chỉ mục trước thời hạn.

Trong một quy trình tìm kiếm sản xuất điển hình, hai kiến trúc được kết hợp như thế nào?

Mẫu truy xuất-sau đó-xếp hạng lại tiêu chuẩn sử dụng bộ mã hóa hai chiều nhanh để thu hồi rộng rãi và bộ mã hóa chéo chính xác để sắp xếp lại danh sách rút gọn.

Tại sao bộ mã hóa chéo không thể tính toán trước các biểu diễn tài liệu?

Vì điểm được tạo từ chuỗi tài liệu truy vấn đã nối nên nó phụ thuộc vào truy vấn và phải được tính toán lại cho mỗi cặp.

Bộ mã hóa kép thường xuất ra nội dung gì cho một văn bản đầu vào?

Bộ mã hóa kép ánh xạ từng văn bản tới một vectơ nhúng; độ tương tự sau đó được tính toán giữa các vectơ.