HƯỚNG DẪN AI về ngôn ngữ

Chú ý chéo

Chú ý chéo là cơ chế cho phép một chuỗi nhìn vào một chuỗi khác: văn bản tạo ra bộ giải mã có thể tham gia vào cách trình bày đầu vào của bộ mã hóa.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It is how models connect what they are producing to what they read, powering translation, captioning, and modern multimodal systems.

Lặn sâu

Sự tự chú ý cho phép các mã thông báo trong một chuỗi liên hệ với nhau; sự chú ý chéo cho phép một trình tự lấy thông tin từ một trình tự khác. Trong bộ giải mã Transformer, mỗi bước tạo sẽ tạo thành các truy vấn từ đầu ra được tạo một phần, trong khi các khóa và giá trị đến từ đầu ra của bộ mã hóa. Mô hình tính toán mức độ liên quan của từng phần tử đầu vào với vị trí đầu ra hiện tại và đưa vào một hỗn hợp thông tin đầu vào có trọng số. Đây là điều cho phép bộ giải mã dịch thuật tập trung vào các từ nguồn phù hợp khi nó viết từng từ đích. Ngoài văn bản, sự chú ý chéo là chất kết dính trong các mô hình đa phương thức: bộ giải mã văn bản có thể tham gia vào các tính năng vá hình ảnh hoặc mô hình âm thanh có thể căn chỉnh âm thanh cho các từ được phiên âm. Bất cứ khi nào hai luồng thông tin riêng biệt cần được hợp nhất, sự chú ý chéo thường là mô liên kết.

Hiểu biết kỹ thuật

Về mặt cơ học, sự chú ý chéo sử dụng lại công thức sản phẩm chấm theo tỷ lệ tương tự như sự tự chú ý, với một điểm thay đổi: truy vấn đến từ một chuỗi (bộ giải mã) và khóa/giá trị đến từ một chuỗi khác (bộ mã hóa). Nó tính toán trọng số chú ý dưới dạng softmax dựa trên độ tương tự của khóa truy vấn, sau đó trả về tổng giá trị có trọng số. Bởi vì các truy vấn và khóa có nguồn gốc từ các nguồn khác nhau nên hai chuỗi có thể khác nhau hoàn toàn về độ dài, phương thức hoặc ngôn ngữ.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của sự chú ý chéo

Sự chú ý chéo ngày càng trở thành giao diện tiêu chuẩn để kết hợp các phương thức lại với nhau. Các mô hình ngôn ngữ thị giác sử dụng nó để văn bản có thể tự đặt mình vào các vùng hình ảnh; trình tạo hình ảnh khuếch tán sử dụng nó để điều chỉnh các pixel trên lời nhắc văn bản. Nghiên cứu đang hướng tới sự chú ý chéo hiệu quả hơn (các biến thể tuyến tính và thưa thớt) để xử lý các tài liệu dài, hình ảnh và video có độ phân giải cao. Khi hệ thống AI tích hợp nhiều giác quan hơn, các lớp chú ý chéo sẽ hoạt động như các kết nối phổ quát sắp xếp văn bản, âm thanh, hình ảnh và dữ liệu có cấu trúc.

Triển khai trong thế giới thực

Trong bản dịch máy thần kinh, bộ giải mã sẽ tham khảo chéo các từ nguồn để chọn bản dịch phù hợp cho mỗi từ đầu ra.

Khuếch tán ổn định sử dụng sự chú ý chéo để điều chỉnh từng vùng hình ảnh được tạo trên lời nhắc văn bản.

Các mô hình ngôn ngữ thị giác như Flamingo cho phép các mã thông báo văn bản tham gia chéo vào các tính năng hình ảnh để trả lời câu hỏi trực quan.

Bộ giải mã giọng nói thành văn bản tham gia chéo vào các khung âm thanh được mã hóa để căn chỉnh âm thanh với các từ được phiên âm.

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Cross-Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Chỉnh sửa chú ý chéo nhanh chóng

Câu hỏi thường gặp

What is Cross-Attention?

Chú ý chéo là cơ chế cho phép một chuỗi nhìn vào một chuỗi khác: văn bản tạo ra bộ giải mã có thể tham gia vào cách trình bày đầu vào của bộ mã hóa. Đó là cách các mô hình kết nối những gì họ đang sản xuất với những gì họ đọc, hỗ trợ dịch thuật, chú thích và các hệ thống đa phương thức hiện đại.

Sự khác biệt chính giữa sự chú ý của bản thân và sự chú ý chéo là gì?

Sự chú ý chéo rút ra các truy vấn từ một chuỗi (ví dụ: bộ giải mã) và các khóa cũng như giá trị từ một chuỗi khác (ví dụ: bộ mã hóa), cho phép cả hai tương tác.

Trong Transformer mã hóa-giải mã, các truy vấn để thu hút sự chú ý chéo đến từ đâu?

Bộ giải mã hình thành các truy vấn từ đầu ra được tạo một phần của nó, sau đó sử dụng đầu ra của bộ mã hóa làm khóa và giá trị để lấy thông tin đầu vào có liên quan.

Tại sao hai chuỗi trong sự chú ý chéo có thể có độ dài hoặc phương thức khác nhau?

Vì các truy vấn bắt nguồn từ một nguồn và khóa/giá trị từ một nguồn khác nên các chuỗi độc lập và có thể khác nhau về độ dài, ngôn ngữ hoặc phương thức.

Khuếch tán ổn định sử dụng sự chú ý chéo như thế nào?

Sự chú ý chéo cho phép từng phần của hình ảnh được tạo ra chú ý đến lời nhắc văn bản, làm nền tảng cho hình ảnh trong từ ngữ.

Sự chú ý chéo chia sẻ phép toán nào với sự tự chú ý?

Cả hai đều sử dụng cùng một sự chú ý đến sản phẩm chấm theo tỷ lệ: điểm tương tự giữa các truy vấn và khóa, softmax, sau đó là tổng giá trị có trọng số.