HƯỚNG DẪN AI về ngôn ngữ

Mô hình chú ý thưa thớt

Sự chú ý thưa thớt làm cho Transformers rẻ hơn bằng cách cho phép mỗi mã thông báo chỉ tham gia vào một tập hợp con các mã thông báo khác được lựa chọn cẩn thận thay vì tất cả chúng.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

This trades a little global reach for big savings in memory and compute on long sequences.

Lặn sâu

Sự tự chú ý hoàn toàn so sánh mọi mã thông báo với mọi mã thông báo khác, do đó chi phí tăng theo bình phương độ dài chuỗi, điều này trở nên khó khăn đối với các tài liệu dài. Sự chú ý thưa thớt thay thế mô hình dày đặc bằng một mô hình có cấu trúc. Các thiết kế phổ biến bao gồm sự chú ý của cửa sổ trượt (cục bộ), trong đó mỗi mã thông báo chỉ nhìn thấy những hàng xóm lân cận; các mô hình sải bước hoặc giãn ra bỏ qua phía trước để đến bối cảnh ở xa một cách rẻ tiền; và mã thông báo toàn cầu, một số vị trí đặc biệt liên quan đến mọi thứ và mọi thứ đều liên quan đến, đóng vai trò là trung tâm thông tin. Các mô hình như Longformer, BigBird và Sparse Transformer kết hợp những mô hình này để tổng số kết nối tăng lên gần như tuyến tính thay vì bậc hai, tạo ra bối cảnh từ hàng nghìn đến hàng chục nghìn mã thông báo.

Hiểu biết kỹ thuật

Thay vì ma trận chú ý N-by-N đầy đủ, chú ý thưa thớt chỉ tính toán các mục được chọn, thường là sự kết hợp của một cửa sổ cục bộ và một số hàng và cột chung. BigBird đã chứng minh một cách nổi tiếng rằng việc kết hợp các kết nối ngẫu nhiên, cửa sổ và toàn cầu sẽ duy trì tính biểu đạt về mặt lý thuyết của sự chú ý hoàn toàn đồng thời giảm độ phức tạp từ O(N bình phương) xuống O(N). Các hạt nhân hiệu quả bỏ qua hoàn toàn các mục được che giấu thay vì tính toán rồi xóa chúng về không.

Tác động chiến lược

Tốc độ và tỷ lệ

Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.

Truy cập và tiếp cận

Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.

Quyết định rõ ràng hơn

Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.

Tương lai của các kiểu chú ý thưa thớt

Sự chú ý thưa thớt vẫn là trọng tâm của mô hình hóa ngữ cảnh dài, ngày càng được kết hợp với các hạt nhân được tối ưu hóa như FlashAttention và với tính thưa thớt đã học hoặc động để chọn mã thông báo nào cần chú ý cho mỗi đầu vào. Khi các cửa sổ ngữ cảnh mở rộng tới hàng triệu mã thông báo, các ngăn xếp kết hợp sẽ trộn lẫn các lớp không gian trạng thái, dày đặc và thưa thớt. Mong đợi các hạt nhân thưa thớt nhận biết phần cứng và sự chú ý dựa trên định tuyến để tiếp tục giảm chi phí đọc các đầu vào rất dài.

Triển khai trong thế giới thực

Longformer xử lý toàn bộ bài báo khoa học hoặc tài liệu pháp lý trong một lần sử dụng cửa sổ trượt cộng với sự chú ý toàn cầu

BigBird xử lý các chuỗi trả lời câu hỏi tài liệu dài và trình tự bộ gen với sự chú ý ở quy mô tuyến tính

Tóm tắt văn bản dài một cuốn sách mà sự chú ý hoàn toàn sẽ làm cạn kiệt bộ nhớ GPU

Hệ thống truy xuất và trò chuyện theo ngữ cảnh dài sử dụng mã thông báo trung tâm toàn cầu để định tuyến thông tin chính qua hàng nghìn mã thông báo

Rủi ro & lan can

Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.

Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.

Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.

Lộ trình thực hiện

1

Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.

2

Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.

3

Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.

4

Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Sparse Attention Patterns quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Khối thưa thớt và sự chú ý thưa thớt bản địa

Câu hỏi thường gặp

What is Sparse Attention Patterns?

Sự chú ý thưa thớt làm cho Transformers rẻ hơn bằng cách cho phép mỗi mã thông báo chỉ tham gia vào một tập hợp con các mã thông báo khác được lựa chọn cẩn thận thay vì tất cả chúng. Điều này đánh đổi một chút phạm vi tiếp cận toàn cầu để tiết kiệm đáng kể bộ nhớ và tính toán trên các chuỗi dài.

Tại sao sự chú ý hoàn toàn đến bản thân lại tốn kém trong những chuỗi dài?

Sự chú ý hoàn toàn so sánh mọi mã thông báo với mọi mã thông báo khác, đưa ra chi phí O(N bình phương) về thời gian và bộ nhớ.

Sự chú ý của cửa sổ trượt (cục bộ) là gì?

Sự chú ý cục bộ hạn chế chế độ xem của từng mã thông báo ở một cửa sổ cố định gồm các mã thông báo xung quanh, giúp cắt giảm đáng kể chi phí.

Mục đích của 'mã thông báo toàn cầu' khi ít được chú ý là gì?

Một số mã thông báo toàn cầu kết nối với tất cả các vị trí, cho phép thông tin truyền qua toàn bộ chuỗi với giá rẻ.

Mô hình nào đã chứng minh rằng việc kết hợp sự chú ý ngẫu nhiên, cửa sổ và tổng thể sẽ giữ được khả năng biểu đạt sự chú ý đầy đủ?

BigBird cho thấy mô hình thưa thớt của nó là một công cụ xấp xỉ phổ quát của các hàm chuỗi trong khi chia tỷ lệ gần như tuyến tính.

Đại khái số lượng kết nối sẽ tăng như thế nào trong sự chú ý thưa thớt được thiết kế tốt?

Bằng cách giới hạn các kết nối tới các cửa sổ cục bộ cộng với một số liên kết toàn cầu, tổng số kết nối sẽ tăng lên một cách tuyến tính.