HƯỚNG DẪN KỸ THUẬT

Chú ý chớp nhoáng

Chú ý Flash là một cách thông minh để tính toán bước chú ý bên trong Transformers mà không cần ghi ma trận chú ý khổng lồ vào bộ nhớ chậm.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Nó làm cho các mô hình ngữ cảnh dài nhanh hơn và tiết kiệm bộ nhớ hơn mà không thay đổi phép toán của chúng.

Lặn sâu

Sự chú ý tiêu chuẩn so sánh mọi mã thông báo với mọi mã thông báo khác, tạo ra ma trận điểm N x N tăng bậc hai theo độ dài chuỗi. Ngây thơ, ma trận đó được ghi vào và đọc lại từ bộ nhớ băng thông cao GPU (HBM) và việc chuyển đổi đó - không phải phép nhân - là nút cổ chai thực sự. Flash Chú ý, được Trí Đạo và đồng nghiệp giới thiệu vào năm 2022, tổ chức lại việc tính toán để ma trận không bao giờ được lưu trữ đầy đủ. Nó xử lý các truy vấn, khóa và giá trị trong các ô nhỏ vừa với SRAM trên chip nhanh, tính toán một phần kết quả và ghép chúng lại với nhau bằng thủ thuật Running-softmax trực tuyến. Đầu ra giống hệt về mặt toán học với sự chú ý thông thường nhưng sử dụng bộ nhớ tuyến tính và chạy nhanh hơn nhiều lần, đặc biệt là trên các chuỗi dài.

Hiểu biết kỹ thuật

Bí quyết chính là ốp lát cộng với softmax trực tuyến. Softmax thường cần toàn bộ hàng điểm để tính mẫu số của nó, nhưng Flash Chú ý giữ mức tối đa và tổng chạy khi nó truyền phát từng ô, điều chỉnh lại tỷ lệ đầu ra từng phần trước đó để kết quả cuối cùng là chính xác. Vì điểm trung gian nằm trong SRAM (nhanh hơn HBM nhiều bậc) nên thuật toán nhận biết IO: nó giảm thiểu việc đọc và ghi bộ nhớ thay vì các phép tính số học thô.

Tác động chiến lược

Chi phí và ngân sách

Các quyết định về kiến ​​trúc sẽ thúc đẩy hiệu suất và chi phí vận hành trong nhiều năm.

Quyết định rõ ràng hơn

Giáo dục kỹ thuật giúp các nhóm chọn nhóm phù hợp chứ không chỉ nhóm mới nhất.

Kiểm soát chất lượng

Lựa chọn kỹ thuật tốt hơn làm giảm sự cố về độ tin cậy trong sản xuất.

Tương lai của sự chú ý chớp nhoáng

Flash Chú ý đã trở thành khối xây dựng mặc định, với FlashAttention-2 và FlashAttention-3 thu được nhiều thông lượng hơn từ các GPU mới hơn như H100 bằng cách cải thiện khả năng phân vùng công việc và khai thác các đường dẫn FP8 có độ chính xác thấp. Mong đợi sự đồng thiết kế tiếp tục với phần cứng, tích hợp chặt chẽ hơn vào các khung đào tạo và suy luận, cũng như các biến thể được điều chỉnh để chú ý đến ngữ cảnh thưa thớt, cửa sổ trượt và ngữ cảnh rất dài. Khi các cửa sổ ngữ cảnh mở rộng tới hàng triệu mã thông báo, các hạt nhân nhận biết IO như thế này vẫn cần thiết để duy trì bộ nhớ và tốc độ thực tế.

Triển khai trong thế giới thực

Đào tạo các mô hình ngôn ngữ lớn như hệ thống lớp Llama và GPT với cửa sổ ngữ cảnh dài hơn với chi phí bộ nhớ thấp hơn.

Phục vụ trợ lý trò chuyện nhanh hơn bằng cách đẩy nhanh giai đoạn điền trước, trong đó lần đầu tiên đọc một lời nhắc dài.

Kích hoạt các công cụ phân tích tài liệu để tiếp thu toàn bộ sách hoặc cơ sở mã bằng cách thực hiện khả năng chú ý theo trình tự dài trên một GPU duy nhất.

Cung cấp năng lượng cho hình ảnh và âm thanh Máy biến áp trong đó đầu vào có độ phân giải cao tạo ra chuỗi mã thông báo rất dài.

Rủi ro & lan can

Tối ưu hóa một điểm chuẩn có thể che giấu những điểm yếu của hệ thống rộng hơn.

Chi phí cơ sở hạ tầng và bảo trì thường được đánh giá thấp.

Khoảng cách về bảo mật và khả năng quan sát có thể tăng lên khi hệ thống trở nên phức tạp hơn.

Lộ trình thực hiện

1

Xác định các mục tiêu về độ trễ, chất lượng và chi phí trước khi triển khai.

2

Điểm chuẩn trong điều kiện tải và dữ liệu thực tế.

3

Giám sát thiết bị về lỗi, độ lệch và tác động của người dùng.

4

Chuẩn bị đường dẫn khôi phục và ứng phó sự cố trước khi mở rộng quy mô.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Flash Attention quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Triển khai chú ý và cắt tỉa đầu

Câu hỏi thường gặp

Chú ý chớp nhoáng là gì?

Chú ý Flash là một cách thông minh để tính toán bước chú ý bên trong Transformers mà không cần ghi ma trận chú ý khổng lồ vào bộ nhớ chậm. Nó làm cho các mô hình ngữ cảnh dài nhanh hơn và tiết kiệm bộ nhớ hơn mà không thay đổi phép toán của chúng.

Nút thắt chính mà Flash Chú ý nhắm đến là gì?

Flash Chú ý có tính năng nhận biết IO: nó làm giảm dữ liệu luân chuyển giữa SRAM nhanh trên chip và bộ nhớ băng thông cao chậm, đây là nút cổ chai thực sự chứ không phải là bản thân số học.

Làm cách nào để Flash Chú ý tránh lưu trữ toàn bộ ma trận chú ý N-by-N?

Nó sắp xếp tính toán sao cho mỗi khối phù hợp với SRAM nhanh, tính toán và tích lũy một phần đầu ra mà không bao giờ cụ thể hóa toàn bộ ma trận trong HBM.

Kỹ thuật nào cho phép Flash Chú ý tính toán softmax một cách chính xác mà không cần xem toàn bộ hàng cùng một lúc?

Softmax trực tuyến duy trì mẫu số đang chạy tối đa và đang chạy trong khi phát trực tiếp các ô xếp, định lại tỷ lệ các đầu ra từng phần trước đó để việc chuẩn hóa cuối cùng được chính xác.

Tại sao Flash Chú ý lại giúp ích nhiều nhất với các chuỗi dài?

Ma trận chú ý đơn giản chia tỷ lệ thành N bình phương trong bộ nhớ, do đó, việc tránh lưu trữ đầy đủ sẽ mang lại mức tiết kiệm lớn nhất chính xác khi các chuỗi dài.

Thiết kế 'IO-aware' của Flash Chú ý ưu tiên giảm thiểu điều gì?

Nhận biết IO có nghĩa là thuật toán được thiết kế xoay quanh chi phí di chuyển dữ liệu trong hệ thống phân cấp bộ nhớ, giảm thiểu lưu lượng HBM thay vì các phép toán số học.