Sự chú ý tiềm ẩn của nhiều đầu
Chú ý tiềm ẩn nhiều đầu (MLA) là một cơ chế chú ý, được giới thiệu trong DeepSeek-V2, có chức năng nén bộ nhớ đệm khóa-giá trị ngốn bộ nhớ thành một vectơ tiềm ẩn được chia sẻ nhỏ.
Tổng quan
It lets large language models run with far less GPU memory while keeping quality close to standard attention.
Lặn sâu
Khi máy biến áp tạo văn bản, nó sẽ lưu trữ vectơ khóa và giá trị cho mọi mã thông báo trước đây trong 'bộ đệm KV'. Bộ đệm đó tăng lên theo độ dài ngữ cảnh và chi phối việc sử dụng bộ nhớ trong quá trình suy luận. MLA thay thế nhiều vectơ khóa/giá trị có kích thước đầy đủ bằng một vectơ tiềm ẩn xếp hạng thấp cho mỗi mã thông báo, sau đó dự án sao lưu tiềm ẩn đó thành các khóa và giá trị trên mỗi đầu một cách nhanh chóng. Vì chỉ có phần tiềm ẩn nhỏ gọn được lưu vào bộ nhớ đệm nên DeepSeek-V2 đã cắt giảm hơn 90% bộ nhớ bộ nhớ đệm KV so với sự chú ý của nhiều đầu tiêu chuẩn, cho phép ngữ cảnh dài hơn và kích thước lô lớn hơn. Điều quan trọng là các ma trận chiếu lên có thể được gấp lại thành các trọng số khác, do đó MLA đạt được mức nén này mà không gây tổn thất nhiều hoặc có thể đo lường được về chất lượng mô hình hóa.
Hiểu biết kỹ thuật
MLA thực hiện nén khớp thứ hạng thấp: trạng thái ẩn của mỗi mã thông báo được chiếu xuống một vectơ tiềm ẩn nhỏ và các ma trận chiếu lên riêng biệt sẽ tái tạo lại các khóa và giá trị trên mỗi đầu. Một thủ thuật thông minh là 'hấp thụ' các trọng số chiếu lên vào các phép chiếu truy vấn và đầu ra, do đó mô hình không bao giờ hiện thực hóa đầy đủ các khóa/giá trị trong quá trình suy luận. Việc nhúng vị trí quay được xử lý bằng đường dẫn khóa tách rời, vì thao tác xoay không thể được hấp thụ theo cách tương tự, bảo toàn thông tin vị trí.
Tác động chiến lược
Tốc độ và tỷ lệ
Quy trình công việc ngôn ngữ có thể di chuyển nhanh hơn mà không làm mất tính nhất quán.
Truy cập và tiếp cận
Nó mở rộng quyền truy cập vào các ngôn ngữ và phong cách giao tiếp.
Quyết định rõ ràng hơn
Các nhóm có thể dành nhiều thời gian hơn để đánh giá trong khi quá trình tự động hóa xử lý sự lặp lại.
Tương lai của sự chú ý tiềm ẩn của nhiều đầu
MLA đã giúp DeepSeek-V2 và V3 tiết kiệm chi phí khi phân phát trên quy mô lớn và kỹ thuật này đang lan rộng khi các nhóm theo đuổi việc suy luận theo ngữ cảnh dài với chi phí rẻ hơn. Mong đợi tính năng nén tiềm ẩn kiểu MLA sẽ kết hợp với các lớp Hỗn hợp chuyên gia thưa thớt, bộ đệm lượng tử hóa và giải mã suy đoán trong các mô hình mở trong tương lai. Các nhà nghiên cứu cũng đang khám phá xem chiều tiềm ẩn có thể co lại đến mức nào trước khi chất lượng giảm xuống và liệu ý tưởng cấp thấp tương tự có thể thu hút sự chú ý trong quá trình đào tạo chứ không chỉ suy luận hay không.
Triển khai trong thế giới thực
Cung cấp các mô hình trò chuyện DeepSeek-V2/V3 với dung lượng bộ nhớ GPU nhỏ hơn đáng kể cho mỗi yêu cầu
Chạy câu hỏi tài liệu dài để trả lời trong đó bộ đệm KV lớn sẽ làm cạn kiệt VRAM
Tăng kích thước lô suy luận trên GPU cố định vì mỗi chuỗi chỉ lưu trữ một vectơ tiềm ẩn nhỏ
Kích hoạt cửa sổ ngữ cảnh dài hơn trên phần cứng hàng hóa cho các trợ lý tăng cường truy xuất
Rủi ro & lan can
Sự thật ảo giác có thể lặng lẽ đi vào báo cáo, luồng hỗ trợ hoặc kết quả nghiên cứu.
Sự nhạy cảm kịp thời có thể tạo ra kết quả không nhất quán đối với các yêu cầu tương tự.
Dữ liệu văn bản nhạy cảm có thể bị lộ nếu khả năng kiểm soát quyền truy cập yếu.
Lộ trình thực hiện
Xác định định dạng đầu ra, âm thanh và tiêu chuẩn chất lượng trước khi triển khai.
Phản hồi mặt đất với các nguồn đáng tin cậy bất cứ khi nào độ chính xác quan trọng.
Duy trì điểm kiểm tra đánh giá của con người đối với các kết quả đầu ra có mức độ rủi ro cao.
Theo dõi các kiểu lỗi và đào tạo lại các lời nhắc hoặc quy trình làm việc thường xuyên.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Multi-Head Latent Attention quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Chú ý nhiều truy vấn
Câu hỏi thường gặp
What is Multi-Head Latent Attention?
Chú ý tiềm ẩn nhiều đầu (MLA) là một cơ chế chú ý, được giới thiệu trong DeepSeek-V2, có chức năng nén bộ nhớ đệm khóa-giá trị ngốn bộ nhớ thành một vectơ tiềm ẩn được chia sẻ nhỏ. Nó cho phép các mô hình ngôn ngữ lớn chạy với bộ nhớ GPU ít hơn nhiều trong khi vẫn duy trì chất lượng gần với tiêu chuẩn.
Vấn đề chính mà Hệ thống Chú ý Tiềm ẩn Nhiều Đầu được thiết kế để giảm thiểu là gì?
MLA nhắm mục tiêu vào bộ đệm KV, bộ đệm này phát triển theo độ dài ngữ cảnh và chiếm ưu thế trong bộ nhớ trong quá trình tạo văn bản.
MLA thu nhỏ bộ đệm KV như thế nào?
MLA lưu trữ một vectơ tiềm ẩn nhỏ gọn cho mỗi mã thông báo và xây dựng lại các khóa và giá trị từ nó thông qua phép chiếu lên.
Mô hình nào lần đầu tiên giới thiệu Chú ý tiềm ẩn nhiều đầu?
MLA được DeepSeek giới thiệu trong mẫu DeepSeek-V2 và được đưa vào DeepSeek-V3.
Tại sao MLA cần một đường dẫn 'tách rời' riêng để nhúng vị trí quay?
Phép biến đổi quay không thể được hấp thụ vào các ma trận trọng số khác, do đó MLA giữ một thành phần khóa nhỏ được tách rời để mang thông tin vị trí.
DeepSeek-V2 đã báo cáo mức độ giảm bộ nhớ KV-cache từ MLA so với sự chú ý nhiều đầu tiêu chuẩn?
DeepSeek-V2 cho biết đã cắt giảm hơn 90% bộ nhớ KV-cache, cho phép bối cảnh dài hơn và lô lớn hơn.