Quay lại Tin tức
Đổi mớiAI Understanding tóm tắt

VisCache báo cáo suy luận mô hình ngôn ngữ-thị giác nhanh hơn với tính năng cắt bớt bộ nhớ đệm trực quan có chọn lọc

Một bài báo arXiv mới đề xuất VisCache, một khung không cần đào tạo giúp giảm lưu trữ bộ đệm KV trực quan cho các mô hình ngôn ngữ thị giác trong khi vẫn giữ lại 19% đến 28% bộ đệm. Các tác giả báo cáo tốc độ tăng lên tới 2,35 lần, nhưng kết quả chưa được xác nhận độc lập ở đây.

5 min readRead the primary source
Primary-source image accompanying VisCache Reports Faster Vision-Language Model Inference With Selective Visual Cache Pruning
Tài liệu nguồn chínhNguồn đã ghi
Nhà xuất bản
arxiv.org
Liên kết nguồn
arxiv.orghttps://arxiv.org/abs/2608.24063
Loại nguồn
Tài liệu chính - một thông báo chính thức, giấy tờ, hồ sơ hoặc trang của bên thứ nhất mà chúng tôi đọc trực tiếp.
Bối cảnhHiểu điều này trong 60 giây

Bắt đầu ở đây

Thuật ngữ chính

Mô hình ngôn ngữ tầm nhìn (VLM)
Một mô hình đa phương thức cùng xử lý thông tin hình ảnh và văn bản.
suy luận
Giai đoạn chạy trong đó mô hình được đào tạo tạo ra dự đoán hoặc kết quả đầu ra.
Cắt tỉa
Loại bỏ các trọng số hoặc nơ-ron mô hình ít quan trọng hơn để giảm kích thước và tính toán.
Tự kiểm traCâu đố giải thích về mô hình AI

Chuyện gì đã xảy ra

Các nhà nghiên cứu Lyuke Wang, Zhuo Li và Guanxu Zhu đã giới thiệu VisCache, một khuôn khổ giúp giảm chi phí tính toán và bộ nhớ khi suy luận theo ngữ cảnh dài trong các mô hình ngôn ngữ lớn bằng ngôn ngữ thị giác. Bài báo đã được gửi tới arXiv vào ngày 25 tháng 8 năm 2026 và mô tả phương pháp hai giai đoạn giúp loại bỏ thông tin hình ảnh dư thừa trong khi cố gắng lưu giữ thông tin quan trọng đối với quá trình chú ý của mô hình.

Bài viết đề cập đến một vấn đề hệ thống cụ thể trong các mô hình ngôn ngữ lớn bằng ngôn ngữ thị giác: suy luận theo ngữ cảnh dài có thể yêu cầu tính toán và bộ nhớ đáng kể vì mô hình này duy trì bộ đệm khóa-giá trị trực quan hoặc KV. Các bộ đệm này là một phần của cơ chế chú ý và lưu giữ thông tin được sử dụng khi mô hình xử lý các mã thông báo sau này. Các tác giả lập luận rằng các phương pháp nén hiện tại thường cắt bớt các mã thông báo trực quan và các lớp mô hình một cách thống nhất, điều này có thể loại bỏ thông tin không đồng đều và làm giảm hiệu suất. VisCache được trình bày dưới dạng một khung cắm và chạy không cần đào tạo nhằm mục đích làm cho việc nén đó có tính chọn lọc hơn.

VisCache có hai giai đoạn được báo cáo. Đầu tiên, một mô hình ngôn ngữ tầm nhìn nhẹ sẽ lọc sự dư thừa theo thời gian bằng cách chỉ chuyển tiếp các khung hình chính có thông tin về mặt ngữ nghĩa. Điều này nhằm mục đích giảm thông tin hình ảnh lặp đi lặp lại theo trình tự trong đó nhiều khung hình liền kề đóng góp ít nội dung mới. Thứ hai, bài viết giới thiệu PruneKV, một thuật toán được thiết kế xoay quanh hành vi chú ý của các mô hình ngôn ngữ thị giác. Bản tóm tắt cho biết PruneKV sử dụng phân bổ ngân sách cắt tỉa theo hình parabol giữa các lớp và quy trình cập nhật không đối xứng: nó cắt tỉa có chọn lọc các khóa trong khi hợp nhất các giá trị. Mục tiêu đã nêu là bảo toàn bối cảnh quan trọng trong khi thu nhỏ bộ đệm được lưu trữ.

Trong các thử nghiệm được tóm tắt trong bản tóm tắt, các tác giả báo cáo rằng VisCache đã đạt được tốc độ suy luận lên tới 2,35 lần và giảm mức sử dụng bộ nhớ trong khi chỉ giữ lại 19% đến 28% bộ đệm KV. Họ cũng nói rằng nó duy trì hiệu suất cạnh tranh so với các mức cơ bản hiện có và tạo ra sự cân bằng thuận lợi giữa hiệu quả và hiệu suất. Nguồn xác định tác phẩm là phiên bản 1 của bản in trước arXiv và cho biết mã có sẵn nhưng nó không cung cấp tên mô hình, bộ dữ liệu, điểm cấp nhiệm vụ, cấu hình phần cứng, đo độ trễ, tỷ lệ lỗi hoặc các điều kiện chính xác đằng sau việc tăng tốc tối đa.

Chi tiết nguồn: arxiv.org ↗

Tại sao nó quan trọng

Nếu kết quả được báo cáo vượt xa các thử nghiệm của tác giả, việc giảm yêu cầu bộ đệm KV trực quan có thể làm cho các hệ thống ngôn ngữ tầm nhìn ngữ cảnh dài ít tốn kém hơn và dễ chạy hơn trong điều kiện hạn chế về bộ nhớ. Điều đó có thể quan trọng đối với các ứng dụng phân tích video dài, chuỗi hình ảnh hoặc các đầu vào đa phương thức khác, mặc dù nguồn không xác định mức độ sẵn sàng sản xuất, khả năng tương thích mô hình rộng hoặc hiệu suất trong thế giới thực.

Tầm quan trọng thực tế của công việc này xuất phát từ việc tập trung vào suy luận hơn là đào tạo mô hình. Các hệ thống ngôn ngữ thị giác xử lý các video dài hoặc chuỗi hình ảnh mở rộng có thể bị hạn chế bởi bộ nhớ và tính toán lặp đi lặp lại ngay cả sau khi mô hình đã được huấn luyện. Một phương pháp duy trì hầu hết hiệu suất tác vụ với bộ đệm hình ảnh nhỏ hơn nhiều có thể cho phép nhiều đầu vào hơn phù hợp với bộ nhớ tăng tốc có sẵn, giảm chuyển động của dữ liệu được lưu trong bộ nhớ đệm và có khả năng giảm chi phí hoặc độ trễ của các dịch vụ đa phương thức. Đây là những tác động của cơ chế được báo cáo, không phải là kết quả được thiết lập độc lập bởi nguồn.

Cách tiếp cận được đề xuất cũng nêu bật lý do tại sao bối cảnh thị giác có thể cần được xử lý khác với bối cảnh văn bản. Một video có thể chứa nhiều khung hình với ít thay đổi về ngữ nghĩa, trong khi một số lượng nhỏ khung hình có thể chứa thông tin cần thiết để trả lời một câu hỏi. Tương tự, tầm quan trọng của việc trình bày trực quan có thể khác nhau giữa các lớp của mô hình. Tính năng lọc khung hình chính và cắt tỉa phụ thuộc vào lớp của bài báo được thiết kế xoay quanh những khác biệt đó thay vì áp dụng một quy tắc lưu giữ ở mọi nơi. Nếu cách tiếp cận này mạnh mẽ, nó có thể cung cấp cho các nhà phát triển một cách khác để quản lý nhu cầu tài nguyên của các mô hình đa phương thức mà không cần đào tạo lại từng mô hình để biểu diễn nén.

Các tuyên bố vẫn còn sơ bộ. Nguồn là bản gửi arXiv, không phải bằng chứng về sự chấp nhận được bình duyệt hoặc sao chép độc lập. “Hiệu suất cạnh tranh” không phải là sự đảm bảo chính xác và bản tóm tắt không cho biết liệu phương pháp này có duy trì độ chính xác như nhau giữa các tác vụ, độ dài video, loại hình ảnh hoặc các ứng dụng nhạy cảm với lỗi hay không. Nó cũng không chứng minh rằng việc tăng tốc được báo cáo sẽ chuyển trực tiếp thành chi phí đám mây thấp hơn hoặc độ trễ mà người dùng thấy rõ hơn vì những kết quả đó phụ thuộc vào việc triển khai phần cứng, phần mềm, phân đợt và chi phí của giai đoạn lọc bổ sung.

Interactive Mechanism

Cơ chế tương tác: Nó thực sự hoạt động như thế nào

Khám phá công nghệ cơ bản đằng sau sự phát triển này một cách tương tác.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Kiểm tra khái niệm tương tác+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Xem gì tiếp theo

Các câu hỏi chính là liệu VisCache có khái quát hóa trên các mô hình, nhiệm vụ, đầu vào hình ảnh và môi trường phần cứng khác nhau hay không và độ chính xác bị mất trong các trường hợp khó hay không. Việc sao chép độc lập, phát hành mã và kết quả điểm chuẩn chi tiết sẽ rất quan trọng để đánh giá xem mức tăng hiệu quả được báo cáo có thể hiện sự tiến bộ của hệ thống hữu ích rộng rãi hay kết quả bị giới hạn trong các điều kiện thử nghiệm của bài báo.

Ưu tiên hàng đầu là khả năng tái tạo. Các tác giả cho biết mã đã có sẵn, vì vậy các nhà nghiên cứu và kỹ sư bên ngoài có thể kiểm tra xem liệu tốc độ tăng tốc tối đa gấp 2,35 lần được báo cáo và phạm vi lưu giữ 19% đến 28% có tái diễn trên cùng một cấu hình hay không. Việc xác minh hữu ích sẽ bao gồm các định nghĩa cơ sở đầy đủ, phạm vi bao phủ của mô hình và tập dữ liệu, độ trễ từ đầu đến cuối, bộ nhớ tối đa, mức sử dụng năng lượng và chi phí chung do mô hình lọc hạng nhẹ đưa ra. Chỉ riêng kết quả tối đa không cho thấy lợi ích điển hình của khối lượng công việc.

Các nhà nghiên cứu cũng nên kiểm tra những sai sót về chất lượng do việc cắt tỉa gây ra. Việc lựa chọn khung hình chính có thể loại bỏ các sự kiện ngắn nhưng quan trọng, trong khi việc nén bộ nhớ đệm quá mức có thể ảnh hưởng đến các đối tượng, hành động hoặc mối quan hệ chỉ xuất hiện một lần. Thiết kế cắt tỉa khóa và hợp nhất giá trị không đối xứng có thể bảo toàn một số thông tin tốt hơn so với cắt tỉa đồng nhất, nhưng nguồn không xác định được nhiệm vụ nào nhạy cảm nhất hoặc lỗi thay đổi như thế nào khi khả năng lưu giữ giảm xuống. Do đó, các đánh giá nên kiểm tra khả năng truy xuất các chi tiết hình ảnh nhỏ, lý luận thời gian tầm xa và các chuỗi đối nghịch hoặc mơ hồ, chứ không chỉ điểm tổng hợp.

Cuối cùng, các yêu cầu triển khai nên được tách biệt khỏi các yêu cầu nghiên cứu. Từ nguồn này, người ta không biết mô hình ngôn ngữ thị giác nào có thể sử dụng VisCache mà không sửa đổi, liệu phương pháp này có hoạt động trên các loại máy gia tốc khác nhau hay liệu lợi ích của nó có còn khi mô hình phục vụ nhiều người dùng đồng thời hay không. Các phiên bản tương lai của bài viết, phân tích được bình duyệt, tiêu chuẩn rộng hơn và báo cáo từ những người dùng độc lập có thể làm rõ những điểm đó. Cho đến lúc đó, VisCache được hiểu rõ nhất là một đề xuất nghiên cứu đầy hứa hẹn với mức tăng hiệu quả được báo cáo, chứ không phải là một giải pháp phổ quát đã được chứng minh cho việc suy luận đa phương thức trong bối cảnh dài.

Hướng dẫn và câu hỏi liên quan

Giải thích về mô hình AIMáy biến ápChatGPT & LLMKiểm tra những gì bạn biết — thử một bài kiểm tra AI miễn phíTra cứu một thuật ngữ AI trong bảng thuật ngữ của chúng tôiTheo dõi trình theo dõi phát hành mô hình AI
Tìm thấy điều này hữu ích?