返回新聞
創新AI Understanding 簡報

論文稱,代理感知快取管理可將多代理服務中的第一個令牌延遲減少高達 45%

新的 arXiv 預印本描述了 CacheScout,這是一個建置在開源 vLLM 伺服器上的層,它根據下一步可能運行的代理程式來決定在模型的鍵值快取中保留哪些內容。作者報告了兩位數的延遲和吞吐量增益;摘要中未說明工作負載、模型和硬體。

7 min readRead the primary source
Source-provided image accompanying Paper Says Agent-Aware Cache Management Cuts First-Token Delay Up to 45% in Multi-Agent Serving
主要來源文件來源記錄
出版商
arxiv.org
來源連結
arxiv.orghttps://arxiv.org/abs/2608.14624
來源類型
主要文件-我們直接閱讀的官方公告、文件、文件或第一方頁面。
背景60 秒內了解這一點

從這裡開始

關鍵術語

代幣
由語言模型處理的文字區塊,例如單字或符號。
人工智慧(AI)
建構執行需要模式識別、推理、語言或決策的任務的系統的廣泛領域。
記憶體(代理記憶體)
AI 代理程式跨步驟或會話使用儲存的上下文來提高連續性。
測試一下自己AI 代理測驗

發生了什麼事

發佈到 arXiv 的預印本描述了 CacheScout,這是託管多代理語言模型系統的伺服器的執行時間層。它不是在最近最少使用的基礎上丟棄快取的計算,而是在線學習哪個代理傾向於遵循哪個代理,然後使用這些預測來決定保留什麼以及提前加載什麼。據報道,它基於 vLLM 構建,可將快取命中率提高 10 至 18 個百分點,並將首次令牌的平均時間縮短 18% 至 45%。

一份名為 arXiv:2608.14624 的預印本於 2026 年 7 月 16 日提交並在人工智慧 (cs.AI) 項下提交,描述了一個名為 CacheScout 的系統。列出了九位作者:Rui Zhang、Chaeeun Kim、Shaoting Feng、Kuntai Du、Yuhan Liu、Yizhong、Cheng-Wei Ching、Junchen Jiang 和 Liting Hu。作為本文基礎的列表頁面沒有說明它們的機構隸屬關係,並且該論文帶有單一版本,沒有表明同行評審或在會議或期刊上發表的資訊。

作者描述的問題特定於多代理系統的建構方式。使用者請求被分解為一系列專用代理,每個代理都針對固定的上下文區塊運行:系統提示、一組工具定義和少量範例。當語言模型處理文字時,它會產生中間注意力狀態,通常稱為鍵值快取或 KV 緩存,服務系統可以儲存和重複使用該狀態,因此不必再次處理相同的引導文字。由於代理上下文是重複的,作者認為原則上可以進行大量的重用。

他們聲稱當前的伺服器無法捕獲它。摘要稱,現有系統使用前綴快取與基於新近度的替換相結合,反應性地管理 KV 快取——保留最近使用的內容並驅逐其餘的內容。在代理管道中,代理的上下文可以在其他代理執行時處於未使用狀態,因此在再次呼叫該代理之前不久,它會被逐出,並重做工作。 CacheScout 的觀點是,未來的重用由代理執行語意決定,而不僅僅是新近度。

如上所述,該機制是在系統運行時學習代理執行轉換(哪個代理傾向於遵循哪個代理),無需預先定義的工作流程圖,也無需離線訓練,然後使用該學習模型來指導快取條目的驅逐和主動預取。作者表示,服務關鍵路徑保持不變,這意味著預測機制應該與請求處理一起放置,而不是位於其中。此實作建立在 vLLM 之上,vLLM 是一種廣泛使用的開源推理伺服器。

報告的結果應該被理解為作者的主張,而不是獨立確定的事實,如下:在摘要中所謂的代表性現實世界多代理工作負載中,緩存命中率提高了 10 到 18 個百分點,平均首次令牌時間下降了 18% 到 45%,平均每輪延遲下降了 29% 到 38%,峰值吞吐量提高了 57%。摘要補充說,這些好處可以推廣到更大的模型,首次令牌時間縮短了 54%,吞吐量提高了 37%。它沒有指定工作負載、模型、GPU、快取大小或超出所描述的前綴快取加新近度行為的基準配置,也沒有報告絕對延遲資料。

來源詳情: arxiv.org

為什麼這很重要

代理產品對每個任務進行多次模型調用,並且每次調用通常都會重新發送相同的系統提示、工具定義和範例。重新計算共享前綴佔了帳單和用戶等待時間的很大一部分。將快取視為可根據工作流程結構而不是新近度進行預測的內容,目標是在不更改模型輸出的情況下浪費資源。

代理產品的經濟性取決於重複的背景。編碼助理、客戶支援工作流程或研究代理可能會進行數十次模型呼叫來完成一項任務,每次呼叫通常會重新傳送一長串、幾乎相同的指令和工具模式前導碼。除非伺服器可以重複使用快取狀態,否則每次呼叫都會再次支付處理前導碼(預填階段)的成本。隨著工具庫存的增加,固定區塊也隨之增加,因此重新閱讀相同文字所花費的計算份額往往會增加而不是減少。

論文強調的兩個指標直接對應到人們注意到的內容。首次出現時間是指任何內容出現之前的暫停時間。每回合延遲是等待步驟完成的時間。在一次聊天機器人交流中,幾百毫秒是一個小問題;在連結多個步驟的代理循環中,相同的每次呼叫延遲會成倍增加,這是即使底層模型很快,代理功能也會感覺緩慢的常見原因。吞吐量在帳本的另一面很重要:更高的峰值吞吐量意味著相同的硬體可以服務更多的並髮用戶,這對於購買 GPU 的人來說都是一個成本問題。

概念上的轉變是最有可能比這個特定實作更持久的部分。從作業系統和網路伺服器借用的快取策略假設未來就像不久前的過去。代理工作負載以結構化、可學習的方式違反了該假設,因為代理運行的順序是應用程式的屬性而不是隨機的。值得注意的是,作者表示,他們在線上學習了這種結構,而不是要求開發人員聲明工作流程圖——一種適合代理框架實際編寫方式的設計選擇,分支、條件路由和編排由模型在運行時決定。

有幾個限制值得明確說明。重複使用 KV 快取是模型本來會重做的工作的計算快捷方式,因此原則上它不應該改變模型輸出;摘要不報告輸出品質或正確性檢查,因此期望是從技術如何工作的推論,而不是來源驗證的東西。收益的大小取決於真正重複上下文的工作負載、系統是否承受足夠的記憶體壓力以進行驅逐決策,以及硬體。相對於一種基準配置衡量的改進百分比可能會比調整得更好的配置有所縮小。主動預取也會消耗記憶體頻寬和容量,且摘要沒有量化錯誤預測的成本。

Interactive Mechanism

互動機制:它實際上是如何運作的

以互動方式探索這項發展背後的基礎技術。

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
互動式概念檢查+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

接下來看什麼

完整論文的工作負載、模型、硬體和基準配置將決定所報告的收益中有多少能夠在與其他部署的接觸中倖存下來。另外值得關注的是:程式碼是否已發布或上游到 vLLM、尾部延遲是否與報告的平均值一起改善,以及當代理順序確實不可預測時,學習模型的行為如何。

首先要檢查的是全文而不是摘要:使用了哪些多代理工作負載以及它們是否是公共的、哪些模型和 GPU、快取相對於工作集的大小以及基線的具體配置方式。與預設 vLLM 設定的比較比與其他快取感知或分層快取方法的比較弱。如果沒有這些詳細信息,報告的範圍很難與現有系統工作相比較。

二、代碼是否出現。 CacheScout 被描述為 vLLM 之上的一層,因此實際問題是它是否已發布,是否建議用於上游,以及推理提供者或服務框架維護者是否接受這個想法。此類系統論文主要透過實作來影響部署,並且需要對調度程序進行侵入性更改的技術比適合現有擴展點的技術傳播得更慢。

第三,穩健性。當代理順序穩定時,學習到的轉換模型應該有最大幫助,並且當路由高度動態或對抗時可能會降級,並且摘要不報告該狀態下的行為,也不報告負載下學習和預取的開銷。多租戶行為是源代碼沒有解決的另一個懸而未決的問題:一個工作負載的預取是否會排擠另一個工作負載的預取,以及緩存共享如何與用戶之間的隔離交互,這通常是前綴重用的一個反復出現的問題。

第四,未報告的數字。摘要給出了首次令牌時間和每輪延遲的方法; 95% 或 99% 的尾部延遲是服務等級協定所針對的,而提高平均值的策略可能會留下或惡化尾部延遲。獨立複製、同儕審查場所以及作者未選擇的工作負載測量都會提高信心。在那之前,這是一個有希望的方向,有自我報告的結果,而不是一個確定的結果。

相關指引和測驗

人工智慧代理人工智慧模型解釋變形金剛ChatGPT 與大型語言模型測試你所知道的—嘗試免費的人工智慧測驗在我們的詞彙表中尋找人工智慧術語
覺得有用嗎?