Zpět na Novinky
InovaceInstruktáž AI Understanding

Papír říká, že správa mezipaměti Agent-Aware snižuje zpoždění prvního tokenu až o 45 % při poskytování více agentů

Nový předtisk arXiv popisuje CacheScout, vrstvu postavenou na open-source serveru vLLM, která rozhoduje o tom, co se má ponechat v mezipaměti klíč–hodnota modelu na základě toho, který agent bude pravděpodobně spuštěn jako další. Autoři uvádějí dvouciferné zvýšení latence a propustnosti; pracovní zatížení, modely a hardware nejsou uvedeny v abstraktu.

7 min readRead the primary source
Source-provided image accompanying Paper Says Agent-Aware Cache Management Cuts First-Token Delay Up to 45% in Multi-Agent Serving
Primární zdrojový dokumentZdroj zaznamenán
Vydavatel
arxiv.org
Odkaz na zdroj
arxiv.orghttps://arxiv.org/abs/2608.14624
Typ zdroje
Primární dokument — oficiální oznámení, papír, podání nebo stránka první strany, kterou čteme přímo.
KontextPochopte to za 60 sekund

Začněte zde

Klíčové pojmy

Žeton
Část textu zpracovaná jazykovými modely, jako je slovo nebo symbol.
umělá inteligence (AI)
Široká oblast budování systémů, které provádějí úkoly vyžadující rozpoznávání vzorů, uvažování, jazyk nebo rozhodování.
Paměť (paměť agenta)
Uložený kontext, který agent AI používá v krocích nebo relacích ke zlepšení kontinuity.
Otestujte seKvíz AI agentů

Co se stalo

Předtisk zveřejněný na arXiv popisuje CacheScout, runtime vrstvu pro servery, které hostují systémy jazykových modelů s více agenty. Namísto toho, aby zahodil výpočty uložené v mezipaměti na nejméně nedávno používaném základě, zjišťuje online, který agent má tendenci kterého následovat, a poté pomocí těchto předpovědí rozhoduje, co ponechat a co načíst předem. Je postaven na vLLM a uvádí se, že zvyšuje míru návštěvnosti mezipaměti o 10 až 18 procentních bodů a snižuje průměrnou dobu do prvního tokenu o 18 až 45 procent.

Předtisk uvedený jako arXiv:2608.14624, předložený 16. července 2026 a uložený pod umělou inteligencí (cs.AI), popisuje systém nazvaný CacheScout. Je uvedeno devět autorů: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang a Liting Hu. Stránka se seznamem, která je základem pro tento článek, neuvádí jejich institucionální příslušnost a článek obsahuje jedinou verzi bez uvedení recenzního posudku nebo publikace na konferenci nebo v časopise.

Problém, který autoři popisují, je specifický pro to, jak jsou multiagentní systémy stavěny. Požadavek uživatele je rozdělen do posloupnosti specializovaných agentů a každý z těchto agentů běží proti pevnému bloku kontextu: systémová výzva, sada definic nástrojů a několik příkladů. Když jazykový model zpracovává text, vytváří střední stav pozornosti, běžně nazývaný mezipaměť klíč-hodnota nebo KV mezipaměť, kterou může obslužný systém uložit a znovu použít, takže stejný úvodní text nemusí být zpracován znovu. Protože se kontexty agentů opakují, autoři tvrdí, že v zásadě je k dispozici velké množství opětovného použití.

Jejich tvrzení je, že současné servery to nedokážou zachytit. Abstrakt říká, že stávající systémy spravují mezipaměť KV reaktivně pomocí mezipaměti předpon v kombinaci s náhradou založenou na aktuálnosti – ponechávají to, co bylo používáno naposledy, a vyřazují zbytek. V kanálu agentů může kontext agenta zůstat nevyužit, zatímco ostatní agenti běží, takže je vyřazen krátce předtím, než je tento agent znovu vyvolán, a práce je přepracována. CacheScout uvádí, že budoucí opětovné použití se řídí sémantikou provádění agenta spíše než samotnou aktuálností.

Mechanismus, jak je popsán, spočívá v tom, naučit se přechody spouštění agenta za běhu systému – který agent má tendenci sledovat který – bez předem definovaného grafu pracovního postupu a bez offline školení, a poté použít tento naučený model k vedení jak vyklizení, tak proaktivního předběžného načítání položek mezipaměti. Autoři říkají, že kritická cesta pro obsluhu zůstává nezměněna, což znamená, že predikční mechanismus má sedět vedle zpracování požadavků, nikoli uvnitř. Implementace je postavena na vLLM, široce používaném open-source inferenčním serveru.

Hlášené výsledky, které je třeba chápat jako tvrzení autorů spíše než jako nezávisle zjištěná fakta, jsou tyto: v rámci toho, co abstrakt nazývá reprezentativním reálným multiagentním pracovním zatížením, se míra úspěšnosti mezipaměti zlepšila o 10 až 18 procentních bodů, průměrný čas do prvního tokenu klesl o 18 až 45 procent, průměrná latence na otočku klesla o 29 až 38 procent a maximální propustnost se zvýšila o 57 procent. Abstrakt dodává, že výhody se zobecňují u větších modelů, kdy se čas do prvního tokenu zkrátí až o 54 procent a propustnost o 37 procent vyšší. Neuvádí pracovní zatížení, modely, GPU, velikosti mezipaměti nebo základní konfiguraci nad rámec popsaného chování ukládání do mezipaměti předpony plus aktuálnost a nehlásí žádné absolutní hodnoty latence.

Podrobnosti o zdroji: arxiv.org

Proč na tom záleží

Produkty Agent provádějí mnoho modelových volání na úlohu a každé volání obvykle znovu posílá stejnou systémovou výzvu, definice nástrojů a příklady. Přepočet tohoto sdíleného předčíslí představuje velký podíl na účtu a čekání, které uživatel pociťuje. Zacházení s mezipamětí jako s něčím předvídatelným ze struktury pracovního postupu, spíše než z aktuálnosti, cíle, které plýtvají beze změny výstupů modelu.

Ekonomika produktů agentů závisí na opakovaném kontextu. Asistent kódování, pracovní postup zákaznické podpory nebo výzkumný agent mohou provést desítky modelových volání, aby dokončili jeden úkol, a každý hovor obvykle znovu odešle dlouhou, téměř identickou preambuli instrukcí a schémat nástrojů. Náklady na zpracování této preambule – fáze předvyplnění – se platí znovu při každém volání, pokud server nemůže znovu použít stav mezipaměti. Jak rostou zásoby nástrojů, roste s nimi i tento pevný blok, takže podíl výpočtů strávených opětovným čtením stejného textu má tendenci se spíše zvyšovat než zmenšovat.

Dvě metriky, které papír zdůrazňuje, se mapují přímo na to, čeho si lidé všimnou. Time-to-first- je pauza, než se něco objeví. Latence na otočku je čekání na dokončení kroku. V jedné výměně chatbota je několik set milisekund menším podrážděním; ve smyčce agenta, která řetězí mnoho kroků, se stejné zpoždění na volání znásobí a je to běžný důvod, proč se agentní funkce cítí pomalí, i když je základní model rychlý. Na propustnosti záleží na druhé straně knihy: vyšší špičková propustnost znamená, že stejný hardware slouží více souběžným uživatelům, což je otázka nákladů pro každého, kdo platí za GPU.

Koncepční krok je část, která s největší pravděpodobností přežije tuto konkrétní implementaci. Zásady ukládání do mezipaměti vypůjčené z operačních systémů a webových serverů předpokládají, že budoucnost vypadá jako nedávná minulost. Pracovní zátěže agentů porušují tento předpoklad strukturovaným a poučitelným způsobem, protože pořadí, ve kterém agenti běží, je spíše vlastností aplikace než náhodné. Autoři zejména říkají, že se tuto strukturu naučili online, místo aby požadovali, aby vývojáři deklarovali graf pracovního postupu – volba návrhu, která odpovídá tomu, jak jsou rámce agentů skutečně napsány, s větvením, podmíněným směrováním a orchestrací, o které rozhoduje model za běhu.

Několik limitů si zaslouží, aby bylo jasně uvedeno. Opětovné použití mezipaměti KV je výpočetní zkratka pro práci, kterou by model jinak předělal, takže v zásadě by nemělo měnit výstupy modelu; abstrakt neuvádí kontroly kvality výstupu nebo správnosti, takže očekávání je spíše odvozením z toho, jak technika funguje, než něčím, co ověřuje zdroj. Velikost zisků závisí na pracovní zátěži, která se skutečně opakuje, na tom, zda je systém pod dostatečným paměťovým tlakem, aby rozhodnutí o vystěhování byla důležitá, a na hardwaru. Procentuální zlepšení měřená oproti jedné základní konfiguraci se mohou zmenšit oproti lépe vyladěné konfiguraci. Proaktivní předběžné načítání také spotřebovává šířku pásma a kapacitu paměti a souhrn nekvantifikuje, kolik stojí chybná předpověď.

Interactive Mechanism

Interaktivní mechanismus: Jak to vlastně funguje

Interaktivně prozkoumejte základní technologii tohoto vývoje.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Interaktivní kontrola konceptu+10 Points
AI Agents Quiz

What is the most accurate way to describe what AI Agents can do today?

Na co se dále dívat

Úplná pracovní zátěž, modely, hardware a základní konfigurace určují, kolik z hlášeného zisku přežije kontakt s jinými nasazeními. Také stojí za to sledovat: zda je kód uvolněn nebo upstreamován do vLLM, zda se latence ocasu zlepší spolu s hlášenými průměry a jak se naučený model chová, když je příkaz agenta skutečně nepředvídatelný.

První věc, kterou je třeba zkontrolovat, je spíše úplný dokument než abstrakt: které pracovní zátěže pro více agentů byly použity a zda jsou veřejné, které modely a GPU, jak velká byla mezipaměť vzhledem k pracovní sadě a jak přesně byla nakonfigurována základní linie. Porovnání s výchozím nastavením vLLM je slabší test než srovnání s jinými přístupy s podporou mezipaměti nebo s víceúrovňovým ukládáním do mezipaměti. Bez těchto podrobností lze uváděné rozsahy jen obtížně porovnat se stávajícími systémy.

Za druhé, zda se kód objeví. CacheScout je popsán jako vrstva nad vLLM, takže praktickou otázkou je, zda je uvolněna, zda je navržena pro upstreaming a zda poskytovatelé odvození nebo správci rámce služeb tuto myšlenku uchopí. Dokumenty o systémech tohoto druhu ovlivňují nasazení především prostřednictvím implementací a technika, která vyžaduje invazivní změny v plánovači, se pohybuje pomaleji než ta, která se hodí k existujícímu bodu rozšíření.

Za třetí, robustnost. Model naučeného přechodu by měl nejvíce pomoci, když je pořadí agentů stabilní a mohlo by se zhoršit, když je směrování vysoce dynamické nebo nepřátelské, a abstrakt neuvádí chování v tomto režimu, ani režii učení a předběžného načítání při zatížení. Chování více nájemců je další otevřená otázka, kterou zdroj neřeší: zda předběžné načítání jedné zátěže vytlačuje jinou zátěž a jak sdílení mezipaměti interaguje s izolací mezi uživateli, což je obecně opakovaný problém pro opětovné použití prefixů.

Za čtvrté, čísla, která nebyla hlášena. Abstrakt uvádí prostředky pro čas do prvního tokenu a latenci na kolo; Koncové latence na 95. nebo 99. percentilu jsou tím, proti čemu jsou psány dohody o úrovni služeb, a politika, která zlepšuje průměry, může opustit nebo zhoršit konec. Nezávislá replikace, místo vzájemného hodnocení a měření pracovní zátěže, které si autoři nevybrali, by zvýšily důvěru. Do té doby se jedná o slibný směr s výsledky, které si sami hlásí, nikoli s ustáleným výsledkem.

Související průvodci a kvízy

Agenti AIVysvětlení modelů AITransformátoryChatGPT a LLMOtestujte si, co víte – vyzkoušejte bezplatný kvíz AIVyhledejte si termín AI v našem slovníku
Považujete to za užitečné?