Назад към Новини
ИновацияAI Understanding брифинг

Маршрутизирането с затворена памет има за цел да намали цената на многоагентните LLM системи

Новоподадена статия предлага запазване само на полезни стъпки за разсъждение, когато множество агенти на езикови модели си сътрудничат. Неговият абстракт отчита по-висока средна точност на бенчмарка и 31,9% намаление на разходите за изводи на HumanEval в сравнение с най-силната базова линия.

5 min readRead the primary source
Source-page capture accompanying Gated-memory routing aims to reduce the cost of multi-agent LLM systems
Документ с първичен източникИзточникът е записан
Издател
arxiv.org
Изходна връзка
arxiv.orghttps://arxiv.org/abs/2609.00237
Тип източник
Първичен документ — официално съобщение, документ, документ или първа страна, която четем директно.
КонтекстРазберете това за 60 секунди

Започнете тук

Ключови термини

Голям езиков модел (LLM)
Езиков модел, обучен върху масивни текстови корпуси за генериране и анализиране на текст.
Памет (памет на агент)
Съхраненият контекст, който AI агент използва през стъпките или сесиите, за да подобри непрекъснатостта.
Обобщение
Колко добре се представя моделът върху нови, невиждани данни извън набора за обучение.
Тествайте себе сиAI Агенти Викторина

Какво стана

Изследователите предложиха Gated-Memory Routing, система, която научава кои междинни стъпки на разсъждение да запази и извлече по време на изпълнение на LLM с множество агенти. Резюмето на документа отчита най-добрата средна точност в пет теста за разсъждения и генериране на код, надвишавайки най-силната базова линия с 2,44 пункта, като същевременно намалява разходите за изводи на HumanEval с 31,9% спрямо тази базова линия.

Документът, изпратен до arXiv на 31 август 2026 г., се отнася до оркестрацията в системи, където множество агенти на големи езикови модели работят заедно по задача. Неговите автори твърдят, че маршрутизирането, базирано само на оригиналната заявка, не може да отговори адекватно на междинен напредък или грешки. Система, която вместо това предава пълната хронология на изпълнението на всяко следващо решение, има повече контекст, но също така принуждава системата многократно да обработва излишни или нискополезни стъпки. Документът описва това натрупване като претоварване на хронологията на изпълнението, свързвайки го директно с по-високите разходи за изводи. Следователно основният проблем е представен като въпрос каква информация трябва да остане налична, докато сътрудничеството продължава. Рамката на резюмето свързва решението за маршрутизиране както с качеството на по-късните решения, така и с изчислителната тежест от многократното обработване на предишни стъпки.

Предложената настройка за маршрутизиране е описана от гледна точка на селективно задържане и извличане по време на изпълнение. Целта му е да запази полезни междинни разсъждения, като същевременно ограничи количеството история, която по-късните агенти трябва да обработват. Това описание запазва фокуса върху вътрешния информационен поток на системата: стъпките на разсъждение се оценяват за полезност, съответната информация се предоставя по-късно, а ненужният материал не се третира като еднакво важен. Следователно отчетът на вестника свързва избора на памет с по-широкия процес на оркестрация, вместо да представя паметта като отделна функция за съхранение. Методът има за цел да направи развиващото се състояние на сътрудничеството по-компактно и зависимо от задачите.

Получената система е предназначена да позволи на сътрудничеството да се промени с развитието на задачата. Решенията относно запазената информация, извлечения контекст, следващата роля, гръбнака и дали изпълнението трябва да продължи са описани като свързани части от процеса на маршрутизиране. Това дава на рамката механизъм за реагиране на междинен напредък, вместо да разчита на едно решение за фиксирано маршрутизиране, взето само от първоначалната заявка. По този начин отчетеният принос е научен начин за управление на хронологията на изпълнението в рамките на мултиагентна LLM работа, като абстрактното обвързва това управление с заявената точност и сравнения на изводи и разходи.

Детайли за източника: arxiv.org ↗

Защо има значение

Мултиагентните LLM системи могат да подобрят изпълнението на сложни задачи чрез координиране на няколко роли или модела, но пренасянето на цялата история на изпълнение във всяко следващо решение може да увеличи изчисленията и разходите. Предложеният подход е насочен към това специфично тясно място чрез поддържане на по-малко заучено състояние. Ако докладваните резултати са извън изброените оценки, методът може да направи съвместните LLM работни процеси по-икономични, без да се жертва измерената точност.

Предложението също така отразява по-широк проектен въпрос за агентния ИИ: колко минали дейности трябва да запази системата, преди допълнителният контекст да стане контрапродуктивен? Отговорът на резюмето е научено, зависимо от задачата състояние, а не фиксиран прозорец или пълен препис. Това рамкиране има значение, защото количеството запазен контекст става част от поведението на разсъжденията на системата, а не просто детайл от изпълнението. Той също така свързва управлението на междинните стъпки с практическия въпрос как съвместните LLM работни потоци могат да останат икономични, докато тяхната история расте.

Това може да бъде полезно, когато хронологията на изпълнение стане дълга или съдържа много неуспешни опити. Компактното заучено състояние може да даде на по-късни решения достъп до информация, която се счита за уместна, без да се изисква пълният препис да се пренася всеки път. Следователно потенциалната полза, описана в статията, е свързана с връзката между запазения контекст и повтарящата се обработка. Предложението не твърди, че по-малкото контекст винаги е по-добро; той описва механизъм за избор на това, което трябва да остане на разположение за следващите етапи на същата задача.

В същото време селективната памет въвежда свой собствен режим на повреда: порталът може да отхвърли детайл, който по-късно се оказва важен, или да извлече информация, която е компактна, но подвеждаща. Резюмето отчита обобщени резултати от бенчмарка, но не показва колко често възникват такива грешки в паметта. Това ограничение оставя важна част от компромиса нерешена, тъй като измерената точност сама по себе си не идентифицира дали успешните резултати зависят от надеждното задържане през цялото изпълнение. Разбирането на този компромис би помогнало да се установи кога наученото състояние е предимство и кога може да се превърне в източник на грешка.

Interactive Mechanism

Интерактивен механизъм: как всъщност работи

Разгледайте интерактивно основната технология зад тази разработка.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивна проверка на концепцията+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Какво да гледате след това

Източникът е резюме на arXiv и не предоставя имената или отделните резултати от всичките пет бенчмарка, базовите конфигурации, статистическите вариации или разходите за самите компоненти за маршрутизиране. По-нататъшната оценка трябва да проучи дали печалбите се обобщават между задачи, модели и по-дълги истории на изпълнение и дали пуснатият код поддържа възпроизводимост. Хартията е посочена като приета от EMNLP 2026, но източникът не установява внедряване или производствена производителност в реалния свят.

Възпроизводимостта и обобщението остават открити въпроси. Записът arXiv казва, че кодът е наличен и че документът е приет на основната конференция EMNLP 2026, но тези подробности не потвърждават независимо твърденията на резюмето. Наличният източник също не предоставя материали за внедряване или разширени резултати, необходими за директно оценяване на докладваното сравнение. В резултат на това следващото полезно доказателство се отнася до това дали посоченият метод и оценка могат да бъдат проверени и повторени при описаните условия.

Полезни последващи доказателства ще включват достъп до код, изследвания на аблация за всеки портал и спиращ контролер, анализи на неизправности, тестове на невиждани модели и оценки извън настройките за бенчмарк. Тези проверки ще изяснят приноса на всеки компонент и ще покажат дали докладваното поведение зависи от пълната комбинация от избор на маршрут. Те също биха помогнали за отделяне на подобренията, свързани с научената памет, от подобренията, свързани с другите части на системата. Понастоящем източникът оставя тези разграничения неуточнени.

Източникът не предоставя доказателства за производствено внедряване, въздействие върху потребителите или производителност в живи многоагентни приложения, така че тези резултати не трябва да се извеждат от докладваните експерименти. Докладваните резултати от бенчмарка и списъкът с приети документи описват наличния запис, но не установяват как методът се държи в оперативни настройки. Следователно всяка оценка извън тези резултати трябва да остане условна, докато не станат налични допълнителни технически подробности, по-широки оценки или доказателства за внедряване.

Свързани ръководства и викторини

AI агентиОбяснени модели на AIТрансформърсAI обучениеТествайте какво знаете — опитайте безплатен тест с изкуствен интелектПотърсете термин за AI в нашия речникСледвайте програмата за проследяване на пускането на AI модел
Намирате ли това за полезно?