Вернуться к новостям
ИнновацииAI Understanding брифинг

TOPAS предлагает планирование с учетом рабочего процесса для сокращения многоагентных заданий LLM

В новом документе arXiv представлен TOPAS — планировщик, который совместно управляет кэшированными префиксами LLM и выполнением запросов в многоэтапных рабочих процессах агентов. Авторы сообщают о более низком времени выполнения заданий по сравнению с протестированными базовыми показателями для синтетических рабочих процессов и двух рабочих нагрузок по разработке программного обеспечения MetaGPT.

6 min readRead the primary source
Primary-source image accompanying TOPAS proposes workflow-aware scheduling to shorten multi-agent LLM jobs
ПервоисточникИсточник записан
Издатель
arxiv.org
Ссылка на источник
arxiv.orghttps://arxiv.org/abs/2608.25523
Тип источника
Первичный документ — официальное объявление, документ, файл или собственная страница, которую мы читаем напрямую.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Память (Память агента)
Сохраненный контекст, который агент ИИ использует на этапах или сеансах для улучшения непрерывности.
Системная подсказка
Инструкция с высоким приоритетом, определяющая поведение, политику и стиль ответа модели.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Исследователи предлагают TOPAS, планировщик задач, ориентированный на префиксы, для обслуживания многоагентных рабочих процессов с большой языковой моделью. Он решает, какие префиксы агентов остаются в общем кэше «ключ-значение» и какие запросы следует выполнять, балансируя повторное использование кэша с ходом всего рабочего процесса.

Статья посвящена конкретной системной проблеме многоагентного обслуживания LLM: кэшированию префиксов. Когда агент неоднократно использует длинное системное приглашение или другой общий префикс, сохранение его кэша значений ключа может ускорить последующий вызов модели. Но тот же кеш занимает память графического процессора, которую в противном случае можно было бы использовать для пакетной обработки одновременных запросов. Авторы описывают это как компромисс между непосредственной локализацией префикса и продвижением через многоэтапный рабочий процесс. В этой формулировке содержимое кэша является частью состояния планирования, а не отдельной деталью реализации.

TOPAS решает эту проблему, принимая два решения одновременно. Он выбирает, какие префиксы агента сохранить в рамках общего бюджета кэша ключей и значений, а какие ожидающие запросы запланировать для выполнения. Его метод оценки оценивает возможные состояния после принятия решения, балансируя ожидаемое сокращение самого длинного оставшегося пути обслуживания каждой задачи с краткосрочной выгодой от повторного использования нисходящих префиксов. В расчете также учитываются затраты на перемещение префикса и упреждение. Планировщик включает в себя механизм устаревания на уровне задач, предназначенный для предотвращения неопределенного ожидания некоторых задач. Эти компоненты объединяют размещение в памяти, порядок запросов и ход рабочего процесса в одной политике.

Авторы реализовали TOPAS в рамках SGLang и оценили его на трех синтетических направленных ациклических графических рабочих нагрузках и двух рабочих процессах разработки программного обеспечения MetaGPT. В документе сообщается, что по сравнению с лучшими базовыми показателями для каждой рабочей нагрузки и показателя TOPAS сократил среднее время выполнения заданий и время выполнения 99-го процентиля на целых 39,8% и 49,4% при синтетических рабочих нагрузках. При рабочей нагрузке MetaGPT-SOP среднее время выполнения задания сокращается на 9,8%. На MetaGPT-TL он сообщает о сокращении среднего времени завершения на 22,0% и на 26,6% при 99-м процентиле. Эти цифры являются утверждениями газеты, а не независимыми проверенными результатами из предоставленного источника. Таким образом, оценка описывает сообщаемое поведение реализации в перечисленных тестовых рабочих нагрузках.

Предложение примечательно тем, что сочетает выбор кэша с выбором выполнения на уровне рабочего процесса. Эта комбинация представляет собой разработку центральных систем, описанную в документе, а приведенные проценты предоставляют доказательства ее влияния на время завершения.

Подробности об источнике: arxiv.org ↗

Почему это важно

Мультиагентные системы часто вызывают вызовы зависимых моделей, поэтому решение о планировании, которое помогает одному запросу, может задержать последующие этапы. В документе сообщается о существенном сокращении среднего и хвостового времени выполнения заданий при оцененных рабочих нагрузках, предполагая, что обслуживающая инфраструктура, а не только качество модели, может существенно повлиять на производительность и стоимость агентских систем.

Практическая значимость заключается в структуре рабочих процессов агентов. Многоагентная задача часто представляет собой не один запрос модели, а цепочку или граф вызовов, при этом более поздние вызовы ожидают более ранних выходных данных. Планировщик, который оптимизирует только следующий запрос или только повторное использование кэша, может улучшить локальную метрику, одновременно задерживая критический нисходящий путь. Вместо этого TOPAS рассматривает оставшийся путь рабочего процесса как часть решения по планированию, которое является прямой попыткой согласовать поведение обслуживания с завершением общей задачи пользователя. Это делает единицу оптимизации заданием рабочего процесса, а не изолированным вызовом модели.

Сообщенные сокращения потенциально значимы, поскольку время выполнения задания влияет на то, насколько быстро агент сможет ответить и сколько одновременных рабочих процессов может поддерживать обслуживающая система. Улучшения в использовании кэша и планировании также могут снизить потребность в добавлении оборудования для конкретной рабочей нагрузки, хотя источник не измеряет экономию инфраструктуры, энергопотребление, эксплуатационные расходы, качество ответа или удовлетворенность пользователей. Таким образом, в документе приводятся данные о планировании задержки в тестовой установке, а не полное обоснование экономики развертывания. Эти неизмеренные размеры остаются отдельными от результатов задержки.

В работе также подчеркивается ограничение оценки производительности агента исключительно на уровне вызова модели. Для многоступенчатых систем модель может выдавать одни и те же выходные данные, в то время как пользователи испытывают разные задержки, поскольку запросы конкурируют за память и слоты выполнения. Делая явными зависимости состояния префикса и рабочего процесса, статья предлагает системную перспективу, которая может быть полезна инженерам, проектирующим инфраструктуру обслуживания агентов. Тем не менее, источник не утверждает, что TOPAS повышает надежность, точность, справедливость среди пользователей или безопасность; его заявленная цель - время завершения работы. Это различие имеет значение, поскольку более быстрое завершение само по себе не демонстрирует более широкого качества системы.

В более общем плане, статья связывает поведение инфраструктуры с видимым пользователем сроком выполнения сложных задач ИИ. Эта связь помогает объяснить, почему планирование с учетом рабочего процесса может иметь значение, даже если базовая модель и сгенерированные результаты остаются неизменными, при этом доказательства источника ограничиваются сообщаемой оценкой.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Agent Lifecycle Stage:
1
User Intent & Planning: "Audit customer refund request #4092 and settle payment."
2
Tool Calling: Emits structured JSON call crm_get_transaction(id='4092').
3
Guardrail & Verification:🛡️ Paused: High-value action requires human operator sign-off.
4
Final Settlement: Refund recorded, email receipt dispatched, and audit log stored.
Core takeaway: An AI agent is not just a language model—it is a closed loop of planning, tool invocation, and environment feedback. Production systems require self-healing retries and strict human approval guardrails.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Результаты взяты из одного препринта arXiv и ограниченной оценки: три синтетических направленных ациклических графа и два рабочих процесса MetaGPT. Важные открытые вопросы включают производительность производственного трафика, различные стеки обслуживания моделей, более крупные или разнообразные рабочие процессы, а также влияние накладных расходов на реализацию и политик кэширования за пределами тестируемых настроек.

Первый вопрос заключается в том, сохранятся ли полученные результаты за пределами пяти групп рабочей нагрузки, упомянутых в газете. Три рабочих нагрузки являются синтетическими, а остальные две идентифицируются как рабочие процессы разработки программного обеспечения MetaGPT. В предоставленном тексте источник не предоставляет размеры рабочей нагрузки, распределение трафика, конфигурации модели, сведения об оборудовании, имена базовых показателей или различия между повторными запусками. Эти детали важны для оценки того, насколько широко применимы проценты. Без них численные сравнения трудно перенести непосредственно в другую обслуживающую среду.

Особенно информативной будет оценка по реальным следам производства. Производственные системы могут иметь нерегулярные шаблоны поступления, отмены, разную длину запросов, несколько моделей, изменение резидентности кэша и целевые уровни обслуживания, которые не представлены фиксированным графом рабочего процесса. Также было бы полезно знать, как ведет себя TOPAS, когда перемещение префикса и вытеснение являются дорогостоящими, когда бюджет кэша очень мал или когда рабочие процессы содержат ветви, которые выполняются непредсказуемо. Такие тесты будут проверять одни и те же компромиссы в условиях, более разнообразных, чем те, которые описаны в предоставленной оценке.

Это документ, отправленный arXiv от 26 августа 2026 года, и источник идентифицирует его как восьмистраничный документ. Предоставленная запись не устанавливает экспертную оценку, независимую репликацию, доступность общедоступного кода или развертывание обслуживающим поставщиком. Последующая работа должна проверить эти проблемы, сравнить TOPAS с дополнительными планировщиками, сообщить о компромиссах в ресурсах и качестве, а также изучить, приводит ли механизм старения к различным задержкам между задачами. До тех пор наиболее убедительным выводом является то, что авторы сообщают о многообещающем методе планирования в рамках ограниченной экспериментальной оценки. Объем этого вывода должен оставаться привязанным к имеющимся здесь доказательствам и описаниям рабочей нагрузки.

Таким образом, наиболее полезными следующими доказательствами будут объединение более широких рабочих нагрузок с прозрачными деталями эксперимента и измерениями после завершения проекта. Эти дополнения прояснят как воспроизводимость, так и практические ограничения описанного подхода к планированию, не меняя при этом того, что утверждается в текущем документе.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаТрансформерыПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером выпуска моделей AI
Нашли это полезным?