Вернуться к новостям
БезопасностьAI Understanding брифинг

Trend Micro заявляет, что ее многомодельная система лидировала в тесте эксплойтов CyberGym

Trend Micro заявляет, что ее система TrendAI AESIR привела к подтвержденным дифференциальным сбоям для 97% задач CyberGym, но результаты компании и сравнения требуют независимого подтверждения.

6 min readRead the linked source
Primary-source image accompanying Trend Micro says its multi-model system led CyberGym’s exploit benchmark
Ссылка на источникИсточник записан
Издатель
edge.prnewswire.com
Ссылка на источник
edge.prnewswire.comhttps://edge.prnewswire.com/c/link/?t=0&l=en&o=4759697-1&h=3235159974&u=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark&a=https%3A%2F%2Fwww.trendaisecurity.com%2Fen-us%2Fresources-insights%2Ftrendai-security-blog%2Ftrendai-first-on-cybergym-top-exploit-benchmark
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
API (интерфейс прикладного программирования)
Структурированный способ отправки одной программной системой запросов и получения ответов от другой системы.
Модель большого языка (LLM)
Языковая модель, обученная на массивных текстовых корпусах для генерации и анализа текста.
Проверьте себяВикторина «Агенты ИИ»

Что случилось

Trend Micro сообщает, что ее агентный механизм устранения эксплойтов TrendAI под кодовым названием AESIR набрал 97% в тесте CyberGym и занял первое место в таблице лидеров по состоянию на август 2026 года. Компания заявляет, что система произвела около 1460 доказательств на уровне байтов для 188 проектов с открытым исходным кодом и 1507 известных уязвимостей.

В сообщении блога Trend Micro по безопасности от 26 августа 2026 года говорится, что его агентный механизм устранения эксплойтов TrendAI под кодовым названием AESIR набрал 97% баллов в CyberGym. Компания описывает CyberGym как эталонный тест Калифорнийского университета в Беркли, содержащий 1507 подтвержденных уязвимостей из 188 крупных проектов с открытым исходным кодом. Задачи требуют создания определенного файла или последовательности байтов, которые приводят к сбою уязвимой программы, но не ее исправленного аналога, без доступа к исправлению или исправленному двоичному файлу во время решения.

По данным источника, результат AESIR представляет собой около 1460 индивидуально проверенных дифференциальных сбоев. Trend Micro сообщает, что система была оценена в течение 60 раундов разработки, потребляла около 235 часов процессора и потребовала около 6000 долларов США за интерфейс программирования приложений для искусственного интеллекта. Компания представляет результат как полностью автономный и утверждает, что ни один человек не участвовал в отправке тестов. Эти цифры являются претензиями на собственный счет компании; источник не предоставляет независимый аудит или полный журнал отправки.

Система описывается как градуированный конвейер. Сначала он пробует классический фаззинг, начальную мутацию и методы детерминированного построения, а затем переходит к агентам, управляемым ИИ, когда эти подходы терпят неудачу. Trend Micro сообщает, что примерно в 30% ее доказательств не использовались вызовы крупных языковых моделей, а фаззинг превосходил расширенные рассуждения ИИ примерно в четверти задач. Компания заявляет, что успешный запуск без использования ИИ может занять около 60 секунд по сравнению с примерно 18 минутами и 6 долларами США на API для попытки использования агента ИИ.

Trend Micro объясняет оставшуюся производительность внутренней онтологией уязвимостей, содержащей более 12 500 эпизодических воспоминаний и более 15 500 начальных значений эксплойтов в более чем 180 проектах. Онтология описывается как уровень операционных знаний, связывающий классы уязвимостей, двоичные форматы, типы сбоев и стратегии мутаций. Сообщается, что AESIR использует семь моделей из Anthropic, Google, OpenAI и DeepSeek в различных целях, включая анализ исходного кода, построение двоичного формата и анализ протоколов. Источник не раскрывает достаточно подробностей реализации, чтобы установить, какой вклад каждый компонент внес в итоговую оценку.

Подробности об источнике: edge.prnewswire.com ↗

Почему это важно

Результат, если его можно воспроизвести независимо, предполагает, что проектирование системы, включая постоянное знание уязвимостей, множественные модели, детерминированное фаззинг и состязательный анализ, может иметь большее значение, чем использование одной ведущей модели. Он также иллюстрирует как потенциал, так и ограничения исследований уязвимостей с помощью ИИ.

Основное значение имеет архитектура, а не просто рейтинг моделей. Trend Micro утверждает, что ведущие системы CyberGym используют многие из одних и тех же передовых моделей, хотя их оценки различаются из-за маршрутизации, памяти, использования инструментов и проверки. В его сравнении AESIR составляет 97%, Sangfor AI — 93,2%, Whitzard Фуданьского университета — 91,2%, MDASH Microsoft — 91% и Wiz Atlas — 90,9%. GPT-5.6 Sol указан на 84,5% и Claude Mythos 5 на 83,8%. Эти результаты представлены Trend Micro как состояние таблицы лидеров и должны рассматриваться как данные источника, пока не будут подтверждены оператором сравнительного анализа.

Для команд безопасности практический урок заключается в том, чтобы зарезервировать дорогостоящие вызовы моделей для случаев, которые не могут решить более дешевые и предсказуемые инструменты. Фаззеры и генераторы, ориентированные на конкретные форматы, могут быстро обрабатывать некоторые классы уязвимостей, а языковые модели могут помочь в анализе исходного кода, обосновании потока управления и многоэтапном построении эксплойтов. Уровень маршрутизации также может снизить зависимость от одного провайдера. Но заявленная экономика специфична для системы Trend Micro, рабочей нагрузки и частной базы знаний; их не следует обобщать в универсальную смету затрат.

Источник также подчеркивает состязательный обзор перекрестных моделей. В описанной конструкции AESIR одна модель предлагает гипотезу эксплойта, другая модель от другого провайдера пытается ее опровергнуть, а третья выносит решение. Роли меняются по раундам. Предполагаемое преимущество — уменьшение количества ложных срабатываний, таких как очевидные ошибки, которые невозможно обнаружить, которые блокируются проверкой входных данных или выходят за рамки заявленной модели угроз. Это потенциально полезный шаблон для инструментов безопасности ИИ, хотя источник не предоставляет данные о количестве ложноположительных результатов, количестве пропущенных уязвимостей или контролируемом сравнении с обзором одной модели.

Тест имеет значение, поскольку он тестирует конкретный артефакт, а не диалоговый ответ: входные данные на уровне байтов, которые ведут себя по-разному на уязвимом и исправленном программном обеспечении. Это более сложная задача, чем просто создание правдоподобного описания уязвимости. Несмотря на это, дифференциальный сбой в контролируемом тесте не эквивалентен надежному реальному эксплойту. Он не устанавливает, что злоумышленник может удаленно получить доступ к уязвимому коду, обойти защиту, получить полезный доступ или действовать в большом масштабе. Таким образом, результат говорит о возможностях построения эксплойтов в стандартных условиях, а не об общем киберриске или автономной наступательной готовности.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Agents Quiz

An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?

Что посмотреть дальше

Ключевые вопросы заключаются в том, подтвердят ли CyberGym или независимые исследователи эту оценку, можно ли воспроизвести оценку и насколько результат зависит от частного корпуса уязвимостей Trend Micro. Тест также не показывает, что система обнаруживает активные атаки, работает с неизвестным программным обеспечением или может безопасно работать без контроля со стороны человека.

Во-первых, необходимо независимое подтверждение. Источник сообщает, что CyberGym имеет официальную таблицу лидеров и независимую систему подачи заявок, но она не включает в себя прямую запись тестов, воспроизводимый код, представленный набор доказательств или подробный протокол для проверки оценок компании. В подтверждении должна быть установлена ​​точная версия эталонного теста, правила включения задач, аппаратные и временные ограничения, версии модели, доступ к инструментам и все ли системы оценивались в сопоставимых условиях.

Во-вторых, исследователям следует изучить преимущества частных данных. Trend Micro заявляет, что ее онтология включает в себя более двух десятилетий исследований уязвимостей, связанных с Trend Micro Research и Zero Day Initiative, включая тысячи исходных данных об эксплойтах и ​​результаты взаимодействия. Эти накопленные оперативные знания могут быть ценными, но они также затрудняют сравнение результатов с системой, использующей только общедоступную информацию. Важное неизвестное заключается в том, распространяется ли метод AESIR на новые проекты, классы уязвимостей и форматы программного обеспечения, отсутствующие в его историческом корпусе.

В-третьих, заявления о развертывании требуют отдельных доказательств. В блоге обсуждается компонент поиска угроз, который может проверять перехваты ловушек и выявлять возможные варианты использования инфраструктуры искусственного интеллекта, но эта работа отличается от оценки CyberGym. Этот тест не измеряет, обнаруживает ли AESIR активные кампании, отличает вредоносную активность от безобидного тестирования или оценивает, устранило ли выпущенное исправление реальный риск. Эти вопросы потребуют оперативных данных, раскрытия методов оценки и тщательных мер безопасности.

Наконец, командам безопасности следует следить за тем, как система справляется с неопределенностью и человеческим контролем. Trend Micro сообщает, что самые сложные оставшиеся задачи связаны с точными последовательностями декодирования FFmpeg, конечными автоматами Ghostscript и структурами ASN.1 смарт-карт. Он также предупреждает, что многомодельные системы могут пострадать от исчерпания квот, скрытых сбоев поставщиков, перерасхода средств и скрытых регрессий для каждой модели. Прежде чем такие системы будут использоваться в производстве, командам необходимы независимые журналы, метрики для каждого компонента, контролируемые разрешения, человеческий анализ решений об эксплуатации и доказательства того, что состязательные проверки уменьшают количество вредных ложных срабатываний, не скрывая при этом подлинные результаты.

Сопутствующие руководства и викторины

ИИ-агентыОбъяснение моделей искусственного интеллектаЭтика ИИИИ-безопасностьПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером регулирования ИИ
Нашли это полезным?