Вернуться к новостям
БезопасностьAI Understanding брифинг

Тест AWS обнаружил безопасный код детекторов уязвимостей ИИ

Help Net Security сообщает, что AWS протестировал 12 моделей искусственного интеллекта в тесте, предназначенном для того, чтобы отличать уязвимости, которые можно использовать, от безопасного кода, который только выглядит опасным. Ни один из них не соответствовал заявленному AWS производственному порогу как для ложноположительных, так и для ложноотрицательных показателей.

4 min readRead the linked source
Source-provided image accompanying AWS benchmark finds AI vulnerability detectors flag safe code
Ссылка на источникИсточник записан
Издатель
helpnetsecurity.com
Ссылка на источник
helpnetsecurity.comhttps://www.helpnetsecurity.com/2026/09/14/aws-deception-benchmark-security-vulnerabilities/
Тип источника
Связанный источник — статус первоисточника не установлен.
КонтекстПоймите это за 60 секунд

Начните здесь

Ключевые термины

Контрольный показатель
Стандартизированный тест или набор данных, используемый для измерения и сравнения производительности модели.
Точность
Доля прогнозируемых положительных результатов, которые на самом деле верны.
Проверьте себяВикторина с объяснением моделей искусственного интеллекта

Что случилось

Help Net Security сообщает, что AWS публично опубликовал свой тест Deception , который проверяет, могут ли модели ИИ отличать подлинные уязвимости программного обеспечения от безопасного кода, содержащего вводящие в заблуждение шаблоны уязвимостей. Тест включает 14 822 образца, охватывающих 16 языков программирования и более 70 категорий CWE; 9695 оцениваются, а 5127 смешаны как неоцененные выборки.

Help Net Security сообщает, что AWS оценил 12 моделей общего назначения от пяти поставщиков, используя тест, разработанный на основе ложных срабатываний. Безопасные примеры теста содержат реальные шаблоны уязвимостей, а также средства защиты, предотвращающие эксплуатацию. Некоторые проблемы зависят от условий развертывания, например сетевых политик Kubernetes, поэтому модель должна учитывать как код, так и его среду.

Согласно отчету, AWS генерировал и уточнял примеры на основе передовых моделей, исключая образцы, которые было слишком легко классифицировать. AWS говорит, что этот процесс израсходовал десятки миллиардов токенов. Компания публично выпускает образцы, но не маркирует их; пользователи отправляют прогнозы в AWS для проверки подсчета очков. Источник не уточняет, требует ли доступ к скорингу платы или других квалификационных требований.

Help Net Security сообщает, что независимые рецензенты проверяют этикетки, не видя решений друг друга или первоначальных обоснований. Спорные образцы подлежат дальнейшему рассмотрению, а неразрешенные случаи перемещаются в неоцененный набор. AWS сообщает, что менее 3% оцененных образцов остаются оспариваемыми после проверки, при этом цель состоит в том, чтобы менее 1% выдержало проверку человеком, и сообщает об отсутствии ошибок в маркировке при проверке 100 случайно выбранных оцененных образцов. Эти утверждения не получили здесь независимого подтверждения.

Подробности об источнике: helpnetsecurity.com ↗

Почему это важно

Результаты показывают, что высокие результаты поиска подозрительного кода не обязательно приводят к надежной сортировке уязвимостей. Высокий уровень ложноположительных результатов может обременить команды безопасности и ослабить доверие к оповещениям, а более строгие требования к доказательствам могут привести к тому, что модели упустят реальные уязвимости. Результаты актуальны для организаций, рассматривающих возможность проверки кода или обеспечения безопасности с помощью ИИ, но они не позволяют оценить полноценные коммерческие продукты безопасности.

Этот тест устраняет практическую слабость системы безопасности с помощью искусственного интеллекта: модель может распознать опасную на вид модель, не понимая мер контроля, предотвращающих эксплуатацию. Help Net Security сообщает, что прямые подсказки дают ложноположительные результаты от 41% до 99%, а точность варьируется от 52% до 71%.

Согласно отчету, обращение к моделям продемонстрировать, что уязвимость действительно может быть использована, снизило количество ложноположительных результатов на 17–74 процентных пункта, но увеличило уровень ложноотрицательных результатов до 7–44%. Заявленная минимальная производственная планка AWS была ниже 10% для обоих показателей, и ни одна из протестированных конфигураций не соответствовала обоим пороговым значениям.

Эти результаты не следует рассматривать как рейтинг продуктов полной безопасности. AWS тестировал одноходовые подсказки на моделях общего назначения, а не на специализированных системах, в которых используются инструменты, повторная проверка или агентные рабочие процессы. Таким образом, источник поддерживает осторожность в отношении оценок уязвимости на уровне модели, а не вывод о том, что продукты безопасности ИИ в целом терпят неудачу.

Interactive Mechanism

Интерактивный механизм: как он на самом деле работает

Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.

Thinking Budget (Test-Time Tokens):1,024 tokens
Complex Accuracy79%Math & Code Logic
Latency3.2sTime to first full output
Inference Cost$0.0092Per query estimated
Reasoning StyleStep VerificationInternal chain depth
Active Thinking Trace:
1Deconstruct user problem into formal constraints
2Propose candidate hypotheses & step-by-step calculation
3Self-correction: Backtrack and refute subtle edge cases
4Exhaustive consistency check & final output synthesis
Core takeaway: Test-time compute fundamentally changes AI economics. Instead of only scaling during pre-training, giving reasoning models more tokens at inference time allows them to systematically solve PhD-level STEM problems.
Интерактивная проверка концепции+10 Points
AI Models Explained Quiz

Which component of an AI application is the machine-learning model itself?

Что посмотреть дальше

Следите за независимыми оценками с использованием выпущенных образцов, результатами использования инструментов или многоэтапных систем безопасности, а также данными о производительности в реальных производственных средах. Источник не документирует цены, доступ на уровне обслуживания или доступность процесса оценки AWS без ограничений. Также не установлено, что протестированные модели одинаково работают с нераскрытым корпоративным кодом.

Независимые исследователи могут использовать общедоступные образцы и процесс оценки, не воссоздавая заявленные AWS затраты на создание данных, но скрытые метки и подтвержденная AWS оценка предназначены для ограничения оптимизации для конкретных тестов. Повторение сторонними группами поможет проверить сообщаемые результаты и качество маркировки.

Будущие оценки должны сравнивать однопроходные модели с системами, которые проверяют репозитории, безопасно выполняют код, анализируют конфигурацию развертывания и требуют доказательств перед выдачей предупреждения. Эти тесты лучше покажут, насколько практические инструменты безопасности улучшают результаты, полученные только на модели.

Источник оставляет важные неизвестные: он не идентифицирует 12 протестированных конфигураций модели, не сообщает о результатах каждой модели в предоставленном тексте, не документирует цены или условия доступа для проверенной оценки и не показывает, как производительность переносится на проприетарные базы кода и операции по обеспечению безопасности в реальном времени.

Сопутствующие руководства и викторины

Объяснение моделей искусственного интеллектаЭтика ИИPrompt EngineeringПроверьте свои знания — пройдите бесплатную викторину по искусственному интеллектуНайдите термин ИИ в нашем глоссарии.Следите за трекером регулирования ИИ
Нашли это полезным?