ДалееСледующее руководство
Оперативная безопасность с использованием искусственного интеллекта
Технический
Техническое РУКОВОДСТВО
Безопасность MCP покрывает риски, возникающие при подключении агентов ИИ к серверам протокола контекста модели.
Самый известный риск — это отравление инструмента, когда в описании инструмента скрываются инструкции, которым следует модель, но пользователь их никогда не видит. Поскольку серверы MCP могут читать файлы, отправлять сообщения и действовать с использованием реальных учетных данных, один злонамеренный или неосторожный сервер может превратить полезного помощника в способ украсть данные или нанести ущерб.
Протокол контекста модели, который Anthropic представил в конце 2024 года, стандартизирует способ подключения приложений ИИ к внешним инструментам и данным. Клиент, такой как настольный помощник или IDE, подключается к серверам, и каждый сервер рекламирует инструменты с именами, описаниями и схемами ввода. Модель читает эти описания как часть своего контекста, и именно здесь возникает основной риск. При отравлении инструмента вредоносные инструкции помещаются в описание или метаданные инструмента. Модель рассматривает описание как надежное руководство, но многие интерфейсы показывают пользователям только краткое имя, поэтому скрытый текст остается невидимым. Отравленный инструмент также может определять, как модель использует другие законные инструменты. Иногда это называют затенением инструмента. Удаление ковра происходит, когда сервер, который был признан безопасным, позже меняет определения своих инструментов. Большинство утверждений происходит один раз, поэтому изменение может остаться незамеченным. Чрезмерно широкие разрешения увеличивают урон от любой атаки. Сервер, хранящий токен с полным доступом к учетной записи, или сервер файловой системы, расположенный в домашнем каталоге, дает злоумышленнику гораздо больше, чем необходимо для выполнения задачи. Запутавшийся депутат — это доверенный компонент, которого обманом заставили использовать свои полномочия для кого-то другого. В настройках MCP распространенной версией является непрямое внедрение подсказок: ненадежный контент, такой как веб-страница, электронная почта или комментарий к проблеме, втягивается в контекст и сообщает агенту, что ему следует злоупотреблять доступом к другому серверу. Модель не может достоверно отличать данные от инструкций. Ошибочно думать, что установка только надежных серверов решит проблему. Инъекция может осуществляться через обычные данные, возвращаемые надежными инструментами. Для защиты нужны уровни: проверять и пин-серверы, показывать полные описания и предупреждать при их изменении, предоставлять минимальные привилегии, изолировать серверы друг от друга, требовать подтверждения для конфиденциальных действий и протоколировать все.
Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.
Техническое образование помогает командам выбрать правильный стек, а не только самый новый.
Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.
Спецификация MCP и ее экосистема со временем добавляли функции безопасности, включая модель авторизации на основе OAuth и руководство по согласию пользователя на вызовы инструментов. Появляются реестры, инструменты подписи и сканирования, которые помогают людям определить, откуда взялся сервер. Само по себе быстрое внедрение остается нерешенной исследовательской проблемой, поэтому ни одно исправление не делает описания инструментов или выходные данные инструментов полностью безопасными. Архитектура на данный момент является самой надежной защитой: минимум привилегий, изоляция, человеческие контрольно-пропускные пункты для высокоэффективных действий и мониторинг. Организации, внедряющие MCP, должны рассчитывать на то, что будут управлять серверами так же, как они управляют зависимостями стороннего программного обеспечения.
«Погодный» сервер MCP включает в описание своего инструмента скрытую строку, сообщающую модели прочитать SSH-ключ пользователя и передать его в качестве дополнительного параметра. В интерфейсе чата отображается только название инструмента, поэтому пользователь ничего не замечает.
Популярный сервер сообщества работает хорошо в течение нескольких недель, а затем выпускает обновление, которое меняет описание инструмента и приводит к утечке содержимого разговоров. Клиенты, которые не закрепляют версии и не проверяют измененные определения, автоматически принимают изменения.
Агент, имеющий как сервер GitHub, так и сервер электронной почты, считывает общедоступную задачу, содержащую внедренные инструкции, а затем использует доступ к своему частному хранилищу для раскрытия секретов электронной почты. Это атака с использованием замешательства, которая использует законные разрешения пользователя.
Компания использует свои внутренние серверы MCP с токенами только для чтения, предназначенными для отдельных проектов, требует одобрения человека для любого инструмента, отправляющего данные наружу, и регистрирует каждый вызов инструмента для проверки.
Оптимизация одного теста может скрыть более широкие недостатки системы.
Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.
Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.
Определите целевые показатели задержки, качества и стоимости перед внедрением.
Тестирование при реалистичной нагрузке и условиях данных.
Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.
Перед масштабированием подготовьте пути отката и реагирования на инциденты.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Безопасность MCP покрывает риски, возникающие при подключении агентов ИИ к серверам протокола контекста модели. Самый известный риск — это отравление инструмента, когда в описании инструмента скрываются инструкции, которым следует модель, но пользователь их никогда не видит. Поскольку серверы MCP могут читать файлы, отправлять сообщения и действовать с использованием реальных учетных данных, один злонамеренный или неосторожный сервер может превратить полезного помощника в способ украсть данные или нанести ущерб.
Модель воспринимает описания инструментов как надежные рекомендации. Скрытые инструкции в них могут управлять его поведением незаметно для пользователя.
Модель видит полный текст, а пользователь может видеть только метку. Именно этот пробел и заставляет скрытые инструкции работать.
Одобрение обычно происходит один раз. Сервер, который позже меняет свои определения, может пропустить вредоносное поведение после этой однократной проверки.
Доверенный компонент, в данном случае агент с разрешениями пользователя, обманом заставляет злоумышленника использовать свои полномочия.
Веб-страницы, электронные письма и выпуски, полученные с помощью честных инструментов, могут содержать внедренные инструкции, поэтому доверие к серверу не распространяется на возвращаемый им контент.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Оперативная безопасность с использованием искусственного интеллекта
Технический