РУКОВОДСТВО ПО ОБЩЕСТВУ

Отравление данных и бэкдор-атаки

Отравление данных повреждает модель, подделывая ее обучающие данные, а бэкдор-атаки скрывают секретный триггер, который заставляет модель вести себя неправильно по команде.

2 минуты чтенияПоследнее обновление

Обзор

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Глубокое погружение

Атаки с отравлением разделяются на две широкие цели. Атаки на доступность направлены на снижение общей точности путем внедрения неправильно маркированных или поврежденных примеров. Целевые и бэкдор-атаки более хитры: модель отлично работает с обычными входными данными, но выдает выбранный злоумышленником выходной сигнал всякий раз, когда появляется скрытый триггер, такой как небольшой пиксельный патч, определенная фраза или невидимый водяной знак. Работа BadNets показала классификатор знаков остановки, который считывает знак, помеченный наклейкой, как «ограничение скорости». Современные системы уязвимы, потому что они обучаются на данных веб-масштаба. Исследователи продемонстрировали, что покупка просроченных доменов за небольшой частью URL-адресов наборов данных может отравить популярные наборы данных изображений за несколько сотен долларов. Языковые модели также могут быть взломаны с помощью отравленных данных тонкой настройки или примеров инструкций.

Техническая информация

Бэкдор с «чистой этикеткой» особенно опасен: отравленные образцы сохраняют правильные этикетки и выглядят нормально для рецензентов-людей, однако в них встроен триггерный признак, который модель учится ассоциировать с целевым классом. При выводе представление триггера меняет прогноз, в то время как чистая точность остается высокой, поэтому стандартная проверка никогда его не улавливает. Средства защиты включают кластеризацию активации, спектральные сигнатуры, реконструкцию триггеров и проверки происхождения данных.

Стратегическое воздействие

Риски и безопасность

Катастрофический и повседневный вред ИИ зависит от того, кто понимает риски и может действовать.

Более четкие решения

Общественная и профессиональная грамотность определяет, возможна ли с политической точки зрения сильная политика безопасности.

Пробивая шумиху

Четкие объяснения уменьшают влияние шумихи, лабораторного пиара и расплывчатого этического театра.

Будущее отравления данных и бэкдор-атак

Поскольку цепочки поставок полагаются на собранные данные, предварительно обученные веса и сторонние настройки, отравление превращается из теории в реальную угрозу цепочке поставок. Ожидайте стандартов подписания наборов данных и происхождения, сертифицированного обучения надежности, которое ограничивает ущерб от фиксированного количества зараженных точек, а также непрерывного бэкдор-сканирования моделей перед развертыванием. Регулирующие органы и структуры безопасности, такие как MITRE ATLAS, начинают рассматривать отравление как первоклассный риск машинного обучения.

Реальная реализация

Модель видения беспилотных автомобилей, ошибочно воспринимающих знак остановки как знак ограничения скорости при наличии небольшого триггера-наклейки.

Дешевое отравление общедоступного набора данных изображений путем захвата просроченных доменов, на которых размещена часть URL-адресов изображений.

Использование бэкдора в модели завершения кода, чтобы скрытая фраза подсказки позволяла вставлять небезопасный код.

Искажение результатов краудсорсингового обучения спам-фильтра, в результате чего конкретные вредоносные электронные письма проскальзывают.

Риски и ограничения

Относитесь к экзистенциальному риску как к научной фантастике, в то время как возможности растут.

Сбивает с толку безопасность поверхности продукта и выравнивание при высокой автономности.

Оставляя неанглоязычную и неспециалистскую аудиторию только с некачественными источниками.

Дорожная карта реализации

1

Отдельные риски повреждения продукта, неправильного использования и потери контроля/перекоса.

2

Спросите, какие доказательства могут изменить ваше мнение о сроках и серьезности.

3

Предпочитайте первоисточники и конкретные оценки маркетинговым заявлениям.

4

Определите один путь действий: карьера, политика, финансирование или навыки, а не только осведомленность.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Синтетические данные

Часто задаваемые вопросы

What is Data Poisoning and Backdoor Attacks?

Отравление данных повреждает модель, подделывая ее обучающие данные, а бэкдор-атаки скрывают секретный триггер, который заставляет модель вести себя неправильно по команде. Они имеют значение, поскольку модели все чаще учатся на собранных краудсорсинговых данных, которые злоумышленники могут незаметно испортить.

Что отличает бэкдор-атаку от атаки с отравлением общедоступной информации?

Модели с бэкдором нормально действуют на чистые входные данные и выдают целевой результат злоумышленника только тогда, когда появляется скрытый триггер.

Почему бэкдор-атаки «чистой метки» трудно обнаружить?

Поскольку отравленные примеры имеют правильные этикетки и выглядят обычными, проверка человеком и стандартная точность проверки не помечают их.

Что продемонстрировало исследование BadNets?

BadNets продемонстрировал классификатор дорожных знаков с бэкдором, который неправильно распознает знаки остановки, отмеченные небольшой наклейкой.

Как исследователи показали, что наборы данных веб-масштаба можно дешево отравить?

Поскольку наборы данных ссылаются на изображения по URL-адресу, покупка устаревших доменов позволяет злоумышленникам контролировать эти изображения за небольшую плату.

Что из этого является признанной защитой от бэкдор-атак?

Защита анализирует внутренние активации, чтобы отделить отравленные экземпляры от чистых, а также другие методы обнаружения.