Суспільство GUIDE

Отруєння даних і бекдор-атаки

Отруєння даних пошкоджує модель, підробляючи її навчальні дані, а бекдор-атаки приховують секретний тригер, який змушує модель поводитися неправильно за командою.

2 хвилини читанняОстаннє оновлення

Огляд

They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.

Глибоке занурення

Напади отруєння поділяються на дві широкі цілі. Атаки на доступність мають на меті погіршити загальну точність шляхом впровадження неправильно позначених або пошкоджених прикладів. Цілеспрямовані та бекдорні атаки є більш прихованими: модель ідеально працює на звичайних вхідних даних, але видає вибраний зловмисником результат щоразу, коли з’являється прихований тригер, наприклад невелика піксельна ділянка, конкретна фраза чи невидимий водяний знак. Робота BadNets показала класифікатор знаків зупинки, який читає знак із наклейкою як «обмеження швидкості». Сучасні системи викриваються через те, що вони навчаються на даних веб-масштабу. Дослідники продемонстрували, що купівля прострочених доменів за невеликою частиною URL-адрес наборів даних може отруїти популярні набори даних зображень на кілька сотень доларів. Мовні моделі також можуть бути бекдорованими через отруєні дані тонкого налаштування або приклади інструкцій.

Технічне розуміння

Бекдор із чистою міткою є особливо небезпечним: отруєні зразки зберігають правильні мітки та виглядають нормальними для рецензентів, але в них вбудована тригерна функція, яку модель навчається асоціювати з цільовим класом. Під час висновку представлення тригера змінює прогноз, тоді як чиста точність залишається високою, тому стандартна перевірка ніколи не вловлює його. Захист включає кластеризацію активації, спектральні сигнатури, реконструкцію тригера та перевірку походження даних.

Стратегічний вплив

Ризики та безпека

Катастрофічні та щоденні збитки ШІ залежать від того, хто розуміє ризики та хто може діяти.

Чіткіші рішення

Громадська та професійна грамотність визначає, чи політично можлива сильна політика безпеки.

Прорізаючи ажіотаж

Чіткі пояснення зменшують захоплення ажіотажем, лабораторним піаром і нечітким етичним театром.

Майбутнє отруєння даних і бекдор-атак

Оскільки ланцюжки постачання покладаються на зібрані дані, попередньо підготовлені ваги та сторонні налаштування, отруєння переходить від теорії до реальної загрози ланцюгу постачання. Очікуйте підписання набору даних і стандарти походження, сертифіковане навчання надійності, яке обмежує шкоду від фіксованої кількості отруєних точок, і постійне бекдор-сканування моделей перед розгортанням. Регулятори та системи безпеки, такі як MITER ATLAS, починають розглядати отруєння як першокласний ризик машинного навчання.

Реалізація в реальному світі

Модель бачення для безпілотних автомобілів, які неправильно сприймають знак «стоп» як знак обмеження швидкості, коли присутній маленький тригер наклейки

Дешеве отруєння загальнодоступного набору даних зображень шляхом викрадення прострочених доменів, які містять частину URL-адрес зображень

Створення бекдору в моделі завершення коду, щоб прихована фраза підказки змушувала вставляти небезпечний код

Порушення краудсорсингового зворотного зв’язку спам-фільтра з метою прослизання конкретних зловмисних електронних листів

Ризики та огорожі

Розгляд екзистенціального ризику як наукової фантастики, а здібності складені.

Плутання безпеки поверхні продукту з вирівнюванням за високої автономності.

Залишаючи неангломовну та неекспертну аудиторію лише низькоякісними джерелами.

Дорожня карта впровадження

1

Розділіть ризики шкоди продукту, неправильного використання та втрати контролю/зміщення.

2

Запитайте, які докази змінили б ваше уявлення про терміни та серйозність.

3

Віддавайте перевагу першоджерелам і конкретним оцінкам над маркетинговими заявами.

4

Визначте один шлях дій: кар’єра, політика, фінансування чи навички — не лише обізнаність.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Data Poisoning and Backdoor Attacks quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часті запитання

What is Data Poisoning and Backdoor Attacks?

Отруєння даних пошкоджує модель, підробляючи її навчальні дані, а бекдор-атаки приховують секретний тригер, який змушує модель поводитися неправильно за командою. Вони мають значення, тому що моделі все частіше вчаться на зібраних краудсорсингових даних, які зловмисники можуть тихо заразити.

Що відрізняє бекдор-атаку від загальнодоступної атаки з отруєнням?

Бекдорні моделі нормально діють на чистих вхідних даних і створюють цільовий вихід зловмисника лише тоді, коли з’являється прихований тригер.

Чому важко виявити чисті бекдор-атаки?

Оскільки отруєні приклади мають правильні мітки та виглядають звичайними, перевірка людьми та стандартна точність перевірки не позначають їх.

Що знаменито продемонструвало дослідження BadNets?

BadNets показали бекдорний класифікатор дорожніх знаків, який неправильно читає знаки зупинки, позначені маленькою наклейкою.

Як дослідники показали, що набори даних веб-масштабу можна дешево отруїти?

Оскільки набори даних посилаються на зображення за URL-адресою, придбання втратили домени дозволяє зловмисникам контролювати ці зображення за невелику плату.

Що з цього є визнаним захистом від бекдор-атак?

Серед інших методів виявлення засоби захисту аналізують внутрішні активації, щоб відокремити отруєні від чистих зразків.