Отравяне на данни и задни атаки
Отравянето на данни разваля модел чрез подправяне на данните за обучението му, а атаките на задната врата крият таен тригер, който кара модела да се държи неправилно при команда.
Преглед
They matter because models increasingly learn from scraped, crowdsourced data that attackers can quietly contaminate.
Дълбоко гмуркане
Атаките с отравяне се разделят на две големи цели. Атаките срещу наличност имат за цел да влошат цялостната точност чрез инжектиране на грешно обозначени или повредени примери. Целевите и задните атаки са по-подъл: моделът се представя перфектно при нормални входове, но произвежда избран от нападателя изход, когато се появи скрит тригер, като например малка пикселна кръпка, конкретна фраза или невидим воден знак. Работата на BadNets показа класификатор на стоп-знаци, който чете маркиран със стикер знак като „ограничение на скоростта“. Съвременните системи са изложени, защото се обучават на данни от уеб мащаб. Изследователите демонстрираха, че закупуването на изтекли домейни зад малка част от URL адреси на набор от данни може да отрови популярни набори от данни за изображения за няколкостотин долара. Езиковите модели могат също така да бъдат бекдорирани чрез отровени данни за фина настройка или примери за инструкции.
Техническа информация
Задната врата с чист етикет е особено опасна: отровените проби запазват правилни етикети и изглеждат нормални за рецензенти, но въпреки това вграждат функция за задействане, която моделът се научава да свързва с целевия клас. При извод представянето на тригера обръща прогнозата, докато чистата точност остава висока, така че стандартното валидиране никога не го улавя. Защитите включват групиране на активиране, спектрални сигнатури, реконструкция на задействане и проверки на произхода на данните.
Стратегическо въздействие
Risk and safety
Катастрофалните и ежедневните вреди от ИИ зависят от това кой разбира рисковете и кой може да действа.
Clearer decisions
Обществената и професионалната грамотност определя дали силната политика за безопасност е политически възможна.
Cutting through hype
Ясните обяснения намаляват улавянето от шум, лабораторен PR и неясен етичен театър.
Бъдещето на отравянето на данни и задните атаки
Тъй като веригите за доставки разчитат на изчерпани данни, предварително обучени тегла и фини настройки от трети страни, отравянето се измества от теория към реална заплаха за веригата за доставки. Очаквайте подписване на набор от данни и стандарти за произход, сертифицирано обучение за устойчивост, което ограничава щетите от фиксиран брой отровени точки и непрекъснато сканиране на задната врата на модели преди внедряване. Регулаторите и структурите за сигурност като MITER ATLAS започват да третират отравянето като първокласен риск от машинно обучение.
Внедряване в реалния свят
Визуален модел за самоуправляващи се автомобили, разчитащи погрешно знак стоп като знак за ограничение на скоростта, когато има малък стикер
Евтино отравяне на публичен набор от данни за изображения чрез отвличане на изтекли домейни, които хостват част от URL адресите на изображения
Backdooring на модел за завършване на код, така че скрита подканваща фраза го кара да вмъкне несигурен код
Повреда на обратната връзка за обучение на спам филтъра, така че конкретни злонамерени имейли да се промъкнат
Рискове и предпазни огради
Третирането на екзистенциалния риск като научна фантастика, докато способностите се смесват.
Объркваща безопасност на повърхностния продукт с подравняване при висока автономност.
Оставяйки неанглийската и неекспертната публика само с източници с ниско качество.
Пътна карта за изпълнение
Отделете рисковете от увреждане на продукта, неправилна употреба и загуба на контрол/неправилно подравняване.
Попитайте кои доказателства биха променили мнението ви за сроковете и тежестта.
Предпочитайте първичните източници и конкретните оценки пред маркетинговите твърдения.
Определете един път на действие: кариера, политика, финансиране или умения - не само информираност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Data Poisoning and Backdoor Attacks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Синтетични данни
Frequently asked questions
What is Data Poisoning and Backdoor Attacks?
Отравянето на данни разваля модел чрез подправяне на данните за обучението му, а атаките на задната врата крият таен тригер, който кара модела да се държи неправилно при команда. Те имат значение, защото моделите все повече се учат от изчерпани, краудсорсинг данни, които нападателите могат тихо да заразят.
Какво отличава атаката на задната вратичка от атаката с отравяне с обща наличност?
Моделите със задна врата действат нормално при чисти входове и произвеждат целевия изход на атакуващия само когато се появи скритото задействане.
Защо са трудни за откриване атаките на задна вратичка с чист етикет?
Тъй като отровените примери имат правилни етикети и изглеждат обикновени, човешкият преглед и стандартната точност на валидиране не ги маркират.
Какво показа известното изследване на BadNets?
BadNets показа скрит класификатор на пътни знаци, който разчита погрешно знаците за спиране, маркирани с малък стикер.
Как изследователите показаха, че масивите от данни в уеб мащаб могат да бъдат отровени евтино?
Тъй като наборите от данни препращат към изображения по URL адрес, закупуването на изтекли домейни позволява на нападателите да контролират тези изображения срещу малка цена.
Кое от тях е призната защита срещу задни атаки?
Защитите анализират вътрешните активации, за да отделят отровените от чистите примери, наред с други методи за откриване.