Что случилось
Tech Xplore сообщает, что исследовательская группа под руководством Университета Ватерлоо и некоммерческой группы по безопасности искусственного интеллекта FAR.AI протестировала 21 популярную модель большого языка с открытым весом, используя среду под названием TamperBench. Исследователи обнаружили, что каждая протестированная модель может быть изменена таким образом, что это поставит под угрозу ее безопасность. Работа была представлена на конференции ACM SIGKDD и также указана в источнике как статья arXiv. Tech Xplore — названное издание, посвященное репортажам; выводы и их более широкие последствия не получили здесь независимого подтверждения.
Tech Xplore сообщает, что в исследовании, проведенном Университетом Ватерлоо и FAR.AI, была изучена 21 самая популярная программа LLM с открытым весом. В команду вошли исследователи из Массачусетского технологического института, ETH Цюриха и Университета Торонто. По данным издания, исследователи обнаружили, что все 21 модель могут быть взломаны, несмотря на встроенную в них защиту. Источник представляет это как результат тестирования исследования, а не как независимо проверенный вывод Tech Xplore. В нем не перечисляются модели и не приводится разбивка результатов по моделям.
Исследователи создали TamperBench, который Tech Xplore описывает как стандартизированную среду с открытым исходным кодом для моделирования различных атак на безопасность моделей. В отчете говорится, что вмешательство может включать изменение весов модели или скрытых представлений с целью ослабления или устранения мер защиты, блокирующих вредоносные реакции. Tech Xplore характеризует эту структуру как систематический способ проверить, выдерживают ли средства защиты такие изменения. Источник не уточняет полные процедуры атаки, необходимые вычислительные ресурсы, вероятность успеха каждого метода или то, как исследователи определили, что защита была скомпрометирована.
В отчете эта статья называется «TamperBench: систематическое стресс-тестирование безопасности LLM в условиях тонкой настройки и взлома». Tech Xplore сообщает, что работа была недавно представлена на 32-й конференции ACM SIGKDD по раскрытию знаний и интеллектуальному анализу данных в Южной Корее, и приводит DOI публикации и ссылку arXiv. В статье упоминается Саад Хоссейн как исследователь, который возглавил исследование, и цитируются исследователи из Университета Ватерлоо, которые описывают результаты как предупреждение для разработчиков и поставщиков ИИ. Источник не подтверждает независимо методы, результаты или статус рецензирования статьи, за исключением описания презентации на конференции и деталей публикации.
Подробности об источнике: techxplore.com ↗
Почему это важно
В отчете описывается проблема безопасности, возникающая из-за возможности загрузки и изменения моделей открытого веса. Если средства защиты можно снять путем тонкой настройки или изменения весов модели или скрытых представлений, модель, которая кажется безопасной при выпуске, может не оставаться безопасной после перераспределения или настройки. Tech Xplore сообщает, что исследователи предупредили, что это может сделать генерацию вредоносного контента более масштабируемой, хотя источник не утверждает, что какая-либо из протестированных моделей использовалась в реальной атаке.
В отчете Tech Xplore основное внимание уделяется разнице между выпущенным поведением безопасности модели и ее поведением после модификации. Модели открытого веса могут скачиваться и дорабатываться разработчиками, компаниями и общественными организациями. Эта гибкость поддерживает исследования, аудит и локальное развертывание, но это также означает, что исходные меры безопасности модели могут не контролировать каждую полученную на ее основе версию. В отчете говорится, что исследователи считают этот риск актуальным, хотя недостатки могут быть не уникальными для открытых моделей.
Практическая проблема заключается в том, что снятие защитных мер безопасности может позволить работоспособной модели генерировать вредные материалы в больших масштабах. Tech Xplore называет возможные варианты использования, включая массовую дезинформацию, изощренное мошенничество по электронной почте и инструкции по производству опасных химикатов. Это сценарии риска, описанные в отчете, а не задокументированные инциденты, возникающие в результате тестируемых моделей. Источник не предоставляет никаких доказательств того, что участники исследования проводили реальные кампании, причиняли вред жертвам или производили опасные вещества.
Результаты могут повлиять на то, как организации оценивают модели перед их внедрением. Tech Xplore сообщает, что исследователи призвали к более тщательной, основанной на фактических данных оценке и закупках, поскольку правительства используют ИИ в таких областях, как здравоохранение, обнаружение мошенничества, образование и другие государственные услуги. Записей о безопасности модели до настройки может быть недостаточно для этих настроек, если последующая точная настройка может изменить ее меры безопасности. Однако источник не устанавливает нормативных требований, конкретного стандарта закупок или проверенного способа устранения проблемы, который мог бы решить проблему.
В отчете открытость также представлена как компромисс между безопасностью и подотчетностью, а не как простое обязательство. Tech Xplore цитирует исследователей, заявляющих, что модели открытого веса остаются важными для исследований и общественного внимания. Это означает, что ответ не может ограничиваться ограничением доступа без учета преимуществ независимого тестирования и модификации. В статье остается нерешенным вопрос о том, как разработчики могут сохранить эти преимущества, предотвращая при этом несанкционированные или небезопасные изменения, и можно ли обеспечить надежность защиты от несанкционированного доступа во всех семействах моделей.
Интерактивный механизм: как он на самом деле работает
Изучите технологию, лежащую в основе этой разработки, в интерактивном режиме.
Which component of an AI application is the machine-learning model itself?
Что посмотреть дальше
Ключевые вопросы заключаются в том, как 21 модель работала при конкретных атаках, какая защита не сработала, смогут ли разработчики моделей воспроизвести результаты и работают ли более сильные методы защиты от несанкционированного доступа в разных архитектурах. Tech Xplore сообщает, что TamperBench был выпущен как инструмент тестирования с открытым исходным кодом и что исследователи хотят, чтобы другие доработали его. Источник не называет модели, не приводит сравнительных показателей отказов и не документирует ответы их разработчиков.
Первое, на что следует обратить внимание, — это независимая репликация. Tech Xplore сообщает об общих результатах по 21 модели, но источник не называет модели, конфигурации атак, базовые меры защиты или измеренную частоту отказов. Эти детали определят, применимо ли это открытие в целом к LLM с открытым весом или в основном к конкретным конструкциям выпуска и условиям оценки. Воспроизведение разработчиками моделей, академическими группами и исследователями безопасности поможет отличить общую слабость от ограничения тестируемой установки.
Инструмент TamperBench — еще одна важная разработка. Tech Xplore сообщает, что исследователи выпустили его как фреймворк с открытым исходным кодом и надеются, что другие исследователи улучшат его. Будущие версии могут прояснить, какие виды тонкой настройки или изменения веса и представления наиболее разрушительны, выдерживают ли определенные методы безопасности и сколько усилий потребуется злоумышленнику. Источник не сообщает, где размещен инструмент, насколько он доступен и включает ли его выпуск меры защиты от неправомерного использования.
Реакция разработчиков моделей будет иметь значение. В статье не приводятся комментарии компаний или сообществ, ответственных за 21 модель, а также не сообщается, выпустили ли они исправления, пересмотренную документацию или новые процедуры выпуска. Полезные последующие отчеты позволят выяснить, могут ли разработчики обнаружить фальсификацию, подтвердить подлинность одобренных вариантов модели, опубликовать оценки безопасности после тонкой настройки или ограничить возможности высокого риска, не подрывая законных исследований.
Вопрос общественного значения заключается в том, меняют ли организации свои методы развертывания. Tech Xplore указывает на использование ИИ правительством в здравоохранении, обнаружении мошенничества, образовании и государственных услугах, но не предоставляет никаких доказательств того, что конкретное учреждение или инцидент пострадали. Следите за правилами закупок, которые требуют тестирования модифицированных моделей, независимых проверок безопасности, раскрытия методов тонкой настройки и четких ограничений на использование мер безопасности, которые могут быть удалены после выпуска. До тех пор, пока на эти вопросы не будут даны ответы, в отчете рекомендуется проявлять осторожность в отношении того, чтобы считать первоначальный профиль безопасности публично опубликованной модели постоянным.