ДалееСледующее руководство
Семена и воспроизводимость в создании изображений ИИ
Визуальный ИИ
Визуальное руководство по искусственному интеллекту
Невидимые водяные знаки для изображений и аудио AI — это сигналы, скрытые непосредственно в значениях пикселей или звуковых волнах.
Люди не могут их видеть или слышать, но соответствующий детектор может их найти и пометить контент как созданный машиной. Такие системы, как SynthID Google DeepMind и AudioSeal Meta, имеют значение, поскольку метка перемещается вместе с самим контентом, в отличие от метки метаданных, и предназначена для того, чтобы выдерживать обычные изменения, такие как сжатие и обрезка.
Текстовые водяные знаки работают, подсказывая, какие слова выбирает языковая модель. Изображения и аудио предлагают другой холст: миллионы значений пикселей или десятки тысяч аудиосэмплов в секунду, большинство из которых могут незначительно меняться, и никто этого не замечает. Невидимый водяной знак использует эту слабину. Он добавляет структурированный образец, который находится намного ниже того, что могут воспринимать люди, но статистически очевиден для детектора, обученного его искать. Google DeepMind представил SynthID в 2023 году для изображений своих моделей Imagen, а позже расширил его до аудио, видео и текста. Он использует две нейронные сети: одна встраивает метку, а другая ее обнаруживает. Вместо того, чтобы штамповать фиксированный шаблон, специалист по внедрению узнает, где изменения будут наименее заметными и наиболее устойчивыми. AudioSeal от Meta, опубликованный в 2024 году, совместно обучает генератор и детектор и может локализовать метку до коротких фрагментов звука, что помогает, когда синтетический клип вставляется в реальную запись. В более ранней работе Meta Stable Signature декодер изображения диффузной модели был точно настроен так, чтобы каждый выходной сигнал имел пометку. Академические методы, такие как Tree-Ring, скрывают закономерности в начальном шуме модели. Обнаружение вероятностное. Детектор сообщает о показателе достоверности, а его разработчики обменивают ложные срабатывания на пропущенные отметки. Надежность тоже имеет пределы. Метки созданы так, чтобы выдерживать сжатие, изменение размера и мягкую фильтрацию, но решительные атаки могут ослабить или удалить их. Примеры включают регенерацию изображения с помощью модели диффузии, добавление враждебного шума или применение тяжелых звуковых эффектов. Распространены два заблуждения. Во-первых, отсутствие водяных знаков не доказывает подлинность контента. Это лишь означает, что не было обнаружено никаких отметок из этой конкретной системы. Во-вторых, невидимые водяные знаки — это не то же самое, что учетные данные контента C2PA. Это подписанные метаданные, прикрепленные к файлу, и они могут быть потеряны при повторном сохранении файла или создании снимка экрана с помощью программного обеспечения, которое их не сохраняет.
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Водяные знаки, скорее всего, станут одним из нескольких слоев, а не полным ответом. Поставщики объединяют невидимые знаки с подписанными метаданными о происхождении, такими как C2PA, а некоторые правительства обсуждают или принимают правила, которые требуют от поставщиков ИИ маркировать синтетические носители, хотя требования различаются в зависимости от юрисдикции. Открытые проблемы остаются. Детектор одного производителя не может считывать метки другого производителя, модели с открытым исходным кодом можно запускать вообще без водяных знаков, а атаки регенерации продолжают совершенствовать. Ожидайте дополнительных исследований знаков, которые выдерживают более серьезные изменения, работы над общими стандартами обнаружения и более четкого публичного сообщения о том, что отсутствие водяного знака не является доказательством подлинности.
Служба новостей, проверяющая вирусную фотографию, пропускает ее через программу проверки на основе SynthID, чтобы определить, была ли она создана моделью изображения Google, и рассматривает отрицательный результат как «неизвестный», а не как «реальный».
Платформа подкастов сканирует загруженные клипы с помощью детектора в стиле AudioSeal, чтобы выявить синтетическую речь. Поскольку детектор может локализовать метку, он указывает, какие секунды файла были созданы.
Служба создания изображений встраивает водяной знак в каждый вывод во время создания, поэтому последующие отчеты о злоупотреблениях можно сверить с изображениями ее собственной модели.
Исследователь сжимает в формате JPEG, изменяет размер, обрезает и делает снимки экрана с изображениями с водяными знаками, а затем измеряет, как часто детектор все еще срабатывает, чтобы определить, где знак выходит из строя.
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Невидимые водяные знаки для изображений и аудио AI — это сигналы, скрытые непосредственно в значениях пикселей или звуковых волнах. Люди не могут их видеть или слышать, но соответствующий детектор может их найти и пометить контент как созданный машиной. Такие системы, как SynthID Google DeepMind и AudioSeal Meta, имеют значение, поскольку метка перемещается вместе с самим контентом, в отличие от метки метаданных, и предназначена для того, чтобы выдерживать обычные изменения, такие как сжатие и обрезка.
Текстовые водяные знаки смещают то, какие токены выбирает модель. Водяные знаки изображения и звука сами по себе изменяют значения пикселей или образцов на величину, слишком малую для восприятия.
AudioSeal был опубликован Meta в 2024 году. Он совместно обучает генератор и детектор и может локализовать метку на коротких участках звука.
Детекторы распознают только метки своей собственной системы, и метки можно удалить. Отрицательный результат означает «неизвестный», а не «аутентичный».
Регенерация восстанавливает пиксели с помощью модели диффузии, которая может размыть скрытый узор. В руководстве упоминается еще одна атака, связанная с враждебным шумом.
Tree-Ring помещает шаблон в исходный шум, с которого начинается диффузионная модель, поэтому метка встроена в сам процесс генерации.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Семена и воспроизводимость в создании изображений ИИ
Визуальный ИИ