Техническое РУКОВОДСТВО

Запоминание в диффузионных моделях

Модели диффузных изображений обычно генерируют новые изображения, но исследования показали, что иногда они могут почти точно воспроизводить определенные обучающие изображения, особенно изображения, которые много раз появлялись в обучающих данных.

  • 3 минуты чтения
  • Последнее обновление
На этой странице3 минуты чтения
  1. Обзор
  2. Глубокое погружение
  3. Стратегическое воздействие
  4. Будущее запоминания в моделях диффузии
  5. Реальная реализация
  6. Риски и ограничения
  7. Дорожная карта реализации
  8. Продолжайте исследовать
  9. Часто задаваемые вопросы

Обзор

Это называется запоминанием. Это важно для авторских прав, потому что из модели может получиться почти копия охраняемого произведения, а также для конфиденциальности, потому что фотография реального человека или медицинское сканирование могут быть извергнуты.

Глубокое погружение

Диффузионная модель учится обращать вспять процесс зашумления: во время обучения она видит изображения с добавленным шумом и учится предсказывать и удалять этот шум. Если он хорошо обобщает, он изучает статистику изображений в целом и создает новые комбинации. Но нейронные сети могут подходить и для отдельных примеров, и когда одно изображение появляется в данных сотни или тысячи раз, самый дешевый способ уменьшить потери на обучение — сохранить его. Ключевые доказательства взяты из статьи Карлини и его коллег 2023 года «Извлечение обучающих данных из диффузионных моделей». Они создали множество изображений для подписей к наиболее дублируемым обучающим изображениям и пометили результаты, которые были очень близки к обучающему изображению. Они извлекли более сотни почти идентичных копий из Stable Diffusion, включая фотографии опознаваемых людей, и обнаружили более высокие показатели запоминания у Imagen Google. Отдельно Сомепалли и его коллеги (2022–2023) показали, что Stable Diffusion на выходе часто копирует части или макеты обучающих изображений и связывает копирование с дублированными изображениями и весьма специфическими подписями. Три заблуждения заслуживают исправления. Во-первых, запоминание не является нормальным поведением модели: извлеченные копии редки относительно всех поколений. Во-вторых, редкость не означает безобидность, потому что решительный пользователь может выбрать те изображения, которые с наибольшей вероятностью запомнятся. В-третьих, запоминание – это не только точное копирование пикселей; модели могут воспроизводить символы, логотипы, водяные знаки и отличительные композиции. Эти доказательства фигурировали в юридических дебатах, в том числе в таких исках, как Getty Images против Stability AI и Андерсен против Stability AI, хотя то, как суды относятся к обучению моделей и результатам, все еще разрабатывается и варьируется в зависимости от страны. Что касается конфиденциальности, проблема более остра в небольших наборах данных с тонкой настройкой, таких как медицинские или личные фотографии, где каждый пример имеет большее влияние.

Стратегическое воздействие

Стоимость и бюджет

Архитектурные решения влияют на производительность и эксплуатационные расходы на протяжении многих лет.

Более четкие решения

Техническое образование помогает командам выбрать правильный стек, а не только самый новый.

Контроль качества

Лучший инженерный выбор снижает вероятность возникновения проблем с надежностью на производстве.

Будущее запоминания в моделях диффузии

Дедупликация и проверки сходства выходных данных становятся стандартной практикой для ответственных разработчиков, и продолжаются исследования по обнаружению запомненных подсказок во время вывода. Дифференциальная конфиденциальность может стать практичной для чувствительных областей, таких как медицинская визуализация, хотя компромиссы в отношении качества остаются. Правовая картина нестабильна: суды в разных странах рассматривают вопрос о том, нарушают ли обучение и результаты авторские права, и результаты могут различаться. Разработчики, скорее всего, столкнутся с большей необходимостью документировать источники обучающих данных и показывать, как они проверяют и ограничивают срыгивание.

Реальная реализация

Исследователи подсказывают модель с точной подписью сильно дублированного тренировочного изображения и получают результат, который почти по пикселям идентичен исходной фотографии.

Дизайнер запрашивает стиль известной картины и получает изображение, копирующее композицию и детали одного конкретного произведения искусства, а не нового произведения.

Генератор изображений, обученный на веб-изображениях, иногда отображает искаженную версию водяного знака фондового агентства, показывая, что он вобрал в себя шаблоны из повторяющихся исходных изображений.

Команда больницы настраивает диффузионную модель на небольшом наборе сканирований пациентов и проверяет, может ли модель выдавать почти копии реальных сканирований, прежде чем будет разрешено какое-либо совместное использование.

Риски и ограничения

  • Оптимизация одного теста может скрыть более широкие недостатки системы.

  • Затраты на инфраструктуру и техническое обслуживание часто недооцениваются.

  • Пробелы в безопасности и наблюдаемости могут увеличиваться по мере усложнения систем.

Дорожная карта реализации

  1. Определите целевые показатели задержки, качества и стоимости перед внедрением.

  2. Тестирование при реалистичной нагрузке и условиях данных.

  3. Мониторинг прибора на наличие ошибок, дрейфа и влияния пользователя.

  4. Перед масштабированием подготовьте пути отката и реагирования на инциденты.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Memorization in Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

Что такое запоминание в моделях диффузии?

Модели диффузных изображений обычно генерируют новые изображения, но исследования показали, что иногда они могут почти точно воспроизводить определенные обучающие изображения, особенно изображения, которые много раз появлялись в обучающих данных. Это называется запоминанием. Это важно для авторских прав, потому что из модели может получиться почти копия охраняемого произведения, а также для конфиденциальности, потому что фотография реального человека или медицинское сканирование могут быть извергнуты.

Что такое запоминание в диффузионной модели?

Запоминание означает, что выходные данные являются почти копиями конкретных обучающих изображений, а не новыми изображениями.

Почему дублированные данные улучшают запоминание?

Повторное использование одного и того же изображения делает подбор именно этого примера эффективным способом снижения потерь.

Что продемонстрировала статья Карлини и его коллег за 2023 год?

Они извлекли более сотни почти копий Stable Diffusion, включая фотографии опознаваемых людей, и обнаружили более высокие показатели в Imagen.

Как атака извлечения идентифицировала вероятные запомненные изображения?

Запомненное изображение появляется последовательно независимо от начального числа, поэтому узкие группы почти идентичных выходных данных помечают кандидатов.

Какое утверждение о запоминании верно?

Извлеченные копии встречаются редко по сравнению со всеми выходными данными, но злоумышленники могут сосредоточиться на изображениях, которые с наибольшей вероятностью будут запомнены.