ДалееСледующее руководство
Невидимые водяные знаки для изображений и аудио AI
Визуальный ИИ
Визуальное руководство по искусственному интеллекту
Синхронизация губ с помощью искусственного интеллекта, управляемая звуком, редактирует видео лица таким образом, чтобы движения его рта соответствовали новой речевой дорожке, предсказывая форму рта на основе самого звука.
Это важно для дублирования уроков и фильмов на другие языки, а также для фиксации перезаписанных диалогов. Тот же метод может заставить реальных людей произнести слова, которые они никогда не произносили.
Wav2Lip, опубликованный в 2020 году исследователями из IIIT Hyderabad (ACM Multimedia), является самой известной моделью открытой синхронизации губ и полезным шаблоном для этой области. Для каждого целевого кадра генератор получает три входных данных: лицо с замаскированной нижней половиной, опорный кадр того же человека, который обеспечивает внешний вид, и короткое окно мел-спектрограммы звука в этот момент. Затем сеть кодировщика-декодера рисует область рта, и результат снова смешивается с исходным видео. Ключевым вкладом стал предварительно обученный «экспертный» дискриминатор синхронизации на основе SyncNet. Во время тренировки он остается в замороженном состоянии и определяет, соответствует ли короткий фрагмент кадров звуку. Более ранние подходы обучали дискриминатор синхронизации совместно с генератором, и эти дискриминаторы оказывались плохими оценщиками синхронизации. Wav2Lip также использовал отдельный дискриминатор визуального качества. Его слабыми сторонами были кадры рта с низким разрешением, размытые зубы и видимые швы или мерцание на границе маски. Более поздние системы, такие как VideoReTalking, MuseTalk и LatentSync на основе диффузии, нацелены на получение более четких и стабильных результатов. Качество оценивается по нескольким критериям. LSE-D измеряет расстояние между аудио и видео вставками SyncNet, где чем меньше, тем лучше. LSE-C измеряет доверие SyncNet: чем выше, тем лучше. Показатели качества изображения, такие как FID и человеческие рейтинги, отражают реалистичность. Распространенным заблуждением является то, что хорошая оценка синхронизации означает реалистичное видео. Чрезмерное движение рта может быть оценено хорошо, но при этом выглядеть неправильно, поэтому человеческая оценка остается важной. Одна из проблем заключается в том, что многие фонемы имеют одну и ту же видимую форму рта, или визему, поэтому отображение звука в рот происходит по принципу «многие к одному». Неправильное использование вытекает непосредственно из самой технологии: сочетание клонированного голоса с синхронизацией губ может привести к убедительным фальшивым заявлениям. Исследователи показали, что несоответствия между фонемами и висемами, особенно губы, не смыкающиеся на буквах «м», «б» и «р», могут выявить такие подделки.
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Синхронизация губ становится стандартной функцией инструментов дублирования и локализации видео, а исследования движутся в направлении более высокого разрешения, стабильных зубов и языка, а также синхронизации всего выражения лица и движения головы, а не только рта. Обнаружение — это гонка вооружений: судебно-медицинские признаки, такие как несоответствие фонем и визем, ослабевают по мере совершенствования генераторов. Некоторые юрисдикции начали регулировать вводящие в заблуждение синтетические СМИ, особенно в период выборов. Согласие показанного лица, четкое раскрытие информации и маркировка происхождения, вероятно, останутся центральными элементами ответственного использования.
Провайдер онлайн-курсов дублирует лекцию на испанский язык и использует синхронизацию губ, чтобы рот преподавателя соответствовал переведенному звуку, отмечая изменения в описании видео.
Видеоредактор синхронизирует рот актера со строкой диалога, перезаписанной после съемок, с согласия актера, вместо того, чтобы переснимать сцену.
Специалист по проверке фактов просматривает вирусный клип политика и замечает, что губы никогда полностью не смыкаются при произнесении звуков «б», «п» и «м» — известный признак фальшивки, синхронизированной по губам.
Исследователь запускает Wav2Lip на наборе клипов говорящей головы и оценивает результаты с помощью LSE-D и LSE-C, чтобы сравнить их с новой моделью синхронизации губ, основанной на диффузии.
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Free newsletter
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Синхронизация губ с помощью искусственного интеллекта, управляемая звуком, редактирует видео лица таким образом, чтобы движения его рта соответствовали новой речевой дорожке, предсказывая форму рта на основе самого звука. Это важно для дублирования уроков и фильмов на другие языки, а также для фиксации перезаписанных диалогов. Тот же метод может заставить реальных людей произнести слова, которые они никогда не произносили.
Поскольку настоящий рот скрыт, генератору приходится полагаться на звук, чтобы определить форму рта.
Дискриминаторы, обученные совместно с генератором, плохо разбирались в синхронизации. Замороженный эксперт дает достоверный сигнал.
LSE-D — это расстояние, поэтому меньшие значения означают, что встраивание звука и рта ближе, что означает лучшую синхронизацию.
Система отсчета обеспечивает идентичность и текстуру. Аудио обеспечивает форму рта.
Wav2Lip работал над небольшими кадрами лица, поэтому рот и зубы часто выглядели мягкими рядом с более резкой окружающей рамкой.
Продолжайте учиться
Другие руководства, выбранные по этой теме
ДалееСледующее руководство
Невидимые водяные знаки для изображений и аудио AI
Визуальный ИИ