Аудио РУКОВОДСТВО ПО ИИ
Расширение и продолжение AI Music
Музыкальное расширение AI использует генеративную модель для продолжения существующего аудиоклипа, регенерации раздела в середине (зарисовки), изменения его стиля или добавления и замены отдельных нот инструментов.
На этой странице4 минуты чтения
Обзор
Это позволяет короткой идее превратиться в полноценный трек или исправить ошибочный дубль без перезаписи. Это важно, потому что меняет то, как люди пишут и редактируют музыку, но имеет четкие ограничения по качеству и не лишает прав того, кто владеет оригинальным звуком.
Глубокое погружение
Расширение берет существующий клип и генерирует то, что будет дальше. Одним из распространенных подходов является авторегрессионное продолжение. MusicGen от Meta, выпущенный в 2023 году как часть AudioCraft, преобразует аудио в дискретные токены с помощью нейронного кодека EnCodec и прогнозирует дальнейшие токены после тех, которые вы предоставляете, подобно тому, как языковая модель продолжает предложение. Потребительские сервисы, такие как Suno и Udio, предлагают эту функцию в качестве функции расширения, обычно позволяя вам выбрать начальную точку и изменить текст или стиль нового раздела. Inpainting восстанавливает замаскированную область посередине, сохраняя при этом звук с обеих сторон, что полезно для исправления текста или замены четырех тактов. Модели диффузии подходят для этого, поскольку известный звук может оставаться фиксированным, в то время как шумы удаляются только в маскированном диапазоне. Режимы аудио-аудио или ремикс, такие как режим Stability AI, представленный в Stable Audio 2.0 в 2024 году, частично добавляют шум к входному сигналу и восстанавливают его под новую подсказку, поэтому структура сохраняется при изменении тембра и стиля. Настройка силы контролирует, сколько оригинала остается. Работа со стеблями сочетает в себе разделение и генерацию. Модели разделения источников, такие как Demucs с открытым исходным кодом Meta, разделяют микс на вокал, ударные, бас и другие; Затем генератор может добавить или заменить одну часть с учетом остальных. Пределы реальны. Длинные расширения дрейфуют: темп, тональность, баланс микса и тембр голоса могут смещаться. Соединения могут щелкать или прыгать по громкости. Модели видят ограниченное контекстное окно, поэтому мотив с первой минуты может быть забыт. Распространенным заблуждением является то, что модель понимает структуру песни так же, как музыкант; это сопоставление шаблонов в недавнем аудио. Права также сохраняются: расширение коммерческой записи, которой вы не владеете, создает ее производную, а условия многих сервисов запрещают загрузку аудио, на которую у вас нет прав.
Стратегическое воздействие
Доступ и охват
Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.
Стоимость и бюджет
Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.
Скорость и масштаб
Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.
Будущее расширения и продолжения музыки с использованием искусственного интеллекта
Исследования направлены на более длинный контекст, лучшее понимание структуры и более точный контроль над отдельными основами, что должно уменьшить дрейф и сделать редактирование на уровне раздела более предсказуемым. Интеграция в рабочие станции цифрового аудио — вероятное направление, поскольку редактирование внутри существующего проекта полезнее, чем создание целых песен в браузере. Качество швов и сохранение индивидуальности конкретного певца остаются непростыми проблемами. Что касается прав, механизмы проверки загрузки и лицензирования между сервисами и правообладателями все еще находятся в стадии разработки, поэтому то, что пользователи могут законно расширять, будет зависеть от развивающихся условий и результатов суда, а не только от технологии.
Реальная реализация
Автор песен напевает 20-секундную идею припева, загружает ее в музыкальный генератор и использует функцию расширения с отметки 0:18, чтобы создать куплет и переход, которые следуют в той же тональности и темпе.
У редактора подкаста есть 30-секундная лицензионная музыкальная дорожка, которая слишком коротка для вступления, поэтому она создает продолжение и плавно затухает его в тактовой строке, чтобы достичь 60 секунд.
Продюсер разделяет старое демо на вокал, ударные, бас и другие основы с помощью Demucs, приглушает слабую часть барабана и заставляет модель генерировать новую партию ударных, основанную на оставшихся основах.
Группа рисует два такта, в которых певец перепутал текст, сохраняя звук с обеих сторон нетронутым, а затем проверяет, что восстановленный вокал по-прежнему звучит как тот же певец.
Риски и ограничения
Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.
Точность может снижаться из-за акцентов, диалектов или шумной обстановки.
Синтетический звук можно принять за аутентичную речь без четкой маркировки.
Дорожная карта реализации
Получите явное согласие на захват, клонирование и повторное использование голоса.
Проверьте качество звука при использовании различных динамиков и фоновых условий.
Определите, когда человек должен проверять или утверждать результаты.
Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI Music Extension and Continuation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Часто задаваемые вопросы
Что такое расширение и продолжение музыки AI?
Музыкальное расширение AI использует генеративную модель для продолжения существующего аудиоклипа, регенерации раздела в середине (зарисовки), изменения его стиля или добавления и замены отдельных нот инструментов. Это позволяет короткой идее превратиться в полноценный трек или исправить ошибочный дубль без перезаписи. Это важно, потому что меняет то, как люди пишут и редактируют музыку, но имеет четкие ограничения по качеству и не лишает прав того, кто владеет оригинальным звуком.
Как авторегрессионная модель, такая как MusicGen, продолжает аудиоклип?
Клип преобразуется в отдельные токены, и модель предсказывает, какие токены будут следующими, подобно тому, как языковая модель продолжает текст.
Какой нейронный кодек использует MusicGen для преобразования аудио в токены?
MusicGen использует EnCodec, нейронный аудиокодек от Meta, для представления звука в виде дискретных токенов.
Что делает аудио-рисование?
Inpainting заполняет или заменяет выбранный диапазон, например, нечеткий текст, сохраняя при этом окружающий звук нетронутым.
Почему диффузионные модели хорошо подходят для рисования?
Диффузия может ограничивать известные области во время шумоподавления, поэтому регенерируется только недостающий участок, чтобы он соответствовал его окружению.
Что контролирует настройка мощности в режиме ремикса или аудио-аудио?
Более высокая мощность добавляет больше шума и больше регенерирует, еще больше меняя входной сигнал; более низкая прочность сохраняет большую часть своей структуры.
Продолжайте учиться
Связанные руководства
Другие руководства, выбранные по этой теме