Аудіо AI GUIDE
Розширення та продовження AI Music
Музичне розширення штучного інтелекту використовує генеративну модель для продовження наявного аудіокліпу, регенерації частини в середині (замальовування), зміни її стилю або додавання та заміни окремих інструментів.
На цій сторінці4 хвилини читання
Огляд
Це дозволяє короткій ідеї перетворитися на повний трек або виправити помилковий дубль без повторного запису. Це має значення, оскільки змінює те, як люди створюють та редагують музику, але має чіткі обмеження щодо якості та не позбавляє прав тих, хто володіє оригінальним аудіо.
Глибоке занурення
Розширення бере наявний кліп і генерує те, що буде далі. Одним із поширених підходів є авторегресійне продовження. MusicGen від Meta, випущений у 2023 році як частина AudioCraft, перетворює аудіо в окремі токени за допомогою нейронного кодека під назвою EnCodec і передбачає подальші токени після тих, які ви надаєте, подібно до того, як мовна модель продовжує речення. Такі споживчі служби, як Suno і Udio, пропонують це як функцію розширення, яка зазвичай дозволяє вибрати початкову точку та змінити текст або стиль для нового розділу. Inpainting відновлює замасковану область посередині, зберігаючи аудіо з обох сторін, що корисно для фіксації тексту пісні або заміни чотирьох тактів. Дифузійні моделі підходять для цього, оскільки відоме аудіо можна утримувати фіксованим, тоді як приглушено лише замаскований діапазон. Режими перетворення аудіо в аудіо або реміксування, як-от той, який Stability AI представив у Stable Audio 2.0 у 2024 році, частково додають шум до вхідного сигналу та відновлюють його за новою підказкою, тому структура зберігається під час зміни тембру та стилю. Налаштування міцності визначає, скільки залишилося оригіналу. Стовбурова робота поєднує відокремлення та породження. Моделі поділу джерела, такі як Demucs з відкритим вихідним кодом Meta, поділяють мікс на вокал, ударні, бас та інше; потім генератор може додати або замінити одну частину залежно від решти. Обмеження реальні. Тривалий дрейф розширень: темп, тональність, баланс міксу та тембр голосу можуть блукати. Об'єднання можуть клацати або стрибати в гучності. Моделі бачать обмежене контекстне вікно, тому мотив з першої хвилини може бути забутий. Поширеною помилкою є те, що модель розуміє структуру пісні так, як це розуміє музикант; він відповідає шаблонам у нещодавньому аудіо. Права також зберігаються: розширення комерційного запису, яким ви не володієте, створює похідне від нього, а умови багатьох послуг забороняють завантажувати аудіо, на яке у вас немає прав.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє розширення та продовження музики штучного інтелекту
Дослідження просуваються до довшого контексту, кращого усвідомлення структури та більш точного контролю над окремими основами, що повинно зменшити дрейф і зробити редагування на рівні розділу більш передбачуваним. Ймовірним напрямком є інтеграція в цифрові аудіостанції, оскільки редагування всередині існуючого проекту корисніше, ніж генерування цілих пісень у браузері. Важкими проблемами залишаються якість по швах і збереження ідентичності конкретного співака. Що стосується прав, перевірка завантажень і ліцензійні домовленості між службами та власниками прав все ще розвиваються, тож те, що користувачі можуть законно продовжити, залежатиме від нових умов і судових рішень, а не лише від технології.
Реалізація в реальному світі
Автор пісні наспівує ідею 20-секундного приспіву, завантажує її в музичний генератор і використовує функцію розширення з позначки 0:18, щоб створити куплет і бридж, які продовжуються в тій самій тональності та темпі.
Редакторка подкастів має 30-секундну ліцензовану музику, яка закоротка для вступу, тому вона генерує продовження та плавно плавить його на смузі, щоб досягти 60 секунд.
Продюсер розділяє стару демо-версію на вокал, ударні, бас та інші основи за допомогою Demucs, приглушує слабку основу барабана та пропонує моделі створити нову партію барабана, обумовлену рештою частин.
Гурт замальовує два такти, де співак розпушив текст, зберігаючи аудіо з обох сторін недоторканим, а потім перевіряє, чи відновлений вокал усе ще звучить як той самий співак.
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AI Music Extension and Continuation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Часті запитання
Що таке AI Music Extension and Continuation?
Музичне розширення штучного інтелекту використовує генеративну модель для продовження наявного аудіокліпу, регенерації частини в середині (замальовування), зміни її стилю або додавання та заміни окремих інструментів. Це дозволяє короткій ідеї перетворитися на повний трек або виправити помилковий дубль без повторного запису. Це має значення, оскільки змінює те, як люди створюють та редагують музику, але має чіткі обмеження щодо якості та не позбавляє прав тих, хто володіє оригінальним аудіо.
Як авторегресійна модель, як-от MusicGen, продовжує аудіокліп?
Кліп перетворюється на окремі маркери, і модель передбачає, які маркери будуть наступними, подібно до того, як мовна модель продовжує текст.
Який нейронний кодек використовує MusicGen для перетворення звуку на токени?
MusicGen покладається на EnCodec, нейронний аудіокодек від Meta, щоб представляти аудіо як окремі токени.
Що робить аудіо малюнок?
Inpainting заповнює або замінює вибраний проміжок, як-от помилковий текст, зберігаючи навколишнє аудіо без змін.
Чому дифузійні моделі добре підходять для малювання?
Дифузія може обмежувати відомі області під час усунення шумів, тому лише відсутня ділянка регенерується відповідно до свого оточення.
Чим керує налаштування потужності в режимі реміксу чи аудіо-в-аудіо?
Вища міцність додає більше шуму та більше регенерує, змінюючи вхідний сигнал далі; менша міцність зберігає більшу частину своєї структури.
Продовжуйте вчитися
Пов'язані посібники
Інші посібники, вибрані для цієї теми