Рифузійна спектрограма Дифузія
Riffusion — це розумний хак, який генерує музику, розглядаючи звук як зображення: він точно налаштовує модель зображення Stable Diffusion, щоб намалювати спектрограми, а потім перетворює ці зображення назад на аудіо.
Огляд
It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.
Глибоке занурення
Riffusion, випущений наприкінці 2022 року Сетом Форсгреном і Хайком Мартіросом, розпочався як проект для хобі. Основний трюк: спектрограма — це двовимірне зображення, де горизонтальна вісь — час, вертикальна вісь — частота, а яскравість пікселів — гучність. Оскільки Stable Diffusion вже генерує зображення з текстових підказок, творці налаштували його на тисячах парних прикладів спектрограми та тексту. Додайте йому «фанкі джазовий бас», і він усуне випадковий шум у спектрограму цього звуку. Щоб створити аудіо для відтворення, Riffusion запускає спектрограму за допомогою алгоритму Гріффіна-Ліма, який реконструює інформацію про відсутню фазу. Оскільки дифузія може плавно інтерполювати між підказками, Riffusion також може перетворювати один стиль в інший протягом безперервного кліпу, плавно повторюючи цикл.
Технічне розуміння
Riffusion повторно використовує конвеєр прихованої дифузії без змін: U-Net ітеративно видаляє гаусівський шум із прихованого зображення, обумовленого вбудованим текстом CLIP. Єдиною роботою, пов’язаною з доменом, є представлення спектрограми (мел-шкала, логарифмічна потужність) і фазова реконструкція Гріффіна-Ліма, яка повертає прогнозовану величину спектрограми назад у форму хвилі. Фаза відкидається під час кодування, тому ітераційна оцінка Гріффіна-Ліма є основним джерелом характерних «водянистих» артефактів.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє дифузії риффузійної спектрограми
Компанія Riffusion довела, що міст спектрограми як зображення працює, і ця ідея тепер живе у великих аудіосистемах, якою стала компанія Riffusion. Очікуйте, що майбутні інструменти замінять Griffin-Lim із втратами на навчені нейронні вокодери для чистішої фази та поєднають дифузію спектрограми з латентними аудіокодеками. Більш широкий урок про те, що моделі зображень можуть бути перенаправлені на нові модальності, продовжує впливати на те, як дослідники завантажують аудіо- та відеогенератори з існуючих попередньо навчених магістралей.
Реалізація в реальному світі
Створення коротких зациклених фонових доріжок для інді-відеоігор із текстової підказки, як-от "напружена синтвейв-гонитва"
Плавний перехід між двома музичними стилями, напр. поєднання «тропічного будинку» з «lo-fi хіп-хопом» в одному кліпі
Створення безоплатних музичних ліжок для відео та подкастів YouTube без ліцензійних зборів
Створення прототипів мелодичних або ритмічних ідей, які потім музикант правильно записує на цифровій аудіостанції
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Riffusion Spectrogram Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Дифузійний вокодер DiffWave
Часті запитання
What is Riffusion Spectrogram Diffusion?
Riffusion — це розумний хак, який генерує музику, розглядаючи звук як зображення: він точно налаштовує модель зображення Stable Diffusion, щоб намалювати спектрограми, а потім перетворює ці зображення назад на аудіо. Це важливо, тому що він показує, що інструмент, створений для одного носія (зображення), може створювати інший (музику) майже без нової архітектури.
Яку існуючу модель штучного інтелекту Riffusion налаштувала для створення музики?
Riffusion налаштував Stable Diffusion, модель дифузії зображення, для створення зображень спектрограми, які потім перетворюються на аудіо.
Що відображає спектрограма на своїх двох осях?
На спектрограмі горизонтальна вісь – час, вертикальна вісь – частота, а яскравість – гучність.
Навіщо Riffusion потрібен такий алгоритм, як Griffin-Lim?
Спектрограма зберігає величину, але відкидає фазу, тому Гріффін-Лім ітеративно оцінює фазу, щоб відновити відтворювану форму сигналу.
Які можливості дає дифузія Riffusion під час змішування двох підказок?
Моделі дифузії можуть інтерполювати в латентному просторі, дозволяючи Riffusion безперервно перетворюватися з одного музичного стилю в інший.
Як спочатку було створено та випущено Riffusion?
Riffusion розпочався як хобі-проект Сета Форсгрена та Хайка Мартіроса, опублікований наприкінці 2022 року.