Аудио РУКОВОДСТВО ПО ИИ

Спектрограмма Риффузии. Диффузия.

Riffusion — это хитрый хак, который генерирует музыку, рассматривая звук как изображение: он точно настраивает модель изображения Stable Diffusion для рисования спектрограмм, а затем преобразует эти изображения обратно в звук.

2 минуты чтенияПоследнее обновление

Обзор

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Глубокое погружение

Riffusion, выпущенный в конце 2022 года Сетом Форсгреном и Хайком Мартиросом, начинался как хобби-проект. Основная хитрость: спектрограмма — это 2D-изображение, где горизонтальная ось — время, вертикальная ось — частота, а яркость пикселя — громкость. Поскольку Stable Diffusion уже генерирует изображения из текстовых подсказок, создатели доработали его на тысячах парных примеров спектрограмма-текст. Задайте ему «фанк-джазовый бас», и он устранит случайный шум в спектрограмме этого звука. Чтобы сделать воспроизводимый звук, Riffusion пропускает спектрограмму через алгоритм Гриффина-Лима, который восстанавливает недостающую информацию о фазе. Поскольку диффузия может плавно интерполировать между подсказками, Riffusion также может превращать один стиль в другой в течение непрерывного клипа, плавно зацикливаясь.

Техническая информация

Riffusion повторно использует конвейер скрытой диффузии без изменений: U-Net итеративно удаляет гауссов шум из скрытого изображения, обусловленного встраиванием текста CLIP. Единственная работа, специфичная для предметной области, - это представление спектрограммы (мел-масштаб, логарифмическая мощность) и фазовая реконструкция Гриффина-Лима, которая превращает спектрограмму прогнозируемой величины обратно в форму волны. Фаза отбрасывается во время кодирования, поэтому итеративная оценка Гриффина-Лима является основным источником характерных «водянистых» артефактов.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее диффузии спектрограмм риффузии

Riffusion доказала, что мост спектрограммы как изображения работает, и эта идея теперь живет внутри более крупных аудиосистем, которыми стала компания Riffusion. Ожидайте, что в будущем инструменты заменят Griffin-Lim с потерями на обученные нейронные вокодеры для более чистой фазы и объединят диффузию спектрограмм со скрытыми аудиокодеками. Более широкий урок о том, что модели изображений можно перенаправить на новые модальности, продолжает влиять на то, как исследователи загружают генераторы аудио и видео из существующих предварительно обученных магистралей.

Реальная реализация

Создание коротких зацикленных фоновых треков для инди-видеоигр из текстовой подсказки, например «напряженная погоня за синтезаторной волной».

Плавный переход между двумя музыкальными стилями, например. сочетание «тропического хауса» и «лоу-фай хип-хопа» в одном клипе

Бесплатное создание эмбиент-музыки для видео и подкастов на YouTube без лицензионных отчислений.

Создание прототипов мелодических или ритмических идей, которые музыкант затем должным образом перезаписывает на цифровой звуковой рабочей станции.

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Диффузионный вокодер DiffWave

Часто задаваемые вопросы

What is Riffusion Spectrogram Diffusion?

Riffusion — это хитрый хак, который генерирует музыку, рассматривая звук как изображение: он точно настраивает модель изображения Stable Diffusion для рисования спектрограмм, а затем преобразует эти изображения обратно в звук. Это важно, поскольку показывает, что инструмент, созданный для одного носителя (изображений), может создавать другой (музыку) практически без новой архитектуры.

Какую существующую модель искусственного интеллекта Riffusion настроил для создания музыки?

Riffusion усовершенствовал Stable Diffusion, модель распространения изображений, для создания изображений спектрограмм, которые затем преобразуются в аудио.

Что представляет спектрограмма по своим двум осям?

На спектрограмме горизонтальная ось — время, вертикальная ось — частота, а яркость представляет громкость.

Зачем Riffusion нужен алгоритм, подобный Гриффину-Лиму?

Спектрограмма сохраняет величину, но отбрасывает фазу, поэтому Griffin-Lim итеративно оценивает фазу, чтобы восстановить воспроизводимую форму сигнала.

Какие возможности дает диффузия Riffusion при смешивании двух подсказок?

Модели диффузии могут интерполироваться в скрытом пространстве, позволяя Riffusion непрерывно трансформироваться из одного музыкального стиля в другой.

Как изначально был создан и выпущен Riffusion?

Riffusion зародился как хобби-проект Сета Форсгрена и Хайка Мартироса и был публично выпущен в конце 2022 года.