Рифузионна спектрограма Дифузия
Riffusion е умен хак, който генерира музика, като третира звука като картина: той фино настройва модела на изображението Stable Diffusion, за да рисува спектрограми, след което преобразува тези изображения обратно в аудио.
Преглед
It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.
Дълбоко гмуркане
Riffusion, издаден в края на 2022 г. от Сет Форсгрен и Хайк Мартирос, започна като хоби проект. Основният трик: спектрограмата е 2D изображение, където хоризонталната ос е времето, вертикалната ос е честотата, а яркостта на пикселите е силата на звука. Тъй като Stable Diffusion вече генерира изображения от текстови подкани, създателите го настроиха фино върху хиляди сдвоени примери за спектрограма-текст. Подканете го с „фънки джаз бас“ и той обезшумява случаен шум в спектрограма на този звук. За да направи аудио, което може да се възпроизвежда, Riffusion пуска спектрограмата чрез алгоритъм на Griffin-Lim, който реконструира информацията за липсващата фаза. Тъй като дифузията може да се интерполира плавно между подканите, Riffusion може също така да трансформира един стил в друг върху непрекъснат клип, безпроблемно зацикляйки.
Техническа информация
Riffusion reuses the latent diffusion pipeline unchanged: a U-Net iteratively removes Gaussian noise from a latent image conditioned on a CLIP text embedding. The only domain-specific work is the spectrogram representation (mel-scale, log power) and the Griffin-Lim phase reconstruction that turns the predicted magnitude spectrogram back into a waveform. Фазата се изхвърля по време на кодирането, така че итеративната оценка на Griffin-Lim е основният източник на характерните „воднисти“ артефакти.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на дифузията на рифузионната спектрограма
Riffusion доказа, че мостът спектрограма като изображение работи и тази идея сега живее в по-големи аудио системи и компанията Riffusion стана. Expect future tools to replace lossy Griffin-Lim with learned neural vocoders for cleaner phase, and to combine spectrogram diffusion with latent audio codecs. The broader lesson, that image models can be redirected to new modalities, continues to influence how researchers bootstrap audio and video generators from existing pretrained backbones.
Внедряване в реалния свят
Генериране на кратки зациклящи фонови песни за инди видеоигри от текстова подкана като „напрегнато преследване на синтезирана вълна“
Плавно преминаване между два музикални стила, напр. смесване на „тропическа къща“ в „lo-fi хип-хоп“ в един клип
Произвеждане на безвъзмездни музикални легла за видеоклипове и подкасти в YouTube без лицензионни такси
Създаване на прототипи на мелодични или ритмични идеи, които музикантът след това презаписва правилно в цифрова аудио работна станция
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Riffusion Spectrogram Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Дифузионен вокодер DiffWave
Frequently asked questions
What is Riffusion Spectrogram Diffusion?
Riffusion е умен хак, който генерира музика, като третира звука като картина: той фино настройва модела на изображението Stable Diffusion, за да рисува спектрограми, след което преобразува тези изображения обратно в аудио. Има значение, защото показва, че инструмент, създаден за една среда (изображения), може да произведе друга (музика) без почти никаква нова архитектура.
Какъв съществуващ AI модел е прецизирал Riffusion, за да генерира музика?
Riffusion прецизира Stable Diffusion, модел на дифузия на изображение, за генериране на спектрограмни изображения, които след това се преобразуват в аудио.
Какво представлява спектрограмата по двете си оси?
В спектрограма хоризонталната ос е времето, вертикалната ос е честотата, а яркостта представлява силата на звука.
Защо Riffusion се нуждае от алгоритъм като Griffin-Lim?
Спектрограмата съхранява величината, но отхвърля фазата, така че Griffin-Lim итеративно оценява фазата, за да възстанови форма на вълната, която може да се възпроизведе.
Каква възможност дава дифузията на Riffusion при смесване на две подкани?
Дифузионните модели могат да се интерполират в латентно пространство, позволявайки на Riffusion непрекъснато да се преобразува от един музикален стил в друг.
Как първоначално беше създаден и пуснат Riffusion?
Riffusion започна като хоби проект от Сет Форсгрен и Хайк Мартирос, пуснат публично в края на 2022 г.