Аудио AI РЪКОВОДСТВО

Стабилна аудио латентна дифузия

Stable Audio е текст-към-аудио система на Stability AI, която използва латентна дифузия за генериране на музика и звукови ефекти, с явен контрол върху дължината на клипа.

2 min readПоследна актуализация

Преглед

It matters because it brought diffusion-based, timing-aware, commercially licensed audio generation to creators.

Дълбоко гмуркане

Stable Audio, стартиран от Stability AI през 2023 г., генерира стерео музика и звукови ефекти от текстови подкани, използвайки латентна дифузия, същото семейство техники зад модели на изображения като Stable Diffusion. Вместо да премахва шума на пикселите на изображението, той обезшумява компресирано латентно представяне на аудио, създадено от вариационен автоенкодер. Отличителна черта е настройката на времето: на модела се дават сигнали за начало и обща продължителност по време на обучение, така че потребителите могат да поискат клипове с определена дължина, включително музикални структури с пълна дължина с интро и край. Stable Audio 2.0, пуснат през 2024 г., може да произведе кохерентни песни с дължина до около три минути при 44,1 kHz стерео и поддържа аудио-към-аудио трансформация. Беше обучен на лицензирана музика за поддържане на комерсиална употреба.

Техническа информация

Системата има три части: VAE, който кодира 44,1 kHz стерео аудио в компактна латентна последователност, текстов енкодер (в стил CLAP или модел, базиран на T5), който вгражда подканата, и дифузионен трансформатор (или U-Net), който се научава да обръща процеса на шум в латентно пространство. Вграждането на времето обуславя генерирането на желания старт и продължителност. При извод моделът обезшумява случаен латентен шум, ръководен от текста, след което VAE декодерът реконструира формата на вълната.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на латентната дифузия на стабилното аудио

Латентната дифузия за аудио се движи към по-дълги, по-структурирани композиции, по-фин контрол на нивото на ствола и инструмента и по-бързо семплиране чрез дестилация. Очаквайте по-тясна интеграция в софтуера за музикално производство, генериране в реално време и етични инструменти около лицензирането на данни за обучение и съгласието на изпълнител. С подобряването на времето и кондиционирането създателите ще насочват по-прецизно аранжимента, темпото и преходите, а редактирането от аудио към аудио ще позволи на потребителите да трансформират съществуващи записи, като същевременно запазват ритъма или стила.

Внедряване в реалния свят

Генериране на безплатна фонова музика с точна дължина за видеоклипове и реклами

Създаване на зациклящи саундтраци на игри и приложения от текстови описания

Създаване на персонализирани звукови ефекти и стингери за подкасти и трейлъри

Трансформиране на съществуващ аудио клип в нов стил чрез подканване от звук към звук

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Stable Audio Latent Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Дифузионни модели за аудио

Frequently asked questions

What is Stable Audio Latent Diffusion?

Stable Audio е текст-към-аудио система на Stability AI, която използва латентна дифузия за генериране на музика и звукови ефекти, с явен контрол върху дължината на клипа. Има значение, защото донесе на създателите базирано на дифузия, съобразено с времето, комерсиално лицензирано аудио генериране.

Каква основна техника използва Stable Audio за генериране на аудио?

Стабилното аудио прилага латентна дифузия, обезшумявайки компресирано латентно представяне на аудио, а не необработени пиксели или проби.

Какъв отличителен контрол предлага Stable Audio, който липсваше на много по-ранни модели?

Кондиционирането на времето позволява на потребителите да изискват аудио с определена дължина, което позволява пълни песни с правилни интро и край.

Кой компонент компресира необработеното аудио в латентно представяне?

VAE кодира 44,1 kHz стерео аудио в компактна латентна последователност и по-късно го декодира обратно във форма на вълната.

Каква нова възможност добави Stable Audio 2.0 през 2024 г.?

Stable Audio 2.0 разшири дължината до около три минути пълни песни и въведе трансформации от аудио към аудио.

В заключение как Stable Audio стартира процеса на генериране?

Дифузията започва от произволен шум в латентно пространство и итеративно го обезшумява според обуславянето на текста.