AudioGen синтез на текст към аудио
AudioGen е Meta модел, който превръща текстовите описания в реалистични звуци от околната среда и звукови ефекти, като „кучешки лай, докато птици чуруликат“. Има значение, защото позволява на създателите да генерират неречево аудио от обикновен език, възможност, която отдавна липсва от генеративния AI.
Дълбоко гмуркане
AudioGen, пуснат от Meta AI през 2022 г., е авторегресивен езиков модел, който генерира общо аудио (звукови ефекти, околни сцени, звуци на животни и предмети) директно от текстови подкани. За разлика от системите за преобразуване на текст в реч, той е насочен към объркания свят на ежедневния звук. Първо компресира необработено аудио в поредица от отделни токени, използвайки невронен кодек (автокодек в стил EnCodec с остатъчно векторно квантуване). Езиковият модел на Transformer след това се научава да предсказва тези аудио токени в зависимост от текстово описание, кодирано от отделен текстов енкодер. За да подобрят разбирането на композицията, авторите смесват и свързват аудио проби по време на обучението, така че моделът да може да научи комбинации като припокриващи се звуци. По-късно AudioGen стана част от библиотеката AudioCraft на Meta заедно с музикалния модел MusicGen.
Техническа информация
AudioGen има два етапа. Първо, аудио енкодерът се научава да картографира вълновите форми към компактен поток от отделни токени и обратно. Второ, трансформаторът се обучава с цел за езиково моделиране, за да предскаже следващия аудио токен, даден предходни токени плюс обуславяне на текст. Насоките без класификатор и моделирането на многопоточна кодова книга подобряват точността и подравняването на текста. Генерирането на аудио означава авторегресивно вземане на проби от токени, след което декодирането им обратно до вълнова форма с кодека.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на синтеза на текст към аудио на AudioGen
Текст-към-аудио се насочва към по-високи честоти на семплиране, по-дълги кохерентни сцени и по-строг контрол върху времето и пространственото разположение на звуците. Очаквайте интегриране във видео инструменти, които автоматично добавят съвпадащи звукови ефекти, инструменти за достъпност, които описват сцени звуково, и двигатели на игри, които синтезират околно аудио при поискване. Комбинирането на модели на токени в стил AudioGen с дифузионни методи и по-силни текстови енкодери трябва да подобри реализма, докато инструментите за поставяне на водни знаци и произход ще помогнат за разграничаване на синтетичния от записания звук.
Внедряване в реалния свят
Генериране на Foley и звукови ефекти за филми и игри от текстови подкани
Създаване на околни звукови пейзажи (дъжд, трафик, гори) за приложения и инструменти за медитация
Прототипиране на аудио за видео проекти без лицензиране на фондови библиотеки
Произвеждане на персонализирани звуци за предупреждение и известяване, описани на обикновен език
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the AudioGen Text-to-Audio Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
DDSP Диференцируем аудио синтез
Frequently asked questions
What is AudioGen Text-to-Audio Synthesis?
AudioGen е Meta модел, който превръща текстовите описания в реалистични звуци от околната среда и звукови ефекти, като „кучешки лай, докато птици чуруликат“. Има значение, защото позволява на създателите да генерират неречево аудио от обикновен език, възможност, която отдавна липсва от генеративния AI.
Какво основно генерира AudioGen?
AudioGen е специализиран в не-говор, общ звук, като звуци от околната среда и ефекти, произведени от текстови подкани.
Какъв е първият етап от проекта на AudioGen?
Невронен кодек автокодер компресира необработено аудио в отделни токени, които след това езиковият модел може да предвиди.
Какъв тип модел предвижда аудио токените?
AudioGen използва авторегресивен трансформатор, който предвижда аудио токени един след друг, в зависимост от текста.
Защо авторите смесват и свързват аудио по време на обучението?
Увеличаването със смесени и свързани клипове подобри способността на AudioGen да композира множество звуци, описани заедно в подкана.
Коя по-голяма Meta библиотека включва AudioGen?
AudioGen е част от библиотеката AudioCraft на Meta, която също съдържа модела MusicGen.