Аудио AI РЪКОВОДСТВО

VALL-E и езикови модели на кодеци

VALL-E преформулира преобразуването на текст в говор като проблем с езиковото моделиране върху токените за аудио кодек, позволявайки гласово клониране само от три секунди от проба.

2 min readПоследна актуализация

Преглед

It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.

Дълбоко гмуркане

Обявен от Microsoft в началото на 2023 г., VALL-E третира синтеза на реч като езиково моделиране. Вместо да предсказва спектрограма, той предсказва дискретните акустични токени на невронния кодек (EnCodec), така че генерирането става предсказване на следващ токен над аудио речник. Като се има предвид 3-секунден запис на невидян говорител плюс целевия текст, VALL-E продължава в гласа на този говорител, запазвайки тембъра и дори акустичната среда. Той беше обучен на приблизително 60 000 часа реч, значително повече от типичните TTS набори от данни, което му даде силно клониране с нулев удар. Тъй като кодечните токени са наслоени (чрез RVQ), VALL-E използва два етапа: авторегресивен модел прогнозира първия, груб поток от токени, обусловен от подканата, а неавторегресивен модел попълва останалите детайлни токени. Тази рецепта за кодек-LM вдъхнови наследници като VALL-E 2 и много модели на основа за реч.

Техническа информация

Номерът е хибридното декодиране върху йерархични кодеци. Етапът на авторегресия предвижда най-важните токени от първата кодова книга един по един, улавяйки прозодията и съдържанието. Останалите кодови книги, които добавят фини акустични детайли, се предсказват паралелно от неавторегресивен модел, обусловен от първия поток и подканата на високоговорителя. Това разделяне поддържа високо качество, като същевременно избягва разходите за последователно генериране на всеки токен, а използването на кодек означава, че речта и текстът могат да бъдат моделирани с една и съща машина за трансформиране.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на VALL-E и кодечните езикови модели

Езиковите модели на кодеци обединяват реч с големи езикови модели, насочвайки към унифицирани системи, които слушат, разсъждават и говорят в един модел. Очаквайте по-добра стабилност и по-малко артефакти, генериране на поточно предаване в реално време и по-строг контрол върху емоцията и стила. Същото мощно клониране, което прави VALL-E полезен за достъпност и дублиране, също поражда опасения за дълбоко фалшифициране и съгласие, така че водният знак, предпазните мерки за гласова проверка и предпазните огради на политиката се превръщат в централна част от начина, по който тези системи се внедряват.

Внедряване в реалния свят

Клониране на глас от няколко секунди аудио за персонализирани асистенти или инструменти за достъпност, които възстановяват изгубен глас

Локализиране и дублиране на видео на други езици при запазване на тембъра на оригиналния говорител

Генериране на експресивен, съобразен с контекста разказ, който запазва акустичната среда на записа

Служи като говорен гръбнак в мултимодални асистенти, които едновременно разбират и възпроизвеждат устно аудио

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VALL-E and Codec Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Възникващи способности на големи езикови модели

Frequently asked questions

What is VALL-E and Codec Language Models?

VALL-E преформулира преобразуването на текст в говор като проблем с езиковото моделиране върху токените за аудио кодек, позволявайки гласово клониране само от три секунди от проба. Той показа, че същото предвиждане на следващ токен, захранващо текстови LLM, може да генерира забележително естествена, изразителна реч.

Каква основна идея отличава VALL-E от по-ранните системи за синтез на реч?

VALL-E преформулира TTS като предсказване на следващ токен над дискретни токени за аудио кодек, третирайки генерирането на реч като езиков модел.

Колко референтно аудио се нуждае от VALL-E, за да клонира гласа на нов говорител?

VALL-E може да извърши клониране на глас с нула удари от приблизително 3-секундна проба от невиждан високоговорител.

Кой неврален кодек използва VALL-E, за да произвежда своите аудио токени?

VALL-E се основава на EnCodec на Meta, предсказвайки неговите дискретни акустични токени за синтезиране на реч.

Защо VALL-E използва както авторегресивен, така и неавторегресивен етап?

Кодечните токени са йерархични чрез RVQ; VALL-E предсказва авторегресивно първия груб поток и паралелно останалите детайлни токени за ефективност.

Приблизително върху колко говорни данни е обучен VALL-E, позволявайки силно клониране с нулев удар?

VALL-E беше обучен на приблизително 60 000 часа говор, много повече от типичните TTS набори от данни, което повиши неговата нулева генерализация.