Аудіо AI GUIDE

AudioLM

AudioLM — це Google дослідницька структура, яка генерує реалістичне аудіо — мову чи фортепіанну музику — розглядаючи звук як мову та прогнозуючи його маркер за маркером.

2 хвилини читанняОстаннє оновлення

Огляд

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Глибоке занурення

Представлений Google у 2022 році, AudioLM переформулює генерацію аудіо як проблему моделювання мови: він перетворює необроблені сигнали на дискретні токени, а потім передбачає наступний токен, так само як текстова модель передбачає наступне слово. Its key trick is a hierarchy of token types. «Семантичні» токени (з такої моделі, як w2v-BERT) фіксують довготривалу структуру — фонетику, синтаксис, мелодію — тоді як «акустичні» токени (з нейронного кодека SoundStream) фіксують дрібні деталі, як-от ідентичність мовця, тембр і умови запису. Спочатку передбачаючи семантичні токени, а потім обумовлюючи їх акустичні токени, AudioLM виробляє продовження, які залишаються узгодженими протягом багатьох секунд, зберігаючи оригінальний голос чи інструмент. Після кількох секунд мови він продовжує говорити тим же голосом; given piano, it improvises in the same style.

Технічне розуміння

AudioLM навчається виключно на аудіо — без стенограм. SoundStream стискає аудіо в акустичні токени за допомогою залишкового векторного квантування, тоді як w2v-BERT надає грубі семантичні токени. Стек мовних моделей Transformer поетапно передбачає лексеми: спочатку семантичні для структури, потім грубі та точні акустичні лексеми для високоточної реконструкції. Декодер SoundStream нарешті перетворює передбачувані токени назад у хвилю, створюючи аудіо, що підтримує голос оратора та просодію.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє AudioLM

Рецепт AudioLM на основі маркерів став основою для пізніших систем: ідеї AudioLM від Google введені в MusicLM для перетворення тексту в музику та SoundStorm для швидшої генерації, тоді як ширше поле тепер поєднує семантичні та акустичні маркери в мові, музиці та звукових ефектах. Очікуйте швидшої генерації в реальному часі, довших когерентних виходів і мультимодального керування, коли текст або інші сигнали керують моделями, навченими лише аудіо. Ті самі методи також посилюють занепокоєння щодо клонування голосу та аудіо-підробок.

Реалізація в реальному світі

Продовження короткого мовленнєвого фрагменту тим же голосом і інтонацією оратора без стенограми

Імпровізація нової фортепіанної музики, яка відповідає стилю короткої записаної підказки

Служить основою аудіогенерації для систем перетворення тексту в музику, таких як MusicLM

Дослідження синтезу мовлення, що зберігає просодію та акустику запису зразка

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Виявлення ключових слів і слова пробудження

Часті запитання

What is AudioLM?

AudioLM — це Google дослідницька структура, яка генерує реалістичне аудіо — мову чи фортепіанну музику — розглядаючи звук як мову та прогнозуючи його маркер за маркером. Це важливо, тому що воно показало, що ви можете створювати послідовне, природно звучаче продовження аудіо без будь-якої текстової розшифровки чи музичної партитури.

Яку основну ідею використовує AudioLM для створення аудіо?

AudioLM перетворює хвилі в дискретні токени та послідовно їх прогнозує, застосовуючи підхід мовних моделей наступного токена до необробленого звуку.

Яка роль «семантичних» токенів у AudioLM?

Семантичні токени (від w2v-BERT) кодують високорівневу структуру та когерентність, тоді як акустичні токени обробляють дрібні деталі звуку.

Який нейронний кодек створює акустичні токени AudioLM?

SoundStream використовує залишкове векторне квантування для стиснення аудіо в акустичні токени, а потім декодує прогнозовані токени назад у форму сигналу.

Що потрібно AudioLM як навчальні дані?

Примітною особливістю є те, що AudioLM тренується виключно на аудіо без будь-яких текстових міток, вивчаючи структуру безпосередньо зі звуку.

Чому AudioLM передбачає семантичні лексеми перед акустичними?

Створення грубої структури спочатку зберігає вихід когерентним протягом тривалого часу; акустичні токени потім обумовлюються цією структурою для додавання високоякісних деталей.