Аудіо AI GUIDE

музичний автомат

Jukebox — це нейронна мережа OpenAI 2020 року, яка генерує необроблений музичний аудіо — разом зі співочими голосами, інструментами та навіть текстами в стилі певних виконавців.

2 хвилини читанняОстаннє оновлення

Огляд

It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.

Глибоке занурення

Випущений OpenAI у квітні 2020 року, Jukebox генерує музику у вигляді необробленого аудіо, а не символічних нот, тобто створює справжній звук, включаючи вокал. Його було навчено приблизно на 1,2 мільйонах пісень (близько половини англомовних), взятих з Інтернету, у поєднанні з текстами та метаданими з LyricWiki. Ви можете обумовити його жанром, стилем виконавця та текстом, і він співатиме впізнавано (якщо туманно), як цей виконавець. Виходи тривають кілька хвилин. Заковика полягає в швидкості та точності: генерування відбувалося надзвичайно повільно, потрібно було близько дев’яти годин, щоб відтворити одну хвилину аудіо, а результати мають приглушену та шумну якість. Jukebox був дослідженням, а не відшліфованим продуктом, але він змінив очікування щодо можливого.

Технічне розуміння

Jukebox стискає необроблене аудіо за допомогою автокодерів VQ-VAE із трьома часовими роздільностями, перетворюючи довгу хвилю на набагато коротшу послідовність дискретних кодів. Потім авторегресійні трансформатори передбачають ці коди по черзі залежно від виконавця, жанру та тексту, а семплери підвищення частоти додають високочастотні деталі. Декодування кодів нижнього рівня назад до форми сигналу 44,1 кГц робить генерацію такою повільною, тому що мільйони аудіосимплів повинні створюватися послідовно.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє музичного автомата

Сам по собі Jukebox зараз значною мірою є історичною віхою, заміненою моделями швидшого розповсюдження та латентного звуку, такими як ті, що стоять за Suno та Udio, які генерують пісні якості майже компакт-диска за секунди. Його основні ідеї — окремі аудіотокени та обумовлення текстів пісень — живуть у сучасних системах. Очікуйте, що майбутні моделі необробленого аудіо скорочуватимуть час генерації, покращуватимуть чіткість голосу та додадуть точні елементи керування, тоді як запитання про авторські права, які вперше підняв Jukebox щодо навчання на захищених авторським правом записах, лише стають голоснішими.

Реалізація в реальному світі

Дослідники вивчають, як нейронні мережі можуть моделювати необроблені аудіо та співочі голоси довгої форми, використовуючи Jukebox як еталонну архітектуру.

Музиканти та любителі створюють моторошні ло-файні «AI-кавери», які співають нові тексти в грубому стилі обраного виконавця.

Педагоги демонструють перехід від створення нот у стилі MIDI до повного синтезу необробленого аудіо з вокалом.

Саунд-дизайнери та художники-експериментатори збирають туманні, мрійливі текстури Jukebox як сировину для реміксування та колажу.

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Jukebox quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Символічне музичне покоління

Часті запитання

What is Jukebox?

Jukebox — це нейронна мережа OpenAI 2020 року, яка генерує необроблений музичний аудіо — разом зі співочими голосами, інструментами та навіть текстами в стилі певних виконавців. Це був знаковий доказ того, що штучний інтелект може моделювати фактичну форму хвилі музики довжиною в пісню, а не лише ноти.

Чим Jukebox відрізняється від попередніх систем штучного інтелекту символічної музики, які виводять MIDI?

Jukebox моделює фактичний звук музики як необроблений аудіо, тож він може відтворювати вокал і тембри інструментів, на відміну від символьних систем, які виводять лише нотні дані.

Хто випустив Jukebox і коли приблизно?

OpenAI випустив Jukebox у квітні 2020 року як модель дослідження для створення музики з вокалом.

Що було основним практичним обмеженням Jukebox?

Оскільки він декодує необроблений аудіо зразок за зразком, Jukebox знадобилося приблизно дев’ять годин, щоб створити одну хвилину музики, що робить його непрактичним для використання в реальному часі.

Яку основну техніку використовує Jukebox, щоб зробити довге необроблене аудіо керованим для своїх Transformers?

Jukebox використовує автокодери VQ-VAE для стиснення форми хвилі в дискретні токени, які Transformers потім моделюють авторегресійно перед підвищенням дискретизації назад до аудіо.

Чим можна обумовити вихід Jukebox?

Jukebox приймає жанр, виконавця для наслідування та тексти пісень і намагатиметься співати ці слова в цьому стилі.