Джубокс
Jukebox е невронната мрежа на OpenAI за 2020 г., която генерира необработен музикален звук — пълен с пеещи гласове, инструменти и дори текстове в стила на конкретни изпълнители.
Преглед
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
Дълбоко гмуркане
Издаден от OpenAI през април 2020 г., Jukebox генерира музика като сурово аудио, а не като символични ноти, което означава, че произвежда действителния звук, включително вокали. Той беше обучен на приблизително 1,2 милиона песни (около половината на английски език), извлечени от мрежата, съчетани с текстове и метаданни от LyricWiki. Можете да го обусловите от жанр, стил на изпълнител и текст и той ще пее разпознаваемо (макар и мъгляво) като този изпълнител. Резултатите продължават няколко минути. Уловката е в бързината и прецизността: генерирането беше изключително бавно, отне около девет часа, за да изобрази една минута аудио, а резултатите са с приглушено, шумно качество. Jukebox беше изследване, а не полиран продукт, но промени очакванията за това, което беше възможно.
Техническа информация
Jukebox компресира сурово аудио с помощта на VQ-VAE автоенкодери при три времеви резолюции, превръщайки дълга форма на вълната в много по-къса последователност от дискретни кодове. След това авторегресивните трансформатори предсказват тези кодове един по един, в зависимост от изпълнител, жанр и текст, а модулите за семплиране добавят високочестотни детайли. Декодирането на кодовете от най-ниско ниво обратно до форма на вълната от 44,1 kHz е това, което прави генерирането толкова бавно, защото милиони аудио проби трябва да бъдат произведени последователно.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на джубокса
Самият Jukebox е до голяма степен исторически крайъгълен камък сега, заменен от по-бързо разпространение и модели с латентен звук като тези зад Suno и Udio, които генерират песни с качество почти като CD за секунди. Неговите основни идеи - отделни аудио токени и кондициониране на текстовете - живеят в съвременните системи. Очаквайте бъдещите модели на необработен звук да продължат да намаляват времето за генериране, да изострят яснотата на гласа и да добавят фини контроли, докато въпросите за авторските права, които Jukebox повдигна за първи път относно обучението върху записи, защитени с авторски права, стават все по-силни.
Внедряване в реалния свят
Изследователи, изучаващи как невронните мрежи могат да моделират необработено аудио и пеещи гласове в дълга форма, използвайки Jukebox като референтна архитектура.
Музиканти и любители, създаващи зловещи, lo-fi „AI кавъри“, които пеят нови текстове в грубия стил на избран изпълнител.
Преподаватели, демонстриращи прехода от генериране на ноти в стил MIDI до пълен синтез на необработен звук с вокали.
Звукови дизайнери и експериментални артисти, събиращи мъгливите, съновидни текстури на Jukebox като суровина за ремиксиране и колаж.
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Символично музикално поколение
Frequently asked questions
What is Jukebox?
Jukebox е невронната мрежа на OpenAI за 2020 г., която генерира необработен музикален звук — пълен с пеещи гласове, инструменти и дори текстове в стила на конкретни изпълнители. Това беше забележително доказателство, че AI може да моделира действителната форма на вълната на музика с дължина на песента, а не само ноти.
Какво прави Jukebox различен от по-ранните системи, подобни на AI за символична музика, които извеждат MIDI?
Jukebox моделира действителния звук на музиката като необработено аудио, така че може да произвежда вокали и инструментални тембри, за разлика от символните системи, които извеждат само нотни данни.
Кой издаде Jukebox и кога приблизително?
OpenAI пусна Jukebox през април 2020 г. като изследователски модел за генериране на музика с вокали.
Какво беше основното практическо ограничение на Jukebox?
Тъй като декодира необработен аудио семпла по семпла, Jukebox отне около девет часа, за да произведе една минута музика, което го прави непрактичен за използване в реално време.
Каква основна техника използва Jukebox, за да направи дълго необработено аудио управляемо за своите Transformers?
Jukebox използва VQ-VAE автоенкодери, за да компресира формата на вълната в дискретни токени, които Transformers след това моделират авторегресивно, преди да преобразуват обратно към аудио.
На какво можете да обусловите изхода на Jukebox?
Jukebox приема жанр, изпълнител за имитиране и текстове и ще се опита да изпее тези думи в този стил.