Аудио AI РЪКОВОДСТВО

Разделяне на стъблото на Spleeter

Spleeter е инструмент с отворен код от Deezer, който разделя завършена песен на отделни песни (вокали, барабани, бас и други) с помощта на дълбоко обучение.

2 min readПоследна актуализация

Преглед

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Дълбоко гмуркане

Spleeter, издаден от компанията за стрийминг на музика Deezer през 2019 г., разделя смесен запис на отделни инструменти. Доставя се в три предварително обучени конфигурации: 2 стебла (вокали плюс акомпанимент), 4 стебла (вокали, барабани, бас, други) и 5 ​​стебла (което добавя пиано). Под капака той използва U-Net конволюционни невронни мрежи, които оперират със спектрограмата на звука, предвиждайки мека маска за всеки източник. Умножаването на маската по оригиналната спектрограма и обръщането обратно към аудиото дава всяко стъбло. Това, което направи Spleeter известен, беше скоростта: той може да разделя аудиото приблизително 100 пъти по-бързо от реално време на GPU. Той се използва широко от диджеи, ремиксьори, транскрибирачи и създатели на караоке и предизвика вълна от конкурентни разделители като Demucs.

Техническа информация

Spleeter работи във времево-честотната област. Аудиото се преобразува в магнитудна спектрограма чрез кратковременна трансформация на Фурие (STFT). U-Net (енкодер-декодер с прескачащи връзки) научава, за източник, маска между 0 и 1 за всеки интервал време-честота. Маскираната спектрограма се комбинира отново с фазата на оригиналната смес, след което обратен STFT реконструира формата на вълната. Тъй като оценява меките маски, а не необработеното аудио, изтичането и повторно използваната фаза причиняват артефакти.

Стратегическо въздействие

Access and reach

Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.

Cost and budget

Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.

Speed and scale

Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.

Бъдещето на разделянето на стъблото на Spleeter

По-нови модели на вълнови домейни като Demucs и хибридни трансформаторни сепаратори сега надминават Spleeter по качество, възстановявайки по-ясни преходни процеси и по-малко артефакти. Тенденцията е към по-висок брой стебла (отделяне на отделни китари или бек вокали), разделяне в реално време на устройството в DAW и телефони и интегриране в приложения за стрийминг за незабавно ремиксиране или достъпност. Самият Spleeter остава популярна базова линия, защото е лек, безплатен и лесен за стартиране, въпреки че изследванията налагат фазово осъзнати и генеративни подходи.

Внедряване в реалния свят

Създаване на незабавни караоке песни чрез премахване на главния вокал от рекламна песен

Диджеи и продуценти, изолиращи барабан или бас ствол, за да изградят ремикси и смеси

Студентите по музика извличат една инструментална линия, за да транскрибират и да упражняват заедно с нея

Възстановяване или почистване на стари записи чрез разделяне и повторно балансиране на кални смеси

Рискове и предпазни огради

Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.

Точността може да спадне при акценти, диалекти или шумна среда.

Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.

Пътна карта за изпълнение

1

Получете изрично съгласие за улавяне на глас, клониране и повторно използване.

2

Тествайте качеството при различни високоговорители и фонови условия.

3

Определете кога човек трябва да прегледа или одобри резултатите.

4

Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Conv-TasNet Time-Domain Separation

Frequently asked questions

What is Spleeter Stem Separation?

Spleeter е инструмент с отворен код от Deezer, който разделя завършена песен на отделни песни (вокали, барабани, бас и други) с помощта на дълбоко обучение. Той направи висококачественото отделяне на стъблата бързо, безплатно и достъпно за всеки с лаптоп.

Коя компания първоначално пусна Spleeter?

Spleeter беше пуснат като отворен код през 2019 г. от Deezer, френската компания за стрийминг на музика.

На какво разделя звука моделът с 4 стебла на Spleeter?

Конфигурацията с 4 стебла извежда вокали, барабани, бас и „друго“ стебло за всичко останало.

Каква невронна мрежова архитектура използва Spleeter?

Spleeter използва U-Net конволюционни мрежи, които предсказват маски върху спектрограмата на звука.

Как всъщност Spleeter извлича един източник от микса?

Мрежата предвижда маска за източник (стойности от 0 до 1), която се умножава със спектрограмата на сместа.

Кое е ключово практическо предимство, което направи Spleeter популярен?

Spleeter може да разделя аудио около 100 пъти по-бързо от реално време на GPU, което го прави бърз и достъпен.