Відокремлення стебла Spleeter
Spleeter — це інструмент із відкритим вихідним кодом від Deezer, який розділяє готову пісню на окремі треки (вокал, ударні, бас тощо) за допомогою глибокого навчання.
Огляд
It made high-quality stem separation fast, free, and accessible to anyone with a laptop.
Глибоке занурення
Spleeter, випущений музичною компанією Deezer у 2019 році, розділяє змішаний запис на окремі інструменти. Він постачається в трьох попередньо налаштованих конфігураціях: 2-ствольна (вокал плюс акомпанемент), 4-ствольна (вокал, барабани, бас та інше) і 5-стімкова (додається фортепіано). Під капотом він використовує згорточні нейронні мережі U-Net, які працюють зі спектрограмою звуку, прогнозуючи м’яку маску для кожного джерела. Множення маски на оригінальну спектрограму та інвертування назад до аудіо дає кожну основу. Що зробило Spleeter відомим, так це швидкість: він може розділяти звук приблизно в 100 разів швидше, ніж у реальному часі на GPU. Його широко використовують ді-джеї, реміксери, транскрибувальники та виробники караоке, і це викликало хвилю конкуруючих роздільників, таких як Demucs.
Технічне розуміння
Spleeter працює в частотно-часовій області. Аудіо перетворюється на спектрограму величини за допомогою короткочасного перетворення Фур’є (STFT). U-Net (кодер-декодер із пропуском з’єднань) дізнається, для кожного джерела, маску від 0 до 1 для кожного діапазону часу та частоти. Замаскована спектрограма рекомбінується з фазою вихідної суміші, потім інверсний STFT реконструює форму хвилі. Оскільки він оцінює м’які маски, а не необроблений звук, витік і повторне використання фази спричиняють артефакти.
Стратегічний вплив
Доступ і охоплення
Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.
Вартість і бюджет
Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.
Швидкість і масштаб
Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.
Майбутнє відокремлення стебла Spleeter
Новіші моделі області сигналу, такі як Demucs і гібридні трансформаторні сепаратори, тепер перемагають Spleeter за якістю, відновлюючи чіткіші перехідні процеси та менше артефактів. Тенденція спрямована на більшу кількість стовбурів (розділення окремих гітар чи бек-вокалу), розділення на пристрої в режимі реального часу в DAW і телефонах, а також інтеграцію в потокові програми для миттєвого реміксування або доступності. Сам Spleeter залишається популярною базовою лінією, оскільки він легкий, безкоштовний і простий у використанні, навіть якщо дослідження просувають фазові та генеративні підходи.
Реалізація в реальному світі
Миттєве створення доріжок для караоке шляхом видалення головного вокалу з комерційної пісні
Ді-джеї та продюсери ізолюють барабан або бас-гітару для створення реміксів і композицій
Студенти-музиканти витягують одну інструментальну лінію для транскрибування та практики
Відновлення або очищення старих записів шляхом розділення та повторного балансування каламутних сумішей
Ризики та огорожі
Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.
Точність може впасти через акценти, діалекти чи шумне середовище.
Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.
Дорожня карта впровадження
Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.
Перевірте якість на різних динаміках і фонових умовах.
Визначте, коли людина повинна переглядати або затверджувати результати.
Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spleeter Stem Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Розділення часової області Conv-TasNet
Часті запитання
What is Spleeter Stem Separation?
Spleeter — це інструмент із відкритим вихідним кодом від Deezer, який розділяє готову пісню на окремі треки (вокал, ударні, бас тощо) за допомогою глибокого навчання. Це зробило високоякісне відділення стовбура швидким, безкоштовним і доступним для будь-кого, хто має ноутбук.
Яка компанія спочатку випустила Spleeter?
Spleeter був випущений як відкритий код у 2019 році Deezer, французькою компанією потокового передавання музики.
На що 4-стовбурна модель Spleeter розділяє звук?
4-стержнева конфігурація виводить вокал, ударні, бас і «інший» стрижень для всього іншого.
Яку архітектуру нейронної мережі використовує Spleeter?
Spleeter використовує згорткові мережі U-Net, які передбачають маски на спектрограмі звуку.
Як Spleeter фактично витягує одне джерело з суміші?
Мережа передбачає маску джерела (значення від 0 до 1), яка множиться на спектрограму суміші.
Яка ключова практична перевага зробила Spleeter популярним?
Spleeter може розділяти аудіо приблизно в 100 разів швидше, ніж у реальному часі на GPU, що робить його швидким і доступним.