Separación del tallo del bazo
Spleeter es una herramienta de código abierto de Deezer que divide una canción terminada en pistas separadas (voz, batería, bajo y más) mediante el aprendizaje profundo.
Descripción general
It made high-quality stem separation fast, free, and accessible to anyone with a laptop.
Buceo profundo
Spleeter, lanzado por la empresa de transmisión de música Deezer en 2019, separa una grabación mixta en bases de instrumentos individuales. Se envía en tres configuraciones previamente entrenadas: 2 vías (voz más acompañamiento), 4 vías (voz, batería, bajo, otros) y 5 vías (que agrega piano). Debajo del capó, utiliza redes neuronales convolucionales U-Net que operan en el espectrograma del audio, prediciendo una máscara suave para cada fuente. Multiplicar la máscara por el espectrograma original e invertir nuevamente al audio produce cada raíz. Lo que hizo famoso a Spleeter fue la velocidad: puede separar audio aproximadamente 100 veces más rápido que el tiempo real en una GPU. Es ampliamente utilizado por DJ, remezcladores, transcriptores y creadores de karaoke, y provocó una ola de separadores competidores como Demucs.
Información técnica
Spleeter trabaja en el dominio del tiempo-frecuencia. El audio se convierte en un espectrograma de magnitud mediante la transformada de Fourier de corto tiempo (STFT). Un U-Net (codificador-decodificador con conexiones de salto) aprende, por fuente, una máscara entre 0 y 1 para cada contenedor de tiempo-frecuencia. El espectrograma enmascarado se recombina con la fase de la mezcla original y luego un STFT inverso reconstruye la forma de onda. Debido a que estima máscaras suaves en lugar de audio sin procesar, las fugas y la fase reutilizada causan artefactos.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro de la separación del tallo del bazo
Los modelos de dominio de forma de onda más nuevos, como Demucs y separadores de transformadores híbridos, ahora superan a Spleeter en calidad, recuperando transitorios más nítidos y menos artefactos. La tendencia es hacia un mayor número de tallos (separando guitarras individuales o coros), separación en tiempo real en el dispositivo en DAW y teléfonos, e integración en aplicaciones de streaming para remezclas o accesibilidad instantáneas. Spleeter en sí sigue siendo una base popular porque es liviano, gratuito y fácil de ejecutar, incluso cuando la investigación impulsa enfoques generativos y conscientes de las fases.
Implementación en el mundo real
Crear pistas de karaoke instantáneas eliminando la voz principal de una canción comercial
DJ y productores aislan un vástago de batería o bajo para crear remezclas y mashups
Estudiantes de música extrayendo una sola línea de instrumento para transcribirla y practicar junto con
Restaurar o limpiar grabaciones antiguas separando y reequilibrando mezclas turbias
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Spleeter Stem Separation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Separación de dominio de tiempo Conv-TasNet
Preguntas frecuentes
What is Spleeter Stem Separation?
Spleeter es una herramienta de código abierto de Deezer que divide una canción terminada en pistas separadas (voz, batería, bajo y más) mediante el aprendizaje profundo. Hizo que la separación de tallos de alta calidad fuera rápida, gratuita y accesible para cualquier persona con una computadora portátil.
¿Qué empresa lanzó originalmente Spleeter?
Spleeter fue lanzado como código abierto en 2019 por Deezer, la empresa francesa de transmisión de música.
¿En qué separa el audio el modelo de 4 tallos de Spleeter?
La configuración de 4 vástagos produce voz, batería, bajo y un vástago "otro" para todo lo demás.
¿Qué arquitectura de red neuronal utiliza Spleeter?
Spleeter utiliza redes convolucionales U-Net que predicen máscaras en el espectrograma del audio.
¿Cómo extrae realmente Spleeter una única fuente de la mezcla?
La red predice una máscara por fuente (valores de 0 a 1) que se multiplica por el espectrograma de mezcla.
¿Cuál es una ventaja práctica clave que hizo popular a Spleeter?
Spleeter puede separar audio aproximadamente 100 veces más rápido que el tiempo real en una GPU, lo que lo hace rápido y accesible.