GUÍA de IA en audio

Separación del tallo del bazo

Spleeter es una herramienta de código abierto de Deezer que divide una canción terminada en pistas separadas (voz, batería, bajo y más) mediante el aprendizaje profundo.

2 minutos de lecturaÚltima actualización

Descripción general

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Buceo profundo

Spleeter, lanzado por la empresa de transmisión de música Deezer en 2019, separa una grabación mixta en bases de instrumentos individuales. Se envía en tres configuraciones previamente entrenadas: 2 vías (voz más acompañamiento), 4 vías (voz, batería, bajo, otros) y 5 vías (que agrega piano). Debajo del capó, utiliza redes neuronales convolucionales U-Net que operan en el espectrograma del audio, prediciendo una máscara suave para cada fuente. Multiplicar la máscara por el espectrograma original e invertir nuevamente al audio produce cada raíz. Lo que hizo famoso a Spleeter fue la velocidad: puede separar audio aproximadamente 100 veces más rápido que el tiempo real en una GPU. Es ampliamente utilizado por DJ, remezcladores, transcriptores y creadores de karaoke, y provocó una ola de separadores competidores como Demucs.

Información técnica

Spleeter trabaja en el dominio del tiempo-frecuencia. El audio se convierte en un espectrograma de magnitud mediante la transformada de Fourier de corto tiempo (STFT). Un U-Net (codificador-decodificador con conexiones de salto) aprende, por fuente, una máscara entre 0 y 1 para cada contenedor de tiempo-frecuencia. El espectrograma enmascarado se recombina con la fase de la mezcla original y luego un STFT inverso reconstruye la forma de onda. Debido a que estima máscaras suaves en lugar de audio sin procesar, las fugas y la fase reutilizada causan artefactos.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la separación del tallo del bazo

Los modelos de dominio de forma de onda más nuevos, como Demucs y separadores de transformadores híbridos, ahora superan a Spleeter en calidad, recuperando transitorios más nítidos y menos artefactos. La tendencia es hacia un mayor número de tallos (separando guitarras individuales o coros), separación en tiempo real en el dispositivo en DAW y teléfonos, e integración en aplicaciones de streaming para remezclas o accesibilidad instantáneas. Spleeter en sí sigue siendo una base popular porque es liviano, gratuito y fácil de ejecutar, incluso cuando la investigación impulsa enfoques generativos y conscientes de las fases.

Implementación en el mundo real

Crear pistas de karaoke instantáneas eliminando la voz principal de una canción comercial

DJ y productores aislan un vástago de batería o bajo para crear remezclas y mashups

Estudiantes de música extrayendo una sola línea de instrumento para transcribirla y practicar junto con

Restaurar o limpiar grabaciones antiguas separando y reequilibrando mezclas turbias

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Separación de dominio de tiempo Conv-TasNet

Preguntas frecuentes

What is Spleeter Stem Separation?

Spleeter es una herramienta de código abierto de Deezer que divide una canción terminada en pistas separadas (voz, batería, bajo y más) mediante el aprendizaje profundo. Hizo que la separación de tallos de alta calidad fuera rápida, gratuita y accesible para cualquier persona con una computadora portátil.

¿Qué empresa lanzó originalmente Spleeter?

Spleeter fue lanzado como código abierto en 2019 por Deezer, la empresa francesa de transmisión de música.

¿En qué separa el audio el modelo de 4 tallos de Spleeter?

La configuración de 4 vástagos produce voz, batería, bajo y un vástago "otro" para todo lo demás.

¿Qué arquitectura de red neuronal utiliza Spleeter?

Spleeter utiliza redes convolucionales U-Net que predicen máscaras en el espectrograma del audio.

¿Cómo extrae realmente Spleeter una única fuente de la mezcla?

La red predice una máscara por fuente (valores de 0 a 1) que se multiplica por el espectrograma de mezcla.

¿Cuál es una ventaja práctica clave que hizo popular a Spleeter?

Spleeter puede separar audio aproximadamente 100 veces más rápido que el tiempo real en una GPU, lo que lo hace rápido y accesible.