GUIA de IA de áudio

Separação de Haste Spleeter

Spleeter é uma ferramenta de código aberto da Deezer que divide uma música finalizada em faixas separadas (vocais, bateria, baixo e muito mais) usando aprendizado profundo.

2 minutos de leituraÚltima atualização

Visão geral

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Mergulho profundo

Spleeter, lançado pela empresa de streaming de música Deezer em 2019, separa uma gravação mixada em hastes de instrumentos individuais. Ele é fornecido em três configurações pré-treinadas: 2 hastes (vocais mais acompanhamento), 4 hastes (vocais, bateria, baixo, outros) e 5 hastes (que adiciona piano). Nos bastidores, ele usa redes neurais convolucionais U-Net que operam no espectrograma de áudio, prevendo uma máscara suave para cada fonte. Multiplicar a máscara pelo espectrograma original e inverter de volta para o áudio produz cada haste. O que tornou o Spleeter famoso foi a velocidade: ele pode separar o áudio cerca de 100 vezes mais rápido que o tempo real em uma GPU. É amplamente utilizado por DJs, remixers, transcritores e fabricantes de karaokê, e gerou uma onda de separadores concorrentes como o Demucs.

Visão Técnica

Spleeter funciona no domínio tempo-frequência. O áudio é convertido em um espectrograma de magnitude via Short-Time Fourier Transform (STFT). Um U-Net (codificador-decodificador com conexões skip) aprende, por fonte, uma máscara entre 0 e 1 para cada compartimento de tempo-frequência. O espectrograma mascarado é recombinado com a fase da mistura original e, em seguida, um STFT inverso reconstrói a forma de onda. Como ele estima máscaras suaves em vez de áudio bruto, o vazamento e a fase reutilizada causam artefatos.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro da separação da haste Spleeter

Modelos mais recentes de domínio de forma de onda, como Demucs e separadores de transformadores híbridos, agora superam o Spleeter em qualidade, recuperando transientes mais nítidos e menos artefatos. A tendência é para contagens mais altas de hastes (separando guitarras individuais ou backing vocals), separação em tempo real no dispositivo em DAWs e telefones e integração em aplicativos de streaming para remixagem instantânea ou acessibilidade. O próprio Spleeter continua sendo uma linha de base popular porque é leve, gratuito e fácil de executar, mesmo quando a pesquisa promove abordagens generativas e com reconhecimento de fase.

Implementação no mundo real

Criar faixas instantâneas de karaokê removendo o vocal principal de uma música comercial

DJs e produtores isolando uma haste de bateria ou baixo para criar remixes e mashups

Estudantes de música extraindo uma única linha de instrumento para transcrever e praticar junto com

Restaurar ou limpar gravações antigas separando e reequilibrando mixagens turvas

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Separação de domínio de tempo Conv-TasNet

Perguntas frequentes

What is Spleeter Stem Separation?

Spleeter é uma ferramenta de código aberto da Deezer que divide uma música finalizada em faixas separadas (vocais, bateria, baixo e muito mais) usando aprendizado profundo. Tornou a separação de hastes de alta qualidade rápida, gratuita e acessível a qualquer pessoa com um laptop.

Qual empresa lançou originalmente o Spleeter?

Spleeter foi lançado como código aberto em 2019 pela Deezer, a empresa francesa de streaming de música.

Em que o modelo de 4 hastes do Spleeter separa o áudio?

A configuração de 4 hastes produz vocais, bateria, baixo e uma 'outra' haste para todo o resto.

Qual arquitetura de rede neural o Spleeter usa?

Spleeter usa redes convolucionais U-Net que prevêem máscaras no espectrograma de áudio.

Como o Spleeter realmente extrai uma única fonte da mixagem?

A rede prevê uma máscara por fonte (valores de 0 a 1) que é multiplicada pelo espectrograma de mistura.

Qual é a principal vantagem prática que tornou o Spleeter popular?

O Spleeter pode separar o áudio cerca de 100 vezes mais rápido que o tempo real em uma GPU, tornando-o rápido e acessível.