GUIA de IA de áudio

Difusão de espectrograma de rifusão

Riffusion é um hack inteligente que gera música tratando o som como uma imagem: ele ajusta o modelo de imagem Stable Diffusion para pintar espectrogramas e depois converte essas imagens novamente em áudio.

2 minutos de leituraÚltima atualização

Visão geral

It matters because it shows a tool built for one medium (images) can produce another (music) with almost no new architecture.

Mergulho profundo

Riffusion, lançado no final de 2022 por Seth Forsgren e Hayk Martiros, começou como um projeto de hobby. O truque principal: um espectrograma é uma imagem 2D onde o eixo horizontal é o tempo, o eixo vertical é a frequência e o brilho do pixel é o volume. Como o Stable Diffusion já gera imagens a partir de prompts de texto, os criadores o ajustaram em milhares de exemplos emparelhados de espectrograma-texto. Avise-o com 'funky jazz bass' e ele elimina o ruído aleatório em um espectrograma desse som. Para tornar o áudio reproduzível, o Riffusion executa o espectrograma por meio de um algoritmo Griffin-Lim que reconstrói as informações da fase ausente. Como a difusão pode interpolar suavemente entre os prompts, o Riffusion também pode transformar um estilo em outro em um clipe contínuo, fazendo um loop contínuo.

Visão Técnica

Riffusion reutiliza o pipeline de difusão latente inalterado: uma U-Net remove iterativamente o ruído gaussiano de uma imagem latente condicionada a uma incorporação de texto CLIP. O único trabalho específico de domínio é a representação do espectrograma (escala mel, potência logarítmica) e a reconstrução da fase Griffin-Lim que transforma o espectrograma de magnitude prevista de volta em uma forma de onda. A fase é descartada durante a codificação, portanto a estimativa iterativa de Griffin-Lim é a principal fonte dos artefatos 'aquosos' característicos.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O Futuro da Difusão do Espectrograma de Rifusão

A Riffusion provou que a ponte do espectrograma como imagem funciona, e essa ideia agora vive dentro de sistemas de áudio maiores e na empresa que a Riffusion se tornou. Espere que ferramentas futuras substituam o Griffin-Lim com perdas por vocoders neurais aprendidos para uma fase mais limpa e combinem a difusão do espectrograma com codecs de áudio latentes. A lição mais ampla, de que os modelos de imagem podem ser redirecionados para novas modalidades, continua a influenciar a forma como os pesquisadores inicializam geradores de áudio e vídeo a partir de backbones pré-treinados existentes.

Implementação no mundo real

Gerando faixas de fundo em loop curto para videogames independentes a partir de um prompt de texto como 'perseguição tensa de synthwave'

Transformando-se suavemente entre dois estilos musicais, por ex. misturando 'tropical house' com 'lo-fi hip hop' em um único clipe

Produzindo camas de música ambiente isentas de royalties para vídeos e podcasts do YouTube sem taxas de licenciamento

Prototipagem de ideias melódicas ou rítmicas que um músico regrava adequadamente em uma estação de trabalho de áudio digital

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Riffusion Spectrogram Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Vocoder de difusão DiffWave

Perguntas frequentes

What is Riffusion Spectrogram Diffusion?

Riffusion é um hack inteligente que gera música tratando o som como uma imagem: ele ajusta o modelo de imagem Stable Diffusion para pintar espectrogramas e depois converte essas imagens novamente em áudio. É importante porque mostra que uma ferramenta construída para um meio (imagens) pode produzir outro (música) quase sem nenhuma nova arquitetura.

Qual modelo de IA existente o Riffusion ajustou para gerar música?

Riffusion ajustou Stable Diffusion, um modelo de difusão de imagem, para gerar imagens de espectrograma que são então convertidas em áudio.

O que um espectrograma representa em seus dois eixos?

Em um espectrograma, o eixo horizontal é o tempo, o eixo vertical é a frequência e o brilho representa o volume.

Por que o Riffusion precisa de um algoritmo como Griffin-Lim?

O espectrograma armazena a magnitude, mas descarta a fase, então Griffin-Lim estima iterativamente a fase para reconstruir uma forma de onda reproduzível.

Que capacidade a difusão oferece ao Riffusion ao combinar dois prompts?

Os modelos de difusão podem interpolar no espaço latente, permitindo que o Riffusion se transforme continuamente de um estilo musical para outro.

Como o Riffusion foi originalmente criado e lançado?

Riffusion começou como um projeto hobby de Seth Forsgren e Hayk Martiros, lançado publicamente no final de 2022.