GUIA de IA de áudio

MusicLM: tokens semânticos e acústicos hierárquicos

MusicLM é o modelo de texto para música de Google que gera áudio de formato longo por meio de uma hierarquia de tokens semânticos para estrutura musical e tokens acústicos para detalhes sonoros.

2 minutos de leituraÚltima atualização

Mergulho profundo

Anunciado pela pesquisa Google no início de 2023, MusicLM enquadra a geração de música como a previsão de sequências de tokens de áudio discretos, da mesma forma que um modelo de linguagem prevê palavras. Ele usa uma hierarquia de representações: tokens semânticos (de um modelo chamado w2v-BERT) capturam estruturas de alto nível, como melodia e ritmo, em longos períodos, enquanto tokens acústicos (do codec neural SoundStream) capturam detalhes finos, como timbre e textura. Um primeiro estágio gera tokens semânticos a partir do prompt de texto e, em seguida, os estágios posteriores preenchem detalhes acústicos condicionados a essa semântica. O condicionamento de texto vem do MuLM/MuLan, uma incorporação conjunta de música e texto treinada para que descrições e áudio caiam no mesmo espaço. Essa abordagem encenada permite que o MusicLM permaneça musicalmente consistente por minutos, em vez de ficar à deriva após alguns segundos.

Visão Técnica

A ideia principal é dissociar a estrutura da textura em uma hierarquia de tokens. Os tokens semânticos grosseiros são esparsos e mudam lentamente, portanto, um Transformer pode modelar a forma de longo prazo sem um grande comprimento de sequência. Os tokens acústicos são densos e de alta taxa, mas só precisam ser previstos condicionados à semântica já fixada, tornando cada estágio tratável. A quantização vetorial residual do SoundStream produz códigos acústicos em camadas que um decodificador final transforma em formas de onda de 24 kHz.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O Futuro da MusicLM: Tokens Semânticos e Acústicos Hierárquicos

A abordagem de token hierárquico do MusicLM tornou-se um modelo para sistemas posteriores como MusicGen e ferramentas musicais comerciais. Espere um condicionamento melódico mais rígido (cantarolar uma música, obter um arranjo completo), músicas mais longas e totalmente estruturadas com versos e refrões e melhor controlabilidade sobre os instrumentos e o tom. As questões espinhosas são legais e éticas: o licenciamento de dados de treinamento, o consentimento do artista e o áudio gerado com marca d'água para que possa ser distinguido da música feita pelo homem são agora fundamentais para a implantação.

Implementação no mundo real

Transformar uma descrição escrita de cena em uma trilha sonora de filme ou trailer, por ex. 'construção orquestral épica com coro'

Gerar música de fundo condicionada a uma legenda de imagem ou mesmo descrever descrições de pinturas para instalações artísticas

Estendendo uma melodia curta cantarolada ou assobiada em um arranjo totalmente instrumentado

Produzindo faixas variadas de stock music em diferentes ritmos e humores para publicidade e criadores de conteúdo

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Geração de Música Simbólica

Perguntas frequentes

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM é o modelo de texto para música de Google que gera áudio de formato longo por meio de uma hierarquia de tokens semânticos para estrutura musical e tokens acústicos para detalhes sonoros.

Como o MusicLM trata fundamentalmente a tarefa de gerar música?

MusicLM enquadra a geração de música como predição autoregressiva sobre tokens de áudio discretos, semelhante a como um modelo de linguagem prevê palavras.

Qual é o papel dos tokens semânticos no MusicLM?

Os tokens semânticos (de w2v-BERT) capturam estruturas grosseiras e de mudança lenta, como melodia e ritmo, em longos períodos.

Qual componente fornece detalhes acústicos finos, como timbre e textura?

Os tokens acústicos vêm do codec neural SoundStream e codificam detalhes finos, como timbre e textura.

Como o MusicLM conecta um prompt de texto ao áudio musical?

MuLan é treinado para que descrições de texto e correspondência de áudio sejam mapeadas para pontos próximos em um espaço de incorporação compartilhado, permitindo o condicionamento de texto.

Por que o design hierárquico e escalonado ajuda na estrutura de longo alcance?

Os tokens semânticos esparsos mudam lentamente, de modo que um Transformer pode modelar a forma de longo prazo com eficiência antes que detalhes acústicos densos sejam preenchidos.