GUIA de IA de áudio

Transcrição Automática de Música

A Transcrição Automática de Música (AMT) converte uma gravação de áudio bruta de música em uma notação simbólica, como partituras, MIDI ou um rolo de piano.

2 minutos de leituraÚltima atualização

Visão geral

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Mergulho profundo

Os sistemas AMT ouvem uma forma de onda de áudio e emitem quais notas são tocadas, quando começam, quanto tempo duram e, às vezes, qual instrumento as toca. O principal desafio é a polifonia: quando várias notas soam simultaneamente, seus harmônicos se sobrepõem e se confundem no espectro de frequências, de modo que um único dó e um sol podem ser difíceis de separar de uma única nota mais alta. Os sistemas modernos convertem o áudio em uma representação de tempo-frequência, como um espectrograma mel ou Transformada Constant-Q, e então usam redes neurais profundas para prever o início, o deslocamento e o tom das notas. O modelo Onsets and Frames de Google foi um marco para a transcrição de piano, enquanto modelos de transformadores mais recentes, como o MT3, transcrevem vários instrumentos ao mesmo tempo.

Visão Técnica

Um insight importante é separar a detecção de início da detecção de pitch em nível de quadro. Modelos como Onsets e Frames usam um cabeçote de rede para identificar o momento preciso em que uma nota começa (um evento agudo e energético) e outro para rastrear quais tons estão soando em cada quadro. As previsões iniciais então bloqueiam as saídas do quadro, reduzindo drasticamente as notas falsas. A Transformada Constant-Q ajuda porque espaça os compartimentos de frequência logaritmicamente, combinando como os tons musicais são espaçados por uma oitava.

Impacto Estratégico

Acesso e alcance

Melhora a acessibilidade por meio de transcrição, narração e interfaces de voz.

Custo e orçamento

As equipes de mídia podem enviar áudio sofisticado com mais rapidez e com orçamentos menores.

Velocidade e escala

Os sistemas voltados para o cliente podem processar interações faladas em maior escala.

O futuro da transcrição automática de música

AMT está mudando do piano solo para uma transcrição confiável de multiinstrumentos e banda completa, incluindo bateria, vocais e técnicas expressivas como bends e vibrato. As arquiteturas de transformadores treinadas em grandes conjuntos de dados sintéticos e alinhados estão preenchendo essa lacuna. Espere uma integração mais estreita com separação de fontes, transcrição em tempo real para apresentações ao vivo e ferramentas que capturam microtemporização e dinâmica, não apenas notas. O objetivo de longo prazo é um sistema que transforme qualquer gravação em partituras editáveis ​​e legíveis por humanos.

Implementação no mundo real

AnthemScore e aplicativos semelhantes que convertem gravações de MP3 em partituras editáveis para músicos que aprendem músicas de ouvido

Extração MIDI de uma gravação de piano para que um produtor possa dar voz novamente ou quantizar a performance em um DAW

Ferramentas de educação musical que comparam as notas tocadas por um aluno com a partitura para sinalizar notas erradas ou perdidas

Musicólogos que transcrevem gravações históricas ou improvisadas (como solos de jazz) em notação para análise

Riscos e guarda-corpos

Os riscos de uso indevido de voz e falsificação de identidade aumentam quando falta consentimento.

A precisão pode diminuir em sotaques, dialetos ou ambientes barulhentos.

O áudio sintético pode ser confundido com fala autêntica sem uma rotulagem clara.

Roteiro de implementação

1

Obtenha consentimento explícito para captura, clonagem e reutilização de voz.

2

Teste a qualidade em diversos alto-falantes e condições de fundo.

3

Defina quando um ser humano deve revisar ou aprovar os resultados.

4

Rotule o áudio sintético e mantenha registros de procedência para fins de prestação de contas.

Continue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar teste

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Próximo guia

Geração de Música Simbólica

Perguntas frequentes

What is Automatic Music Transcription?

A Transcrição Automática de Música (AMT) converte uma gravação de áudio bruta de música em uma notação simbólica, como partituras, MIDI ou um rolo de piano. Ele aborda um dos problemas mais difíceis da IA ​​de áudio: desembaraçar muitas notas sobrepostas tocadas ao mesmo tempo.

O que a Transcrição Automática de Música produz principalmente?

AMT converte uma gravação de áudio em uma notação simbólica, como MIDI, um piano roll ou partituras que descrevem as notas tocadas.

Por que a música polifônica é especialmente difícil de transcrever?

Quando várias notas soam ao mesmo tempo, seus harmônicos se sobrepõem, tornando difícil separar quais notas individuais estão presentes.

O que foi notável no modelo Onsets e Frames de Google?

Onsets e Frames usavam um cabeçote para detectar inícios de notas precisos e outro para tons sustentados, com inícios controlando a saída do quadro.

Por que o Constant-Q Transform é útil para música?

Os tons musicais são espaçados logaritmicamente (oitavas dobram em frequência), e os compartimentos logarítmicos do CQT alinham-se naturalmente com isso.

A que se refere um 'início' na transcrição?

Um início é o momento agudo e energético em que uma nota começa, que é mais fácil de localizar com precisão do que a sua sustentação.