GUÍA de IA en audio

Transcripción automática de música

La transcripción automática de música (AMT) convierte una grabación de audio sin procesar de música en una notación simbólica como partituras, MIDI o un rollo de piano.

2 minutos de lecturaÚltima actualización

Descripción general

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Buceo profundo

Los sistemas AMT escuchan una forma de onda de audio y emiten qué notas se tocan, cuándo comienzan, cuánto duran y, a veces, qué instrumento las toca. El desafío principal es la polifonía: cuando varias notas suenan simultáneamente, sus armónicos se superponen y se desdibujan en el espectro de frecuencia, por lo que un solo do y un sol pueden ser difíciles de separar de una sola nota más fuerte. Los sistemas modernos convierten el audio en una representación de tiempo-frecuencia, como un espectrograma mel o una transformación Q constante, y luego utilizan redes neuronales profundas para predecir los inicios, desplazamientos y tonos de las notas. El modelo Onsets and Frames de Google fue un hito para la transcripción de piano, mientras que los modelos transformadores más nuevos como MT3 transcriben múltiples instrumentos a la vez.

Información técnica

Una idea clave es separar la detección de inicio de la detección de tono a nivel de fotograma. Modelos como Onsets y Frames utilizan un cabezal de red para detectar el momento preciso en que comienza una nota (un evento agudo y enérgico) y otro para rastrear qué tonos suenan en cada cuadro. Luego, las predicciones de inicio controlan las salidas de fotogramas, reduciendo drásticamente las notas espurias. La Transformación Q Constante ayuda porque espacia los contenedores de frecuencia de forma logarítmica, igualando la forma en que los tonos musicales se espacian una octava.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de la transcripción musical automática

AMT está pasando del piano solo a una transcripción confiable de múltiples instrumentos y de banda completa, que incluye batería, voz y técnicas expresivas como curvas y vibrato. Las arquitecturas de transformadores entrenadas en grandes conjuntos de datos sintéticos y alineados están cerrando la brecha. Espere una integración más estrecha con separación de fuentes, transcripción en tiempo real para presentaciones en vivo y herramientas que capturan microtemporizaciones y dinámicas, no solo notas. El objetivo a largo plazo es un sistema que convierta cualquier grabación en una partitura editable y legible por humanos.

Implementación en el mundo real

AnthemScore y aplicaciones similares que convierten grabaciones MP3 en partituras editables para músicos que aprenden canciones de oído

Extracción MIDI de una grabación de piano para que un productor pueda volver a expresar o cuantizar la interpretación en un DAW

Herramientas de educación musical que comparan las notas tocadas por un estudiante con la partitura para marcar notas incorrectas o perdidas.

Musicólogos que transcriben grabaciones históricas o improvisadas (como solos de jazz) en notación para su análisis.

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Generación de música simbólica

Preguntas frecuentes

What is Automatic Music Transcription?

La transcripción automática de música (AMT) convierte una grabación de audio sin procesar de música en una notación simbólica como partituras, MIDI o un rollo de piano. Aborda uno de los problemas más difíciles de la IA de audio: desenredar muchas notas superpuestas tocadas a la vez.

¿Qué produce principalmente la transcripción automática de música?

AMT convierte una grabación de audio en una notación simbólica como MIDI, un rollo de piano o una partitura que describe las notas tocadas.

¿Por qué es especialmente difícil transcribir la música polifónica?

Cuando suenan varias notas a la vez, sus armónicos se superponen, lo que dificulta separar qué tonos individuales están presentes.

¿Qué fue lo notable del modelo Onsets and Frames de Google?

Onsets and Frames utilizó un cabezal para detectar inicios de notas precisos y otro para tonos sostenidos, y los inicios controlaban la salida del marco.

¿Por qué es útil la Transformada Q Constante para la música?

Los tonos musicales están espaciados logarítmicamente (las octavas duplican su frecuencia) y los contenedores espaciados logarítmicamente del CQT se alinean naturalmente con esto.

¿A qué se refiere un "inicio" en la transcripción?

Un inicio es el momento agudo y enérgico en el que comienza una nota, que es más fácil de localizar con precisión que su sostenido.