GUIDA AI audio

Trascrizione musicale automatica

La trascrizione musicale automatica (AMT) converte una registrazione audio grezza di musica in una notazione simbolica come spartiti, MIDI o un pianoforte.

2 minuti di letturaUltimo aggiornamento

Panoramica

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Immersione profonda

I sistemi AMT ascoltano una forma d'onda audio e trasmettono quali note vengono suonate, quando iniziano, quanto durano e talvolta quale strumento le suona. La sfida principale è la polifonia: quando più note suonano simultaneamente, le loro armoniche si sovrappongono e si confondono nello spettro delle frequenze, quindi un singolo Do e un Sol possono essere difficili da separare da una singola nota più forte. I sistemi moderni convertono l'audio in una rappresentazione tempo-frequenza come uno spettrogramma mel o una trasformazione a Q costante, quindi utilizzano reti neurali profonde per prevedere l'inizio, lo spostamento e l'altezza delle note. Il modello Onsets and Frames di Google è stato un punto di riferimento per la trascrizione del pianoforte, mentre i modelli di trasformatore più recenti come MT3 trascrivono più strumenti contemporaneamente.

Approfondimento tecnico

Un aspetto fondamentale è la separazione del rilevamento dell'inizio dal rilevamento del tono a livello di fotogramma. Modelli come Onsets e Frames utilizzano una testina di rete per individuare il momento preciso in cui inizia una nota (un evento acuto ed energico) e un'altra per tenere traccia delle altezze che suonano in ciascun fotogramma. Le previsioni di inizio quindi controllano le uscite del frame, riducendo drasticamente le note spurie. La trasformazione a Q costante aiuta perché distanzia i contenitori di frequenza logaritmicamente, corrispondendo al modo in cui le altezze musicali sono distanziate di un'ottava.

Impatto strategico

Accedere e raggiungere

Migliora l'accessibilità attraverso la trascrizione, la narrazione e le interfacce vocali.

Costo e budget

I team media possono fornire audio raffinato più velocemente con budget inferiori.

Velocità e scala

I sistemi rivolti al cliente possono elaborare le interazioni parlate su scala più ampia.

Il futuro della trascrizione musicale automatica

AMT si sta spostando dal pianoforte solo verso una trascrizione affidabile multi-strumento e a banda intera, comprese batteria, voce e tecniche espressive come bending e vibrato. Le architetture dei trasformatori addestrate su grandi set di dati sintetici e allineati stanno colmando il divario. Aspettatevi un'integrazione più stretta con la separazione delle fonti, la trascrizione in tempo reale per le performance dal vivo e strumenti che catturano micro-tempi e dinamiche, non solo note. L'obiettivo a lungo termine è un sistema che trasformi qualsiasi registrazione in una partitura modificabile e leggibile dall'uomo.

Implementazione nel mondo reale

AnthemScore e app simili convertono le registrazioni MP3 in spartiti modificabili per i musicisti che imparano le canzoni a orecchio

Estrazione MIDI da una registrazione di pianoforte in modo che un produttore possa rielaborare la voce o quantizzare la performance in una DAW

Strumenti di educazione musicale che confrontano le note suonate da uno studente con la partitura per contrassegnare le note sbagliate o perse

Musicologi che trascrivono registrazioni storiche o improvvisate (come gli assoli jazz) in notazione per l'analisi

Rischi e guardrail

I rischi di uso improprio della voce e di impersonificazione aumentano quando manca il consenso.

La precisione può diminuire se si considerano accenti, dialetti o ambienti rumorosi.

L'audio sintetico può essere confuso con un parlato autentico senza un'etichettatura chiara.

Tabella di marcia per l'implementazione

1

Ottieni il consenso esplicito per l'acquisizione, la clonazione e il riutilizzo della voce.

2

Testare la qualità su diversi altoparlanti e condizioni di fondo.

3

Definire quando un essere umano deve rivedere o approvare gli output.

4

Etichettare l'audio sintetico e conservare i registri di provenienza per responsabilità.

Continua a esplorare

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Inizia il quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Prossima guida

Generazione di musica simbolica

Domande frequenti

What is Automatic Music Transcription?

La trascrizione musicale automatica (AMT) converte una registrazione audio grezza di musica in una notazione simbolica come spartiti, MIDI o un pianoforte. Affronta uno dei problemi più difficili dell'intelligenza artificiale audio: districare molte note sovrapposte suonate contemporaneamente.

Che cosa produce principalmente la trascrizione musicale automatica?

AMT converte una registrazione audio in una notazione simbolica come MIDI, un piano roll o uno spartito che descrive le note suonate.

Perché la musica polifonica è particolarmente difficile da trascrivere?

Quando più note suonano contemporaneamente, le loro armoniche si sovrappongono, rendendo difficile separare le singole altezze presenti.

Cosa c'era di interessante nel modello Onsets and Frames di Google?

Onsets e Frames utilizzavano una testina per rilevare gli attacchi precisi delle note e un'altra per le altezze sostenute, con gli attacchi che controllavano l'uscita del fotogramma.

Perché la trasformazione a Q costante è utile per la musica?

Le altezze musicali sono distanziate logaritmicamente (le ottave raddoppiano in frequenza) e i contenitori distanziati logaritmicamente del CQT si allineano naturalmente con questo.

A cosa si riferisce un "esordio" nella trascrizione?

L'esordio è il momento acuto ed energico in cui inizia una nota, che è più facile da localizzare con precisione rispetto al suo sostegno.