Audio AI ÚTMUTATÓ

Automatikus zenei átírás

Az Automatic Music Transcription (AMT) a zene nyers hangfelvételét szimbolikus lejegyzésekké alakítja, például kottává, MIDI-vé vagy zongoratekercské.

2 perc olvasásUtoljára frissítve

Áttekintés

It tackles one of the hardest problems in audio AI: untangling many overlapping notes played at once.

Mély merülés

Az AMT rendszerek egy hanghullámot hallgatnak, és kiadják, hogy mely hangok szólalnak meg, mikor kezdődnek, mennyi ideig tartanak, és néha melyik hangszer játssza le őket. A fő kihívás a polifónia: amikor több hang szólal meg egyszerre, harmonikusaik átfedik egymást, és összemosódnak a frekvenciaspektrumban, így egyetlen C-t és G-t nehéz elválasztani egyetlen hangosabb hangtól. A modern rendszerek a hangot idő-frekvencia reprezentációvá alakítják át, például mel-spektrogrammá vagy Constant-Q Transform-má, majd mély neurális hálózatokat használnak a hangok kezdetének, eltolásának és hangmagasságának előrejelzésére. A Google Kezdők és keretek modellje mérföldkő volt a zongora átírásban, míg az újabb transzformátormodellek, például az MT3 több hangszert írnak át egyszerre.

Technikai betekintés

Egy kulcsfontosságú betekintést nyújt a kezdeti észlelés és a keretszintű hangmagasság-észlelés szétválasztása. Az olyan modellek, mint az Onsets és a Frames, egy hálózati fejet használnak a hangjegy kezdetének pontos pillanatának észlelésére (éles, energikus esemény), egy másikat pedig annak nyomon követésére, hogy az egyes képkockákban milyen hangmagasságok szólalnak meg. A kezdeti előrejelzések ezután bezárják a keretkimeneteket, drámaian csökkentve a hamis hangjegyeket. A Constant-Q Transform segít, mert logaritmikusan osztja el a frekvenciasávokat, és megfelel a zenei hangmagasságok oktávnyi távolságának.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

Az automatikus zeneátírás jövője

Az AMT a szólózongoráról a megbízható többhangszeres és teljes sávos átírás felé halad, beleértve a dobokat, az énekhangot és az olyan kifejező technikákat, mint a hajlítások és a vibrato. A nagy szintetikus és összehangolt adatkészletekre kiképzett transzformátor-architektúrák bezárják a szakadékot. Szorosabb integrációra számíthat a források szétválasztásával, valós idejű átírással az élő előadáshoz, valamint olyan eszközökkel, amelyek rögzítik a mikroidőzítést és a dinamikát, nem csak a jegyzeteket. A hosszú távú cél egy olyan rendszer, amely bármilyen felvételt szerkeszthető, ember által olvasható kottává alakít.

Valós megvalósítás

AnthemScore és hasonló alkalmazások, amelyek MP3-felvételeket alakítanak át szerkeszthető kottává olyan zenészeknek, akik hallásról tanulnak dalokat

MIDI kinyerés egy zongorafelvételről, így a producer újra megszólaltathatja vagy kvantifikálhatja az előadást DAW-ban

Zenei oktatási eszközök, amelyek összehasonlítják a tanuló lejátszott hangjait a kottával, hogy megjelöljék a rossz vagy kihagyott hangokat

Zenetudósok, akik történelmi vagy rögtönzött felvételeket (például jazzszólókat) írnak le kottaírásba elemzés céljából

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Szimbolikus zenegeneráció

Gyakran ismételt kérdések

What is Automatic Music Transcription?

Az Automatic Music Transcription (AMT) a zene nyers hangfelvételét szimbolikus lejegyzésekké alakítja, például kottává, MIDI-vé vagy zongoratekercské. Megoldja az audio AI egyik legnehezebb problémáját: sok, egyszerre lejátszott, egymást átfedő hangot felold.

Mit ad ki elsősorban az automatikus zeneátírás?

Az AMT egy hangfelvételt szimbolikus jelöléssé alakít át, például MIDI-vé, zongoratekercské vagy a lejátszott hangokat leíró kottává.

Miért különösen nehéz a többszólamú zenét átírni?

Ha több hang egyszerre szólal meg, azok harmonikusai átfedik egymást, ami megnehezíti az egyes hangmagasságok elkülönítését.

Mi volt a figyelemre méltó Google Kezdők és keretek modelljében?

A kezdetek és keretek egy fejet használtak a precíz hangkezdemények észlelésére, egy másikat pedig a tartós hangmagasságokra, a kezdetek kapuzták a keret kimenetét.

Miért hasznos a Constant-Q Transform a zenéhez?

A zenei hangmagasságok logaritmikusan vannak elosztva (az oktávok dupla frekvenciájúak), és a CQT logaritmikus térközű rekeszei természetesen ehhez igazodnak.

Mit jelent a „kezdet” az átírásban?

A kezdés az az éles, energikus pillanat, amikor egy hang elkezdődik, amelyet könnyebb pontosan lokalizálni, mint fenntartani.