Szimbolikus zenegeneráció
A szimbolikus zenegenerálás a zenét strukturált lejegyzésként hozza létre – hangok, hangmagasságok, időtartamok és időzítés (gyakran MIDI-ként) –, nem pedig nyers hanganyagként.
Áttekintés
It gives composers editable, instrument-agnostic output they can tweak note by note.
Mély merülés
A kész hullámforma létrehozása helyett a szimbolikus rendszerek generálják a „kottát”: hangsorokat hangmagassággal, időtartammal, sebességgel és időzítéssel, jellemzően MIDI vagy zongorahenger formában. Mivel a kimenet szimbolikus, teljes mértékben szerkeszthető – egyetlen hangot megváltoztathat, hangszereket cserélhet, áthelyezheti a billentyűket, vagy átadhatja egy emberi előadónak. A nevezetes projektek közé tartozik a Google Magenta's MelodyRNN és MusicVAE, a OpenAI MuseNet (2019), amely sokféle stílusban több hangszeres kompozíciókat generált, valamint az Anticipatory Music Transformer munkája. A Sunohoz hasonló nyers hangeszközökkel szembeni kompromisszum az, hogy a szimbolikus modellek nem adják ki a tényleges hangzást vagy valósághű énekhangot; szintetizátorra vagy samplerre van szükségük ahhoz, hogy meghallják. De pontosságot, irányíthatóságot és apró, gyors megjelenítést kínálnak.
Technikai betekintés
Ezek a modellek úgy kezelik a zenét, mint egy nyelvet: a hangjegyek (vagy a hangjegy-események, mint a „note-on”, „note-off”, time-shift) jelzőkké válnak, és egy sorozatmodell – történelmileg egy RNN/LSTM, jelenleg általában egy Transformer – előrejelzi a következő eseményt. Egyesek VAE-t használnak a sima látens tér megtanulására, így interpolálhatnak a dallamok között. Mivel a szimbolikus sorozat több ezerszer rövidebb, mint egy nyers hullámforma, ezek a modellek sokkal gyorsabban edznek és generálnak, mint az audiomodellek, és kimenetük közvetlenül szerkeszthető bármely jelölési szoftverben.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A szimbolikus zenegeneráció jövője
A szimbolikus generálás egyre inkább hanggal párosul: egy Transformer komponálja a kottát, majd egy kiváló minőségű neurális szintetizátor vagy mintavevő rendereli azt, a szerkeszthetőséget valósághű hangzással kombinálva. Szorosabb integrációra számíthat a DAW-kbe és a lejegyzési eszközökbe, mint másodpilóták, amelyek harmóniákat javasolnak, hangszereléseket töltenek ki, vagy igény szerint folytatják a dallamot. Ahogy javul az irányítás, a zenészek valószínűleg interaktív zeneszerző partnerként fogják kezelni a szimbolikus mesterséges intelligenciát, és a szimbolikus plusz audio csővezeték áthidalja a szakadékot a stúdióminőségű kimenetek között.
Valós megvalósítás
Egy zeneszerző a Google Magenta eszközökkel dallam- vagy harmóniaötleteket generál, majd hangról hangra szerkeszti a DAW-ban.
Egy játékstúdió, amely eljárásilag MIDI háttérzenét generál, amely alkalmazkodik a játékmenethez, és bármilyen hangszerkészlettel előállítható.
Zenei oktató szoftver automatikusan generáló gyakorló gyakorlatok és kíséret választott hangnemben és nehézségi fokozatban.
Egy producer, aki MuseNet-stílusú modelleket használ, hogy több hangszeres elrendezést dolgozzon ki különböző műfajok között, majd finomítsa és újra hangszerelje azokat.
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Symbolic Music Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
MusicLM hierarchikus zenegeneráció
Gyakran ismételt kérdések
What is Symbolic Music Generation?
A szimbolikus zenegenerálás a zenét strukturált lejegyzésként hozza létre – hangok, hangmagasságok, időtartamok és időzítés (gyakran MIDI-ként) –, nem pedig nyers hanganyagként. Szerkeszthető, hangszer-agnosztikus kimenetet ad a zeneszerzőknek, amelyeket hangról hangra módosíthatnak.
Mit produkál valójában a szimbolikus zenei generáció?
A szimbolikus rendszerek a tényleges hang helyett a „pontszámot” adják ki – olyan eseményeket, mint a hangmagasság, időtartam és időzítés.
Mi a szimbolikus kimenet fő előnye a nyers hanggeneráláshoz képest?
Mivel a kimenet szimbolikus jelölés, minden hang szerkeszthető, transzponálható, újrahangszerelhető vagy ember által előadható.
Ezek közül melyik a OpenAI jól ismert szimbolikus zenei modellje?
A MuseNet (2019) több hangszeres szimbolikus kompozíciókat generált számos zenei stílusban.
Hogyan kezelik a modern szimbolikus modellek általában a zenét számítástechnikailag?
A szimbolikus modellek tokenizálják a hangjegyes eseményeket (mint például a feljegyzés, a feljegyzés, az időeltolás), és sorozatmodelleket (például Transformers) használnak a következő esemény előrejelzésére.
A szimbolikus modellek általában miért képeznek és generálnak gyorsabban, mint a nyers hangmodellek?
A szimbolikus sorozat sokkal kompaktabb, mint a több millió hangminta, így a modellek sokkal hatékonyabban dolgozzák fel.