MusicLM: Ishara za Hierarkia za Semantic na Acoustic
MusicLM is Google's text-to-music model that generates long-form audio through a hierarchy of semantic tokens for musical structure and acoustic tokens for sound detail.
Dive ya kina
Iliyotangazwa na Google Utafiti wa mwanzoni mwa 2023, MusicLM inatayarisha kizazi cha muziki kama kutabiri msururu wa tokeni za sauti, kama vile muundo wa lugha unavyotabiri maneno. Inatumia safu ya uwakilishi: tokeni za kisemantiki (kutoka kwa muundo unaoitwa w2v-BERT) hunasa muundo wa kiwango cha juu kama vile wimbo na mdundo kwa vipindi virefu, huku tokeni za akustika (kutoka kwa kodeki ya neural ya SoundStream) huchukua maelezo mafupi kama vile timbre na umbile. Hatua ya kwanza huzalisha tokeni za kisemantiki kutoka kwa haraka ya maandishi, kisha hatua za baadaye hujaza maelezo ya akustika yaliyowekwa kwenye semantiki hizo. Urekebishaji wa maandishi hutoka kwa MuLM/MuLan, upachikaji wa maandishi ya muziki uliofunzwa ili maelezo na sauti kutua katika nafasi sawa. Mbinu hii kwa hatua huruhusu MusicLM kusalia sawa kimuziki kwa dakika badala ya kuelea baada ya sekunde chache.
Ufahamu wa Kiufundi
Wazo kuu ni kutenganisha muundo kutoka kwa muundo kwenye safu ya ishara. Ishara za semantic mbaya ni chache na zinabadilika polepole, kwa hivyo Transformer inaweza kuunda fomu ya muda mrefu bila urefu mkubwa wa mlolongo. Ishara za akustisk ni mnene na za kiwango cha juu, lakini zinahitaji tu kutabiriwa kulingana na semantiki zilizowekwa tayari, na kufanya kila hatua iweze kueleweka. Ukadiriaji wa vekta ya mabaki ya SoundStream hutoa misimbo ya akustika iliyowekewa safu ambayo kisimusi cha mwisho hurejesha kuwa miundo ya mawimbi ya kHz 24.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa MuzikiLM: Ishara za Hierarkia za Semantic na Acoustic
Mbinu ya tokeni ya daraja la MusicLM ikawa kiolezo cha mifumo ya baadaye kama vile MusicGen na zana za muziki za kibiashara. Tarajia uboreshaji wa kina wa sauti (vuma wimbo, pata mpangilio kamili), nyimbo ndefu zilizo na muundo kamili wenye mistari na korasi, na udhibiti bora wa ala na funguo. Masuala mazito ni ya kisheria na ya kimaadili: utoaji leseni ya data ya mafunzo, idhini ya msanii, na sauti inayotokana na uwekaji alama maalum ili iweze kutofautishwa na muziki ulioundwa na binadamu sasa hivi ndio msingi wa utumiaji.
Utekelezaji wa Ulimwengu Halisi
Kugeuza maelezo ya tukio lililoandikwa kuwa alama ya filamu au trela, k.m. 'epic orchestral build with choir'
Inazalisha muziki wa usuli uliowekwa kwenye maelezo mafupi ya picha au hata maelezo ya uchoraji kwa ajili ya usakinishaji wa sanaa
Kupanua wimbo mfupi wa kuvuma au kupigwa filimbi katika mpangilio kamili
Kuzalisha nyimbo mbalimbali za muziki kwa nyakati na hali tofauti za utangazaji na waundaji wa maudhui.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Kizazi cha Muziki cha Alama
Maswali yanayoulizwa mara kwa mara
What is MusicLM: Hierarchical Semantic and Acoustic Tokens?
MusicLM is Google's text-to-music model that generates long-form audio through a hierarchy of semantic tokens for musical structure and acoustic tokens for sound detail.
Je, kimsingi MusicLM inashughulikiaje kazi ya kutengeneza muziki?
MusicLM huweka uundaji wa muziki kama utabiri wa kiotomatiki juu ya tokeni tofauti za sauti, sawa na jinsi muundo wa lugha unavyotabiri maneno.
Ni nini jukumu la ishara za semantic katika MusicLM?
Tokeni za kisemantiki (kutoka w2v-BERT) hunasa muundo mbaya, unaobadilika polepole kama vile mdundo na mdundo kwa vipindi virefu.
Ni sehemu gani hutoa maelezo mazuri ya akustisk kama timbre na muundo?
Tokeni za sauti hutoka kwenye kodeki ya neural ya SoundStream na kusimba maelezo mafupi kama vile timbre na umbile.
Je, MusicLM inaunganisha vipi arifa ya maandishi kwa sauti ya muziki?
MuLan imefunzwa ili maelezo ya maandishi na kulinganisha ramani ya sauti na sehemu zilizo karibu katika nafasi iliyoshirikiwa ya kupachika, kuwezesha uwekaji maandishi.
Kwa nini muundo wa daraja, uliopangwa kwa hatua husaidia na muundo wa masafa marefu?
Tokeni chache za kisemantiki hubadilika polepole, kwa hivyo Kibadilishaji kielelezo cha umbo la muda mrefu kwa ufanisi kabla ya kujazwa kwa maelezo mnene ya akustika.