MWONGOZO WA AI wa Sauti

MusicLM: Ishara za Hierarkia za Semantic na Acoustic

MusicLM is Google's text-to-music model that generates long-form audio through a hierarchy of semantic tokens for musical structure and acoustic tokens for sound detail.

dk 2 kusomaIlisasishwa mwisho

Dive ya kina

Iliyotangazwa na Google Utafiti wa mwanzoni mwa 2023, MusicLM inatayarisha kizazi cha muziki kama kutabiri msururu wa tokeni za sauti, kama vile muundo wa lugha unavyotabiri maneno. Inatumia safu ya uwakilishi: tokeni za kisemantiki (kutoka kwa muundo unaoitwa w2v-BERT) hunasa muundo wa kiwango cha juu kama vile wimbo na mdundo kwa vipindi virefu, huku tokeni za akustika (kutoka kwa kodeki ya neural ya SoundStream) huchukua maelezo mafupi kama vile timbre na umbile. Hatua ya kwanza huzalisha tokeni za kisemantiki kutoka kwa haraka ya maandishi, kisha hatua za baadaye hujaza maelezo ya akustika yaliyowekwa kwenye semantiki hizo. Urekebishaji wa maandishi hutoka kwa MuLM/MuLan, upachikaji wa maandishi ya muziki uliofunzwa ili maelezo na sauti kutua katika nafasi sawa. Mbinu hii kwa hatua huruhusu MusicLM kusalia sawa kimuziki kwa dakika badala ya kuelea baada ya sekunde chache.

Ufahamu wa Kiufundi

Wazo kuu ni kutenganisha muundo kutoka kwa muundo kwenye safu ya ishara. Ishara za semantic mbaya ni chache na zinabadilika polepole, kwa hivyo Transformer inaweza kuunda fomu ya muda mrefu bila urefu mkubwa wa mlolongo. Ishara za akustisk ni mnene na za kiwango cha juu, lakini zinahitaji tu kutabiriwa kulingana na semantiki zilizowekwa tayari, na kufanya kila hatua iweze kueleweka. Ukadiriaji wa vekta ya mabaki ya SoundStream hutoa misimbo ya akustika iliyowekewa safu ambayo kisimusi cha mwisho hurejesha kuwa miundo ya mawimbi ya kHz 24.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa MuzikiLM: Ishara za Hierarkia za Semantic na Acoustic

Mbinu ya tokeni ya daraja la MusicLM ikawa kiolezo cha mifumo ya baadaye kama vile MusicGen na zana za muziki za kibiashara. Tarajia uboreshaji wa kina wa sauti (vuma wimbo, pata mpangilio kamili), nyimbo ndefu zilizo na muundo kamili wenye mistari na korasi, na udhibiti bora wa ala na funguo. Masuala mazito ni ya kisheria na ya kimaadili: utoaji leseni ya data ya mafunzo, idhini ya msanii, na sauti inayotokana na uwekaji alama maalum ili iweze kutofautishwa na muziki ulioundwa na binadamu sasa hivi ndio msingi wa utumiaji.

Utekelezaji wa Ulimwengu Halisi

Kugeuza maelezo ya tukio lililoandikwa kuwa alama ya filamu au trela, k.m. 'epic orchestral build with choir'

Inazalisha muziki wa usuli uliowekwa kwenye maelezo mafupi ya picha au hata maelezo ya uchoraji kwa ajili ya usakinishaji wa sanaa

Kupanua wimbo mfupi wa kuvuma au kupigwa filimbi katika mpangilio kamili

Kuzalisha nyimbo mbalimbali za muziki kwa nyakati na hali tofauti za utangazaji na waundaji wa maudhui.

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Kizazi cha Muziki cha Alama

Maswali yanayoulizwa mara kwa mara

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM is Google's text-to-music model that generates long-form audio through a hierarchy of semantic tokens for musical structure and acoustic tokens for sound detail.

Je, kimsingi MusicLM inashughulikiaje kazi ya kutengeneza muziki?

MusicLM huweka uundaji wa muziki kama utabiri wa kiotomatiki juu ya tokeni tofauti za sauti, sawa na jinsi muundo wa lugha unavyotabiri maneno.

Ni nini jukumu la ishara za semantic katika MusicLM?

Tokeni za kisemantiki (kutoka w2v-BERT) hunasa muundo mbaya, unaobadilika polepole kama vile mdundo na mdundo kwa vipindi virefu.

Ni sehemu gani hutoa maelezo mazuri ya akustisk kama timbre na muundo?

Tokeni za sauti hutoka kwenye kodeki ya neural ya SoundStream na kusimba maelezo mafupi kama vile timbre na umbile.

Je, MusicLM inaunganisha vipi arifa ya maandishi kwa sauti ya muziki?

MuLan imefunzwa ili maelezo ya maandishi na kulinganisha ramani ya sauti na sehemu zilizo karibu katika nafasi iliyoshirikiwa ya kupachika, kuwezesha uwekaji maandishi.

Kwa nini muundo wa daraja, uliopangwa kwa hatua husaidia na muundo wa masafa marefu?

Tokeni chache za kisemantiki hubadilika polepole, kwa hivyo Kibadilishaji kielelezo cha umbo la muda mrefu kwa ufanisi kabla ya kujazwa kwa maelezo mnene ya akustika.