MWONGOZO WA AI wa Sauti

SautiLM

AudioLM ni Google mfumo wa utafiti ambao huzalisha sauti halisi - hotuba au muziki wa piano - kwa kutibu sauti kama lugha na kuitabiri kwa ishara.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It matters because it showed you can produce coherent, natural-sounding audio continuations without any text transcript or musical score.

Dive ya kina

Ilianzishwa na Google mwaka wa 2022, AudioLM inaweka upya uundaji wa sauti kama tatizo la kielelezo cha lugha: inabadilisha mawimbi ghafi kuwa tokeni tofauti na kisha kutabiri tokeni inayofuata, kama vile muundo wa maandishi unavyobashiri neno linalofuata. Ujanja wake muhimu ni safu ya aina za ishara. Ishara za 'Semantic' (kutoka kwa modeli kama vile w2v-BERT) hunasa muundo wa muda mrefu - fonetiki, sintaksia, melodi - huku ishara za 'acoustic' (kutoka kwa sauti ya sauti ya sauti) zinanasa maelezo mazuri kama vile utambulisho wa spika, timbre na masharti ya kurekodi. Kwa kutabiri kwanza tokeni za kisemantiki, kisha kuweka tokeni za akustisk juu yake, AudioLM hutoa miendelezo ambayo hukaa thabiti kwa sekunde nyingi huku ikihifadhi sauti au ala asili. Ikipewa sekunde chache za hotuba, inaendelea kusema kwa sauti ile ile; ikipewa piano, inaboresha kwa mtindo sawa.

Ufahamu wa Kiufundi

AudioLM inafunzwa kwa sauti pekee - hakuna nakala. SoundStream hubana sauti kuwa tokeni za akustika kupitia ujanibishaji wa vekta iliyobaki, huku w2v-BERT hutoa tokeni mbovu za kisemantiki. Kundi la miundo ya lugha ya Transfoma hutabiri ishara katika hatua: semantiki kwanza kwa muundo, kisha tokeni mbovu na laini za akustika kwa ajili ya ujenzi wa uaminifu wa juu. Kisimbuaji cha SoundStream hatimaye hurejesha tokeni zilizotabiriwa kuwa muundo wa wimbi, na kutoa sauti ambayo hudumisha sauti ya mzungumzaji na prosody yake.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa AudioLM

Kichocheo cha msingi cha tokeni cha AudioLM kimekuwa msingi wa mifumo ya baadaye: Mawazo ya Google ya AudioLM yaliyoingizwa kwenye MusicLM kwa maandishi hadi muziki na SoundStorm kwa kizazi cha haraka, huku uga mpana sasa unachanganya tokeni za kisemantiki na akustika katika matamshi, muziki na madoido ya sauti. Tarajia uzalishaji wa haraka, wa wakati halisi, matokeo madhubuti zaidi, na udhibiti wa moduli nyingi ambapo maandishi au mawimbi mengine huongoza miundo iliyofunzwa kikamilifu na sauti. Mbinu sawa pia huongeza wasiwasi juu ya uundaji wa sauti na bandia za sauti.

Utekelezaji wa Ulimwengu Halisi

Kuendeleza klipu fupi ya hotuba kwa sauti sawa ya mzungumzaji na kiimbo bila manukuu

Kuboresha muziki mpya wa piano unaolingana na mtindo wa kidokezo kifupi kilichorekodiwa

Inatumika kama uti wa mgongo wa kizazi cha sauti kwa mifumo ya maandishi-hadi-muziki kama vile MusicLM

Utafiti katika usanisi wa usemi ambao huhifadhi sauti za sauti na kurekodi kutoka kwa sampuli

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the AudioLM quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Keyword Spotting na Wake Maneno

Maswali yanayoulizwa mara kwa mara

What is AudioLM?

AudioLM ni Google mfumo wa utafiti ambao huzalisha sauti halisi - hotuba au muziki wa piano - kwa kutibu sauti kama lugha na kuitabiri kwa ishara. Ni muhimu kwa sababu ilionyesha kuwa unaweza kutoa miendelezo ya sauti yenye sauti ya asili bila manukuu yoyote ya maandishi au alama ya muziki.

AudioLM hutumia wazo gani la msingi kutoa sauti?

AudioLM hubadilisha maumbo ya mawimbi kuwa tokeni tofauti na kuzitabiri kwa kufuatana, kwa kutumia mbinu ya ishara inayofuata ya miundo ya lugha kwa sauti mbichi.

Ni nini jukumu la ishara za 'semantic' katika AudioLM?

Tokeni za kisemantiki (kutoka w2v-BERT) husimba muundo na mshikamano wa kiwango cha juu, huku tokeni za akustika hushughulikia maelezo mafupi ya sauti.

Ni codec gani ya neural hutoa tokeni za akustisk za AudioLM?

SoundStream hutumia ujanibishaji wa vekta iliyosalia ili kubana sauti kuwa tokeni za akustika na baadaye kusimbua tokeni zilizotabiriwa kuwa muundo wa wimbi.

Je, AudioLM inahitaji nini kama data ya mafunzo?

Kipengele kinachojulikana ni kwamba AudioLM hufundisha kwa sauti bila lebo yoyote ya maandishi, muundo wa kujifunza moja kwa moja kutoka kwa sauti.

Kwa nini AudioLM inatabiri ishara za kisemantiki kabla ya ishara za akustisk?

Kuzalisha muundo coarse kwanza huweka pato madhubuti baada ya muda; tokeni za akustisk basi huwekwa kwenye muundo huo ili kuongeza maelezo ya uaminifu wa hali ya juu.