Vokoda ya UnivNet yenye Azimio nyingi
UnivNet ni vokoda ya GAN ambayo inatathmini ilitoa sauti kwa kutumia spectrogramu nyingi zilizokokotwa katika maazimio tofauti ya STFT, ikiboresha maelezo ya masafa ya juu.
Muhtasari
It aims to be a universal vocoder that generalizes well to unseen speakers and recording conditions.
Dive ya kina
UnivNet, iliyopendekezwa na Jang et al. mnamo 2021, inakabiliana na udhaifu unaojulikana kwa vokoda za GAN: masafa ya juu yaliyofichwa au yaliyosheheni vizalia vya programu. Masharti yake ya jenereta kwenye spectrogramu za bendi kamili na hutumia vibadilishaji vya eneo (LVC), ambapo chembechembe za ubadilishaji hutabiriwa kwenye nzi kutoka kwa vipengele vya ingizo ili kichujio kikabiliane na maudhui ya ndani. Wazo la kichwa ni kibaguzi wa spectrogram yenye maazimio mengi (MRSD): badala ya kuhukumu tu muundo mbichi wa mawimbi, UnivNet hukusanya STFT kadhaa kwa ukubwa tofauti wa dirisha na kurukaruka na huendesha vibaguzi kwa ukubwa huo wa spectrogram. Hii inasukuma jenereta kupata maelezo mazuri ya taswira na muundo mpana wa muda. Imefunzwa kwenye spika nyingi, UnivNet hutoa matamshi ya asili kwa sauti ambayo haijawahi kuona wakati wa mafunzo, na kupata lebo yake ya jumla.
Ufahamu wa Kiufundi
Ubadilishaji unaoweza kubadilika wa eneo wa UnivNet huzalisha uzani wake wa kerneli kwa nguvu kutoka kwa vipengele vya hali ya hewa kupitia mtandao mdogo wa kitabiri cha kernel, kwa hivyo kila hatua ya wakati hutumia kwa ufanisi kichujio kinachobadilika na yaliyomo badala ya punje iliyoshirikiwa. Ikiunganishwa na kibaguzi cha spectrogram chenye maazimio mengi, ambacho huchukua mabadilishano kadhaa ya mara kwa mara kwa wakati mmoja, hii inalenga moja kwa moja bendi ya masafa ya juu ambapo vokoda rahisi za GAN huwa na ukungu au kuvuma.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Vokoda ya UnivNet yenye Azimio nyingi
Ubaguzi wa maazimio mbalimbali wa UnivNet umekuwa kiungo cha kawaida katika rafu za kisasa za TTS na mifumo iliyoathiriwa kama vile BigVGAN na kodeki za sauti za neva. Tarajia uundaji wa ulimwengu wote, wa spika-agnostiki ili kuendelea kupanuka kuelekea sauti ya kuimba, usanisi wa lugha nyingi, na sauti ya kipimo data kamili cha kHz 48, huku wazo la adaptive-kernel liarifu miundo bora kwenye kifaa ambayo lazima ishughulikie sauti mbalimbali bila urekebishaji mzuri wa kila mzungumzaji.
Utekelezaji wa Ulimwengu Halisi
Huduma za TTS za wazungumzaji wengi ambazo lazima zisikike za kawaida kwa sauti ambazo hazipo kwenye data ya mafunzo
Mabomba ya kuunda sauti ambapo vokoda moja ya ulimwengu wote hutumikia wazungumzaji wengi lengwa
Kitabu cha sauti cha uaminifu wa hali ya juu na masimulizi ya podikasti yanayohitaji usawazishaji wa hali ya juu na masafa ya juu
Vokoda ya nyuma kwa mifumo ya TTS ya mwisho hadi-mwisho inayooanisha kitabiri cha spectrogram na jenereta thabiti ya umbo la wimbi.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the UnivNet Multi-Resolution Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Vokoda za Neural
Maswali yanayoulizwa mara kwa mara
What is UnivNet Multi-Resolution Vocoder?
UnivNet ni vokoda ya GAN ambayo inatathmini ilitoa sauti kwa kutumia spectrogramu nyingi zilizokokotwa katika maazimio tofauti ya STFT, ikiboresha maelezo ya masafa ya juu. Inalenga kuwa vokoda ya ulimwengu wote ambayo inajumlisha vyema kwa wazungumzaji wasioonekana na hali ya kurekodi.
Ni kipengele gani cha saini cha kibaguzi cha UnivNet?
UnivNet ya kibaguzi wa spectrogram yenye maazimio mengi huchanganua STFT kadhaa kwa ukubwa tofauti wa dirisha na kurukaruka ili kunasa ubadilishanaji wa masafa tofauti ya saa.
Ni tatizo gani katika vokoda za GAN za awali ambazo UnivNet inalenga haswa?
Kwa kubagua katika maazimio mengi ya spectrogramu, UnivNet inaboresha maelezo ya masafa ya juu ambayo vokoda rahisi za GAN mara nyingi hutiwa ukungu.
Je, mabadiliko ya kutofautisha eneo (LVC) katika UnivNet ni nini?
LVC hutumia mtandao wa kernel-predictor ili kila eneo litumie vichujio vinavyobadilika vya maudhui vinavyotokana na hali ya mel-spectrogram.
Kwa nini UnivNet inaelezewa kama vokoda ya ulimwengu wote?
Imefunzwa kwenye spika nyingi, UnivNet huunganisha matamshi ya asili hata kwa sauti ambayo haijawahi kukutana nayo katika mafunzo, kwa hivyo ni ya ulimwengu wote.
Je, kibaguzi wa spectrogram yenye maazimio mengi husaidiaje jenereta?
Maazimio tofauti ya STFT yanasisitiza ubadilishanaji tofauti wa masafa ya saa, kwa hivyo kulinganisha zote husukuma jenereta kuelekea maelezo na muundo sahihi.