Sauti ya Kuzalisha ya MelGAN
MelGAN ni vokoda yenye msingi wa GAN inayobadilika kikamilifu ambayo hubadilisha spectrogramu za hali ya juu kuwa aina mbichi za sauti kwa njia moja ya kusonga mbele kwa haraka.
Muhtasari
It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.
Dive ya kina
MelGAN, ilianzishwa na Kumar et al. mnamo 2019, hutoa sauti bila kitanzi cha polepole cha sampuli inayotumiwa na WaveNet. Jenereta yake ni rundo la mipasuko inayopitika ambayo huchukua sampuli ya mel-spectrogram (kawaida bendi 80 za masafa) hadi kiwango cha sampuli ya sauti, na vizuizi vilivyosalia vinavyotumia mipasuko iliyopanuliwa ili kupanua uga wa kupokea. Ubunifu muhimu ulikuwa mafunzo na wabaguzi wengi wanaofanya kazi katika mizani tofauti ya sauti (mwonekano wa asili wa mawimbi pamoja na matoleo yaliyopunguzwa), kila moja ikiangalia madirisha yanayopishana. Hasara ya kulinganisha vipengele inalinganisha uwezeshaji wa kibaguzi kati ya sauti halisi na bandia, kuleta utulivu wa mafunzo ya GAN. Muundo huu ni mdogo kwa viwango vya sauti-neural na unatumia kasi zaidi kuliko wakati halisi hata kwenye CPU, na kuifanya iwe ya vitendo kwa maandishi yaliyopachikwa na ya kifaa-kwa-hotuba.
Ufahamu wa Kiufundi
Kibaguzi cha viwango vingi cha MelGAN hutumia mitandao mitatu inayofanana kuangalia sauti katika ubora kamili, nusu na robo, kila muundo unanasa katika masafa tofauti ya masafa. Muhimu, MelGAN inategemea hasara ya kulinganisha vipengele (umbali wa L1 kati ya ramani za kipengele cha kibaguzi cha sauti halisi dhidi ya sauti inayozalishwa) badala ya upotevu dhahiri wa uundaji upya wa spectrogram, ambayo huhimiza jenereta kulinganisha takwimu halisi za sauti kwa safu.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Vokoda ya Kuzalisha ya MelGAN
MelGAN alizaa familia ya vokoda za GAN. Wafuasi wake, HiFi-GAN na UnivNet, waliweka mbinu ya haraka isiyo ya moja kwa moja lakini waliongeza vibaguaji vya vipindi vingi na vyenye maazimio mengi kwa masafa safi zaidi. Usanifu huishi katika TTS ya kifaa na utiririshaji ambapo muda wa kusubiri na saizi ya modeli ni muhimu, na mawazo yake ya kibaguzi yanaendelea kuathiri kodeki za neva na mifumo ya kuunda muziki ambapo mafunzo ya wapinzani huboresha ubora wa utambuzi.
Utekelezaji wa Ulimwengu Halisi
Maandishi ya kwenye kifaa -kwa-hotuba katika visaidizi vya rununu ambapo sauti ndogo ya kasi huepuka safari za kwenda na kurudi kutoka kwa wingu
Njia za kubadilisha sauti katika wakati halisi ambazo hubadilisha mel-spectrogram ya spika kuwa sauti inayolengwa
Zana za mchezo na uhuishaji ambazo huunganisha mazungumzo ya wahusika kutoka kwa spectrogramu zinazozalishwa zenye utulivu wa chini
Misingi ya utafiti wa GAN za sauti, ambapo upotezaji wa ulinganishaji wa vipengele vya MelGAN hutumiwa tena kwa muziki na uzalishaji wa athari za sauti.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the MelGAN Generative Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Vokoda ya Usambazaji wa DiffWave
Maswali yanayoulizwa mara kwa mara
What is MelGAN Generative Vocoder?
MelGAN ni vokoda yenye msingi wa GAN inayobadilika kikamilifu ambayo hubadilisha spectrogramu za hali ya juu kuwa aina mbichi za sauti kwa njia moja ya kusonga mbele kwa haraka. Ilikuwa muhimu kwa sababu ilithibitisha usanisi wa usemi wa hali ya juu, usio wa moja kwa moja unaweza kufanya kazi kwa mamia ya mara kuliko wakati halisi kwenye GPU.
Je, MelGAN hubadilisha maoni gani kuwa muundo mbichi wa sauti?
MelGAN ni vokoda: inachukua uwakilishi wa kipengele cha akustisk, mel-spectrogram, na kuunganisha umbo linalolingana la mawimbi.
Kwa nini MelGAN ni haraka sana kuliko WaveNet kwa uelekezaji?
WaveNet inazalisha sampuli moja kwa wakati autoregressively; Jenereta ya ubadilishaji ya MelGAN hutoa umbo zima la wimbi kwa njia moja ya mbele inayolingana.
MelGAN alianzisha muundo gani tofauti wa kibaguzi?
MelGAN hutumia vibaguzi vingi vinavyofanana ambavyo huchunguza muundo asilia wa mawimbi na matoleo yaliyopunguzwa sampuli ili kunasa muundo katika mizani tofauti.
Ni hasara gani husaidia kuleta utulivu katika mafunzo ya wapinzani ya MelGAN?
Hasara ya kulinganisha vipengele hupunguza umbali wa L1 kati ya ramani za vipengele vya kibaguzi kwa sauti halisi na inayozalishwa, kuongoza jenereta na mafunzo ya kuleta utulivu.
Jenereta ya MelGAN huongeza vipi uwanja wake wa kupokea?
Vitalu vilivyosalia vilivyo na mipasuko iliyopanuliwa huongeza uga wa kupokea kwa ufanisi, na kuruhusu muundo wa muda wa jenereta wa masafa marefu.