MWONGOZO WA AI wa Sauti

Vokoda za Neural

Vokoda ya neural ni kielelezo ambacho hugeuza uwakilisho wa akustisk kompati, kwa kawaida ni spekkitirogramu ya mel, kuwa muundo halisi wa mawimbi inayoweza kusikika.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.

Dive ya kina

Usanisi wa matamshi ya kitamaduni ulitumia vokoda za kuchakata mawimbi ambazo mara nyingi zilisikika kuwa za kusisimua au za roboti. Vokoda za neural hujifunza kuunda upya sampuli mbichi za sauti kutoka kwa spectrogramu kwa mafunzo ya saa za rekodi halisi. WaveNet (DeepMind, 2016) ilikuwa mafanikio, ikitabiri sampuli moja ya sauti kwa wakati mmoja katika sampuli 16,000+ kwa sekunde, ikitoa usemi wa asili wa kushangaza lakini polepole sana. Miundo ya baadaye iliuza uzuiaji huo wa kasi kwa kasi: WaveGlow ilitumia kizazi kinachotegemea mtiririko, Parallel WaveGAN na MelGAN zilitumia mitandao mzalishaji ya wapinzani, na HiFi-GAN ikawa kiwango maarufu kwa kutoa sauti ya 22kHz ya uaminifu wa juu kwa kasi zaidi kuliko wakati halisi. Leo, vokoda karibu kila mara ni nusu ya pili ya bomba la hatua mbili, linalooanishwa na muundo wa akustisk kama Tacotron 2 au FastSpeech ambao hutoa spectrogram.

Ufahamu wa Kiufundi

Mel-spectrogram hutupa taarifa ya awamu ya sauti, ikiweka tu jinsi nishati inavyosambazwa kwenye bendi za masafa kwa muda. Kazi ngumu ya mpiga sauti ni kuvumbua muundo wa mawimbi unaokubalika, unaoshikamana ambao ukubwa wake unalingana na ingizo hilo. Vokoda zenye msingi wa GAN kama vile HiFi-GAN hutumia vibaguzi vingi ambavyo hukagua mawimbi katika mizani na vipindi tofauti, na kusukuma jenereta kutoa maelezo halisi kama vile uelewano na mipitisho mikali ya konsonanti.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa Vokoda za Neural

Vokoda zinapungua na kasi zaidi ili ziweze kufanya kazi kwenye simu na vifaa vilivyopachikwa bila muunganisho wa wingu. Pia kuna msukumo kuelekea vokoda za ulimwengu wote ambazo hujumlisha kwa mzungumzaji, lugha, uimbaji au hata sauti isiyo ya hotuba bila kujizoeza tena. Mwelekeo sambamba hukunja vokoda moja kwa moja kwenye mifumo ya mwanzo-mwisho na kodeki za neva, na kutia ukungu kwenye mstari kati ya hatua tofauti za akustika na uundaji wa mawimbi na kupunguza vizalia vya programu vinavyoletwa kwa kupitia spectrogramu ya kati.

Utekelezaji wa Ulimwengu Halisi

Inazalisha sauti ya mwisho inayozungumzwa katika visaidizi vya kubadilisha maandishi hadi usemi kama vile visoma skrini na programu za usogezaji

Kuzalisha sauti za asili zilizoigwa katika upakuaji na zana za usimulizi wa vitabu vya sauti

Kuunda upya sauti za kuimba katika muziki wa AI na programu ya sauti-pepe

Kuwasha utoaji wa sauti kwenye kifaa kwa spika mahiri na vifaa vya ufikivu bila seva ya kwenda na kurudi

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Vokoda za HiFi-GAN na GAN

Maswali yanayoulizwa mara kwa mara

What is Neural Vocoders?

Vokoda ya neural ni kielelezo ambacho hugeuza uwakilisho wa akustisk kompati, kwa kawaida ni spekkitirogramu ya mel, kuwa muundo halisi wa mawimbi inayoweza kusikika. Ni hatua ya mwisho ambayo inatoa maandishi ya kisasa-kwa-hotuba na sauti cloning yao ya asili, sauti ya binadamu.

Je, kazi ya msingi ya vokoda ya neural ni ipi?

Vokoda ya neural inachukua kipengele cha akustisk chanya, kwa kawaida ni mel-spectrogramu, na kuunganisha mwonekano halisi wa mawimbi ya sauti unayosikia.

Ni muundo gani wa 2016 ambao ulifanya vokoda za neural zisikike za asili?

WaveNet, kutoka DeepMind mnamo 2016, ilitoa sampuli za sauti kwa sampuli na kutoa hotuba ya asili ya kushangaza, iliyoanzisha enzi ya sauti ya neural.

Kwa nini WaveNet asili ilikuwa polepole kutoa sauti?

WaveNet haibadiliki kiotomatiki: kila sampuli ya sauti inategemea zile za awali, kwa hivyo kutoa makumi ya maelfu ya sampuli kwa sekunde ilikuwa ghali kimahesabu.

Ni taarifa gani ambayo mel-spectrogram hutupilia mbali, na kufanya kazi ya vokoda kuwa ngumu zaidi?

Mel-spectrogram huweka ukubwa (nishati kwa kila bendi ya mzunguko) lakini awamu ya kushuka, kwa hivyo vokoda lazima iunde upya muundo thabiti wa mawimbi ambao awamu yake inakubalika.

Vokoda za GAN kama HiFi-GAN huboreshaje uhalisia?

HiFi-GAN hutumia vibaguzi kadhaa kukagua mizani tofauti ya saa na vipindi, kusukuma jenereta kutoa uelewano wa kweli na wa muda mfupi.