VITS Muundo wa Usemi wa Mwisho-hadi-Mwisho
VITS ni muundo wa maandishi hadi usemi ambao hubadilisha maandishi moja kwa moja kuwa mawimbi ghafi ya sauti katika mfumo mmoja uliofunzwa, na kuruka bomba la kawaida la hatua mbili.
Muhtasari
By combining variational inference with adversarial training, it produces remarkably natural, expressive speech.
Dive ya kina
VITS (Maelekezo ya Kibadala na mafunzo ya pinzani kwa Maandishi-hadi-Hotuba ya mwisho-mwisho), iliyoanzishwa na Kim, Kong, na Son mnamo 2021, inachanganya mawazo matatu ambayo mifumo ya zamani ilitenganisha. Kisimbaji kiotomatiki cha masharti cha masharti (VAE) hujifunza uwakilishi fiche wa usemi, mitiririko ya kuhalalisha hufanya usambazaji uliofichika kunyumbulika vya kutosha ili kunasa maelezo mafupi ya akustika, na kibaguzi cha mtindo wa GAN husukuma muundo wa wimbi uliozalishwa kuelekea uhalisia. Muhimu zaidi, VITS hufunza muundo wa akustika na vokoda pamoja badala ya kuwa hatua mbili, na kuondoa kutolingana ambako kunashusha ubora wakati moduli zinafunzwa kando. Pia hutambulisha kitabiri cha muda wa stokastiki, kwa hivyo sentensi sawa inaweza kusemwa kwa midundo tofauti, ya sauti asilia kila wakati.
Ufahamu wa Kiufundi
VITS hutatua tatizo la upatanishi na Utafutaji wa Mipangilio ya Monotonic (MAS), ambayo hupata upangaji bora kati ya tokeni za maandishi na fremu za sauti wakati wa mafunzo bila vipanganishi vya nje. Sehemu ya nyuma ya VAE inakokotolewa kutoka kwa sauti halisi, ilhali hali ya awali kwenye maandishi inarekebishwa kwa kurekebisha mtiririko ili kuendana nayo. Kwa makisio, unachukua sampuli kutoka kwa maandishi hapo awali na kusimbua moja kwa moja hadi muundo wa wimbi, kwa hivyo hakuna spektiromu tofauti na hakuna vokoda tofauti inayohitajika.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Muhtasari wa Usemi wa VITS wa Mwisho-hadi-Mwisho
VITS ilizaa familia ya warithi ambao hutawala chanzo huria cha TTS. VITS2 imerahisisha usanifu na kuboreshwa kwa uasilia, huku YourTTS na Coqui XTTS inayotumika sana ilipanua mbinu ya uundaji wa sauti sifuri na lugha nyingi. Tarajia kazi inayoendelea kwenye vibadala vyepesi, vya muda halisi vya kifaa, utumiaji bora wa lugha nyingi kwa lugha zisizo na nyenzo nyingi, na udhibiti mkali zaidi wa hisia na mtindo wa kuzungumza, kwa kuwa muundo wa mwanzo-mwisho ni msingi unaovutia na unaoeleweka wa kujenga juu yake.
Utekelezaji wa Ulimwengu Halisi
Coqui TTS husafirisha miundo kulingana na VITS ambayo wasanidi programu husanikisha ili kuunda sauti mahususi ya msimulizi kwa vitabu vya kusikiliza.
Visaidizi vya sauti vya programu huria kwenye maunzi ya Raspberry Pi-class hutumia miundo fupi ya VITS kutoa sauti kamili nje ya mtandao.
Programu za kujifunza lugha huzalisha mifano ya matamshi ya asili kwa kutumia vibadala vya VITS vya lugha nyingi kama vile YourTTS.
Studio za michezo ya Indie huunganisha mistari mbalimbali ya mazungumzo ya NPC, ikitegemea kitabiri cha muda wa stochastiki kwa mdundo usio wa roboti.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VITS End-to-End Speech Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Usanifu wa Hotuba ya Kihisia
Maswali yanayoulizwa mara kwa mara
What is VITS End-to-End Speech Synthesis?
VITS ni muundo wa maandishi hadi usemi ambao hubadilisha maandishi moja kwa moja kuwa mawimbi ghafi ya sauti katika mfumo mmoja uliofunzwa, na kuruka bomba la kawaida la hatua mbili. Kwa kuchanganya makisio tofauti na mafunzo ya wapinzani, hutoa usemi wa asili na wa kujieleza.
Je, kifupi cha VITS kinamaanisha nini?
VITS inasimamia Maelekezo Tofauti na kujifunza kwa chuki kwa Maandishi-hadi-mwisho, inayoakisi viambato vyake vitatu vya msingi.
Ni tofauti gani kuu ya usanifu kati ya VITS na mabomba ya jadi ya TTS?
VITS ni ya mwisho hadi mwisho: inajifunza umbo la maandishi-hadi-mawimbi katika modeli moja, ili kuepuka kutolingana kwa muundo tofauti wa akustika na vokoda.
Je, VITS hujifunza vipi upatanishi kati ya fremu za maandishi na sauti?
VITS hutumia Utafutaji wa Mpangilio wa Monotonic ili kugundua upatanishi bora wa maandishi kwa fremu ndani, bila mpangilio wa nje unaohitajika.
Kwa nini VITS inajumuisha kitabiri cha muda wa stochastic?
Kibashiri cha muda wa stochastiki huruhusu sentensi sawa kusemwa kwa midundo tofauti ya asili, kuepuka mwako bapa, wa roboti.
Ni sehemu gani inayosukuma pato la VITS kuelekea sauti inayosikika kihalisi?
VITS hutumia mafunzo ya adversarial (GAN), ambapo mbaguzi hutathmini kama mawimbi yanasikika halisi, kuboresha ubora wa utambuzi.