Usemi wa Asili na Usambazaji Uliofichwa TTS
NaturalSpeech ni safu ya Microsoft utafiti wa TTS unaolenga ubora wa matamshi ya kiwango cha binadamu, na matoleo ya baadaye yakitumia uenezaji uliofichika kutoa sauti tajiri na za asili.
Muhtasari
It shows how diffusion models, famous for images, can produce expressive, controllable audio.
Dive ya kina
NaturalSpeech asili (2022) ulikuwa mfumo wa kwanza kuripotiwa kufikia ubora wa kiwango cha binadamu kwenye benchmark ya LJSpeech, ikizingatiwa na wasikilizaji ambao hawakuweza kuieleza kwa uhakika kutoka kwa rekodi halisi. Ilitumia kisimbaji kiotomatiki cha mabadiliko chenye viasili vilivyolingana kwa uangalifu ili kuziba pengo kati ya mafunzo na makisio. NaturalSpeech 2 kisha ikakubali mbinu ya uenezaji fiche: usemi husimbwa na kodeki ya sauti ya neural katika vivekta fiche, na muundo wa uenezaji hujifunza kutoa lango hizo kutoka kwa maandishi, kuwezesha uunganishaji wa sauti usio na sifuri kutoka kwa haraka fupi. NaturalSpeech 3 ilianzisha uenezaji wa hali ya juu, ikitenganisha usemi katika sifa zilizotengana kama vile maudhui, prosodi, timbre na maelezo ya akustisk, ili kila moja iweze kutengenezwa na kudhibitiwa kivyake kwa uaminifu na unyumbufu wa hali ya juu.
Ufahamu wa Kiufundi
Usambazaji fiche hufanya kazi kwa kuongeza kelele kwa uwakilishi fiche wa usemi na kufundisha mtandao kubadilisha kelele hiyo hatua kwa hatua. Badala ya kutoa sauti kwa maumbo ghafi ya mawimbi au spectrogramu kamili, NaturalSpeech 2 hutoa deno lajenti za kodeki, ambazo zina sura ya chini na ni rahisi kuiga. Hali ya maandishi na kidokezo cha sauti ya marejeleo huelekeza uenezaji wa kinyume, kwa hivyo laini za mwisho zilizotolewa zisimbue kuwa usemi unaolingana na maudhui yaliyoombwa na utambulisho wa spika.
Athari za kimkakati
Kufikia na kufikia
Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.
Cost and budget
Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.
Kasi na kiwango
Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.
Mustakabali wa Usemi wa Asili na Usambazaji Uliofichwa TTS
TTS inayotegemea mgawanyiko na iliyogeuzwa huelekeza kwenye sauti ambazo si za asili tu bali zinazoweza kudhibitiwa vizuri, hivyo kuwaruhusu watumiaji kurekebisha sauti, mihemko na sauti kama miito inayojitegemea. Tarajia sampuli za haraka zaidi kupitia kunereka na uenezaji wa hatua chache, uundaji thabiti zaidi wa risasi sifuri kutoka sekunde za sauti, na muunganisho mkali zaidi na miundo mikubwa ya lugha kwa uwasilishaji unaozingatia muktadha. Maendeleo haya pia yanazidisha hitaji la kuweka alama na ulinzi wa idhini, kwa kuwa uundaji wa uaminifu wa hali ya juu huongeza hatari za matumizi mabaya.
Utekelezaji wa Ulimwengu Halisi
Studio za kuiga huiga sauti ya mwigizaji kutoka sampuli fupi hadi kubinafsisha filamu, kwa kutumia uundaji wa muundo wa NaturalSpeech wa mtindo wa 2 wa zero-shot.
Mifumo ya vitabu vya kusikiliza hutoa masimulizi ya kiwango cha binadamu ambayo wasikilizaji wanatatizika kutofautisha na vipaji halisi vya sauti.
Zana za ufikivu huunda upya sauti ya mtu kutoka kwa rekodi za zamani kwa wale ambao wamepoteza matamshi yao.
Vyuo vya uundaji wa maudhui huwaruhusu wahariri kurekebisha kwa hiari sauti na prosody, kwa kutumia vipengele vilivyobainishwa vya NaturalSpeech 3.
Hatari & Walinzi
Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.
Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.
Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.
Ramani ya Utekelezaji
Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.
Jaribu ubora kwenye spika na hali mbalimbali za usuli.
Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.
Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.
Endelea Kuchunguza
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NaturalSpeech and Latent Diffusion TTS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Mwongozo unaofuata
Usambazaji Uliofichwa wa Sauti
Maswali yanayoulizwa mara kwa mara
What is NaturalSpeech and Latent Diffusion TTS?
NaturalSpeech ni safu ya Microsoft utafiti wa TTS unaolenga ubora wa matamshi ya kiwango cha binadamu, na matoleo ya baadaye yakitumia uenezaji uliofichika kutoa sauti tajiri na za asili. Inaonyesha jinsi miundo ya uenezaji, maarufu kwa picha, inaweza kutoa sauti ya kujieleza, inayoweza kudhibitiwa.
Je, NaturalSpeech asili (2022) iliripotiwa kufikia hatua gani muhimu?
NaturalSpeech iliripotiwa kuwa mfumo wa kwanza kufikia ubora wa kiwango cha binadamu kwenye LJSpeech, huku wasikilizaji wakishindwa kuutofautisha na usemi halisi.
Mtindo wa uenezaji wa latent wa NaturalSpeech 2 hutoa nini?
NaturalSpeech 2 huenea juu ya laini za kodeki, ambazo ni fumbatio na rahisi kuiga kuliko maumbo ghafi ya mawimbi, kisha huzitenganisha ziwe sauti.
Mfano wa uenezaji hutoaje data kwa kiwango cha juu?
Usambazaji huongeza kelele wakati wa mafunzo na hujifunza kuigeuza, kutoa sampuli kwa kutoa sauti kutoka kwa kelele nasibu.
Ni uwezo gani muhimu ambao uenezaji uliofichika huwapa NaturalSpeech 2?
Kwa kuweka kidokezo cha sauti fupi, NaturalSpeech 2 inaweza kuunda sauti ya mzungumzaji ambayo haijawahi kufunzwa kwa uwazi.
Je, ni wazo gani kuu la NaturalSpeech 3's 'usambazaji wa sababu'?
Usambazaji wa hali ya juu hutenganisha maudhui, prosodi, timbre, na maelezo ya akustisk ili kila sifa iweze kuigwa na kudhibitiwa kando.