Vokoder neuronal
Vocoder neuronal xeetu model la buy soppi misaal akustik bu dëgër, lu ci gëna bari mel-spectrogram, mu nekk jëmmu onde buñ mëna dégg.
Résumé
It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.
Plongeur bu xóot
Synthese kàddu yu yàgg yi dañu daan jëfandikoo vocoder yuy liggéey siñaal yuy faral di sone buzzy wala robot. Vocoder neuronal yi dañu jàng defaraat ay misaali audio yu ñor ci spectrogram ci di tàggat ay waxtu enregistrement dëgg. WaveNet (DeepMind, 2016) mooy jéego bu am solo bi, di wax luy waaja am ci audio benn misaal ci saa si ci 16,000+ misaal ci segond bu nekk, di defar kàddu yu yéeme waaye ndànk lool. Modèle yu ci topp yi dañu jël gaawaay gi: WaveGlow dafa jëfandikoo defar bu sukkandiko ci debit, Parallel WaveGAN ak MelGAN jëfandikoo nañu reso yuy xeex, ba noppi HiFi-GAN nekkoon standard bu siiw ci defar audio 22kHz bu gëna gaaw ci jamono dëgg. Tay, vocoder bi daanaka ñaareelu xaaj la ci gasoduc bi am ñaari etap, boole ci model akustik bu melni Tacotron 2 wala FastSpeech biy defar spectrogram mel bi.
Gis-gis xarala
Mel-spectrogram dafay sànni leerali fasu audio bi, du bàyyi lenn ludul ni energie bi di séddalee ci bande fréquence yi ci diir bi. Liggéey bu metti bi vocoder wara def mooy sos forme onde bu leer te méngoo, spectre magnitude bi méngoo ak liñu dugal. Vocoder yu GAN yu melni HiFi-GAN dañuy jëfandikoo diskriminatër yu bari yuy saytu siñaal bi ci ay eskaal ak ay jamono yu wuute, di puus generatër bi ngir génne ay detay yu rafet yu melni armonic ak transient yu ñaw yu alfabe yi.
njeextalu pexe
Dugg ak yegg
Dafay gëna yombal jëfandikoo gi jaaraleko ci transkripsioŋ, nettali ak interfaasu baat.
Njëgg ak budget
Ekipu mejaa yi mën nañu yónnee audio bu leer ci anam wu gëna gaaw te seen xaalis gëna néew.
Gaawaay ak yaatuwaay
Sistem yiy jàkkarloo ak kiliyaan bi mën nañu def waxtaan ci anam wu gëna yaatu.
Ëlëgu Vokoder Neural
Vocoder yi dañu gëna ndaw, gëna gaaw, suko defee ñu mëna dox ci telefon yi ak aparey yiñ samp te duñu am benn lëkkaloo ci cloud. Amna itam ñuy push ci vocoders universel yuy generalise ci bépp waxkat, làkk, way, wala sax son bu dul wax te kenn duko tàggat. Tendens bu paralel dafay boole vocoder bi ci sistem end-to-end ak codec neuronal, di dindi liiñ bi am ci digganté etape akustik ak forme onde yu wuute, ba noppi wàññi artfact yi ñuy dugal ci jaar ci spectrogram bu digg bi.
Doxal ci àdduna dëgg
Defar audio bu mujj biñ wax ci assistant bind-ci-wax yu melni jàngat ekraŋ yi ak aplikaasioŋu navigasioŋ
Defar ay baat yuñ klone yuy sone ci jumtukaayi dubbing ak audiobook
Tabaxaat kàddu yiy way ci music IA ak losisel wirtuel-vocalist
Taxawal baat biy génn ci aparey bi ngir kàddu yu xarañ yi ak aparey yi yomb jëfandikoo te du am serwër buy dem ak dikk
Risk yi ak balustrade yi
Jëfandikoo baat ci anam wu jaarul yoon ak niru ak nit dafay gëna yokk sudee nanguwul.
Jaar-jaar mën na wàññeeku ci aksan yi, dialect yi wala barab yu bari xumbaay.
Audio synthetik mën nañu ko jaawale ak wax ju dëggu sudee amul etiket bu leer.
Roadmap ngir samp gi
Wutal ndigal bu leer ngir jàpp baat bi, klone ko ak jëfandikoowaat ko.
Saytu kalite ci kàddukat yu bari ak anam yu bari ci ginaaw.
Mandargal kañ la nit wara xoolaat wala nangu ay génne.
Etiketu audio synthetik te nga denc dokimaa ci fimu bawoo ngir mëna lim.
Weyal di banneexu
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Neural Vocoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Gis bi ci topp
HiFi-GAN ak GAN
Laaj yi ñuy faral di laaj
What is Neural Vocoders?
Vocoder neuronal xeetu model la buy soppi misaal akustik bu dëgër, lu ci gëna bari mel-spectrogram, mu nekk jëmmu onde buñ mëna dégg. Mooy etape bu mujj biy jox text-to-speech ak cloning baat bu bees bi seen son naturel, nit.
Lan mooy liggéey bi njëkk ci vocoder neuronal?
Vocoder neuronal dafay jël màndarga akustik bu dëgër, lu ci gëna bari mel-spectrogram, ba noppi defar forme onde audio bu ñor bi ngay dégg.
Ban xeetu 2016 moo nekkoon jéego bu am solo bi tax vocoder neural yi di sone ci anam wu natureel?
WaveNet, bu bawoo ci DeepMind ci 2016, defar na audio misaal-ci-misaal ba noppi defar kàddu yu yéeme, daal di tàmbali jamonoy vocoder neural.
Lu tax WaveNet bi njëkk yeex defar audio?
WaveNet autoregressive la: sample audio bu nekk mingi aju ci yi ko jiitu, kon defar ay fukki junni sample ci seconde lu seer la woon ci wàllu ordinatër.
Ban leeral la mel-spectrogram bi di sànni, loolu mooy gëna yombal liggéeyu vocoder bi?
Mel-spectrogram yi dañuy tëye magnitude (energie ci bande fréquence bu nekk) waaye dañuy wàññi fase, kon vocoder bi dafa wara defaraat forme onde bu lëkkaloo te fase bi mën nañu ko gëm.
naka la vocoder yu lalu ci GAN yu melni HiFi-GAN di gëna baaxal realisme bi?
HiFi-GAN dafay jëfandikoo ay diskriminatër yu bari yuy saytu ay eskaalu waxtu ak ay jamono yu wuute, di puus generatër bi ngir génne ay harmonik ak ay transient yu dëggu.