Architecture de parole
DeepSpeech xeetu xàmmee kàddu la bu Baidu dugal ci 2014, muy màndargaal man-mani audio yu ñor yi ci mbind mi, di jëfandikoo reso neuronal buy baaxoo tàggat ak ñàkkum CTC.
Résumé
It helped pioneer the shift away from complex, hand-engineered ASR pipelines toward learned, data-driven systems.
Plongeur bu xóot
Xammekaayu kàddu yu yàgg yi dañu boole ay xeeti akustik yu wuute, diksoneer waxin, ak xeeti làkk yu am cër yuñ defaree loxo. DeepSpeech dafa wecci li ëpp ci loolu ak benn reso neuronal buñ tàggat ba ci njeexte li. Architecture bi dafay jël spectrogram wala MFCC ci kaw kadre audio yu gàtt ba noppi di leen dundal ci ay couche yu bari yuñ boole, couche buy baamtu ci ñaari yoon yuy jàpp contexte ci jamono yu weesu ak ëlëg, ak couche buy génne distribution probabilité ci kaw araf yi ci jéego bu nekk. Li gëna am solo mooy, dafay jëfandikoo Classification Temporal Connectionist (CTC), muy may reso bi mu jàng liggéey bi am ci diggante audio ak mbind te soxlawul etiketu kadre. Ginaaw loolu Mozilla genne ab jëfandikoo open-source bu siiw (ak yeneen yu bees yuy jëfandikoo jëmmal bu lalu ci LSTM, jëmmal ci streaming), muy tax jëfandikoo gi gëna yomba jëfandikoo.
Gis-gis xarala
Caabi enabler mooy CTC ñàkk. Kaddu ak bind mënul méngoo kaadar-ci-kadre, moo tax CTC dafay dugal màndarga 'amul dara' ba noppi boole lépp lu mëna méngoo ci transkripsioŋ biñ bëgga. Loolu dafay may model bi mu génne benn araf ci jéego bu nekk, ba noppi jàng ci saasi fi son yi di méngoo ak araf yi. RNN bu am ñaari yoon dafay may bépp wax luy waaja am xëcc ci contexte akustik bi ko wër, ba noppi ñuy faral di yokk xeetu làkk n-gram bu biti ci waxtu dekode ngir gëna baaxal ortograafi ak tànneefi baat yi.
njeextalu pexe
Dugg ak yegg
Dafay gëna yombal jëfandikoo gi jaaraleko ci transkripsioŋ, nettali ak interfaasu baat.
Njëgg ak budget
Ekipu mejaa yi mën nañu yónnee audio bu leer ci anam wu gëna gaaw te seen xaalis gëna néew.
Gaawaay ak yaatuwaay
Sistem yiy jàkkarloo ak kiliyaan bi mën nañu def waxtaan ci anam wu gëna yaatu.
Ëlëgu architecture DeepSpeech
DeepSpeech ci boppam ñu ngi ko wecci bu baax ci arsitektir yu lalu ci bàyyi xel ak soppi (Conformer, Whisper, wav2vec 2.0) yuy jàpp muy lu gëna gudd te di saytu seen bopp ci audio bu amul etiket. Waaye xalaatam yu am solo yi, tàggat ci njeexte ak dekodaas CTC, ñu ngi des ci fundamental te ba leegi ñu ngi feeñ ci biir sistem hybrid yu bees yi. Legacy bi ci konseptioŋ la: dafa firndeel ni benn model buñ jàng mën na xëcc ay pipeline yuñ defar bu baax, loolu moo ubbi buntu model yu yaatu yu tay yi, lakk yu bari, yu ñuy saytu seen bopp.
Doxal ci àdduna dëgg
Offline, ci aparey biy xàmmee ndigalu baat ngir aplikaasioŋ yiñ jagleel kumpa, di jëfandikoo DeepSpeech bu Mozilla
Defar ay projet de transcription ci ay podcast wala ay diskur te doo yéem ci ab serwiisu cloud
Jàngale li gëna am solo ci ASR ak CTC ci njàngum masin ci daara yu kawe yi
Tabax interfaasu baat buñ personaalise bu IoT wala aparey yuñ samp fu ñu soxla xàmmeekaay bu woyof te mëna streaming
Risk yi ak balustrade yi
Jëfandikoo baat ci anam wu jaarul yoon ak niru ak nit dafay gëna yokk sudee nanguwul.
Jaar-jaar mën na wàññeeku ci aksan yi, dialect yi wala barab yu bari xumbaay.
Audio synthetik mën nañu ko jaawale ak wax ju dëggu sudee amul etiket bu leer.
Roadmap ngir samp gi
Wutal ndigal bu leer ngir jàpp baat bi, klone ko ak jëfandikoowaat ko.
Saytu kalite ci kàddukat yu bari ak anam yu bari ci ginaaw.
Mandargal kañ la nit wara xoolaat wala nangu ay génne.
Etiketu audio synthetik te nga denc dokimaa ci fimu bawoo ngir mëna lim.
Weyal di banneexu
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DeepSpeech Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Gis bi ci topp
Architecture konformer
Laaj yi ñuy faral di laaj
What is DeepSpeech Architecture?
DeepSpeech xeetu xàmmee kàddu la bu Baidu dugal ci 2014, muy màndargaal man-mani audio yu ñor yi ci mbind mi, di jëfandikoo reso neuronal buy baaxoo tàggat ak ñàkkum CTC. Jàppale na ñu njëkka joge ci pipeline ASR yu jafee defar, ñu dem ci sistem yuñ jàng te lalu ci done.
Ban fonction perte mooy may DeepSpeech mu tàggat te du am niveau de cadre ci digganté audio ak text?
CTC dafay dugal ab màndarga bu amul dara ba noppi boole ci kaw bépp yoon bu baax buy wàcci ci bind biñ bëgga, dindi soxla etiketu kaadar bu nekk.
Lan mooy filosofi architecture bi DeepSpeech siiwal?
DeepSpeech moo wecci pipeline bi fi yàgg a nekk, mu am benn reso neuronal buñ tàggat, muy coppite bu am solo ci jëmmal ASR.
Lu tax DeepSpeech di jëfandikoo ab layer buy dellusi ci ñaari yoon?
RNN bidirectional dafay doxal toppalante bi ci ñaari yoon yi, kon génne bu nekk dafay am njariñ ci contexte akustik bi ko wër, gëna dëgëral njub.
Ban xeetu man-mani dugal la DeepSpeech di faral di doxalee?
Modèle bi dafay jëfandikoo man-mani audio yu tollu ci niveau cadre lu ci melni spectrogram wala MFCC ba noppi di génne ay probabilite ci jéego bu nekk.
Lan lañuy faral di yokk ci waxtu dekode ngir gëna baaxal tànneefi baat yi ak ortograafi DeepSpeech?
Soo boolee génnug akustik bi ak xeetu làkk wi ci biti ci diiru dekodaas bi, dafay jàppale sistem bi mu defar kàddu yu gëna neexa dégg ak ortograafi.