MWONGOZO WA AI wa Sauti

Usanifu wa DeepSpeech

DeepSpeech ni kielelezo cha utambuzi wa usemi wa mwisho hadi mwisho ulioanzishwa na Baidu mnamo 2014 ambao hupanga vipengele vya sauti mbichi moja kwa moja kwenye maandishi kwa kutumia mtandao wa kawaida wa neva uliofunzwa na hasara ya CTC.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It helped pioneer the shift away from complex, hand-engineered ASR pipelines toward learned, data-driven systems.

Dive ya kina

Vitambua matamshi vya kawaida viliunganishwa pamoja miundo tofauti ya akustika, kamusi za matamshi na miundo ya lugha iliyo na vipengee vilivyopangwa kwa mkono. DeepSpeech ilibadilisha sehemu kubwa ya hiyo na mtandao mmoja wa neva uliofunzwa mwisho hadi mwisho. Usanifu wake huchukua vipengele vya spectrogram au MFCC juu ya fremu fupi za sauti na kuzilisha kupitia safu kadhaa zilizounganishwa kikamilifu, safu inayorudiwa ya pande mbili ambayo inanasa muktadha kutoka zamani na siku zijazo, na safu ya matokeo inayozalisha uwezekano wa usambazaji juu ya wahusika katika kila hatua ya wakati. Muhimu sana, hutumia Uainishaji wa Muda wa Muunganisho (CTC), ambao huruhusu mtandao kujifunza upatanishi kati ya sauti na maandishi bila kuhitaji lebo za kiwango cha fremu. Mozilla baadaye ilitoa utekelezaji maarufu wa chanzo-wazi (pamoja na matoleo mapya zaidi kwa kutumia muundo unaotegemea LSTM, unaoweza kutiririka), na kufanya mbinu hiyo kufikiwa kwa wingi.

Ufahamu wa Kiufundi

Kiwezeshaji kikuu ni upotezaji wa CTC. Matamshi na maandishi hayajapangiliwa kwa fremu kwa fremu, kwa hivyo CTC inatanguliza ishara 'tupu' na kujumlisha upangaji wote unaowezekana ambao unakunjika hadi manukuu lengwa. Hii huruhusu modeli kutoa herufi kwa hatua ya wakati na kujifunza mahali ambapo sauti hupanga herufi kiotomatiki. RNN ya maelekezo mawili hupa kila ubashiri ufikiaji wa muktadha wa akustika unaozunguka, na muundo wa nje wa lugha ya n-gram mara nyingi huongezwa kwa wakati wa kusimbua ili kuboresha tahajia na chaguo la maneno.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa Usanifu wa DeepSpeech

DeepSpeech yenyewe imebadilishwa kwa kiasi kikubwa na usanifu wa umakini na kibadilishaji (Conformer, Whisper, wav2vec 2.0) ambao unanasa muktadha mrefu na kujisimamia kwa sauti isiyo na lebo. Lakini mawazo yake ya msingi, mafunzo ya mwisho hadi mwisho na usimbaji wa CTC, yanasalia kuwa ya msingi na bado yanaonekana ndani ya mifumo ya kisasa ya mseto. Urithi huo ni wa kimawazo: ulithibitisha kuwa modeli moja iliyofunzwa inaweza kushindana na mabomba yaliyosanifiwa sana, na hivyo kufungua njia kwa miundo ya leo mikubwa, ya lugha nyingi na inayojidhibiti ya msingi ya usemi.

Utekelezaji wa Ulimwengu Halisi

Nje ya mtandao, utambuzi wa amri ya sauti kwenye kifaa kwa programu zinazolenga faragha kwa kutumia DeepSpeech iliyo wazi ya Mozilla.

Inazalisha nakala za rasimu za podikasti au mihadhara bila kutegemea huduma ya wingu

Kufundisha misingi ya upotezaji wa mwisho hadi mwisho wa ASR na CTC katika kozi za kujifunza mashine za chuo kikuu.

Kuunda violesura maalum vya sauti vya IoT au vifaa vilivyopachikwa ambapo kitambua chepesi na kinachoweza kutiririka kinahitajika

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DeepSpeech Architecture quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Usanifu wa Conformer

Maswali yanayoulizwa mara kwa mara

What is DeepSpeech Architecture?

DeepSpeech ni kielelezo cha utambuzi wa usemi wa mwisho hadi mwisho ulioanzishwa na Baidu mnamo 2014 ambao hupanga vipengele vya sauti mbichi moja kwa moja kwenye maandishi kwa kutumia mtandao wa kawaida wa neva uliofunzwa na hasara ya CTC. Ilisaidia uanzishaji wa kuhama kutoka kwa mabomba changamano, yaliyoundwa kwa mkono na ASR kuelekea mifumo iliyojifunza, inayoendeshwa na data.

Ni utendakazi gani wa upotezaji unaoruhusu DeepSpeech kutoa mafunzo bila usawazishaji wa kiwango cha fremu kati ya sauti na maandishi?

CTC huleta ishara tupu na kujumlisha upangaji wote halali unaoporomoka hadi kwenye maandishi lengwa, hivyo basi kuondoa hitaji la lebo za kila fremu.

Ni falsafa gani kuu ya usanifu ambayo DeepSpeech ilieneza umaarufu?

DeepSpeech ilibadilisha bomba la jadi la hatua nyingi na mtandao mmoja wa neva uliofunzwa mwisho hadi mwisho, mabadiliko makubwa katika muundo wa ASR.

Kwa nini DeepSpeech hutumia safu inayorudiwa ya pande mbili?

RNN ya pande mbili huchakata mfuatano katika pande zote mbili, kwa hivyo kila towe hunufaika kutokana na muktadha wa akustisk unaozunguka, kuboresha usahihi.

Je, DeepSpeech hufanya kazi kwa aina gani ya vipengele vya ingizo?

Muundo huu hutumia vipengele vya sauti vya kiwango cha fremu kama vile spectrogramu au MFCC na uwezekano wa matokeo wa herufi kwa kila hatua ya saa.

Ni nini mara nyingi huongezwa wakati wa kusimbua ili kuboresha chaguo la maneno na tahajia ya DeepSpeech?

Kuchanganya sauti ya sauti na muundo wa lugha ya nje wakati wa kusimbua husaidia mfumo kutoa maneno na tahajia zinazokubalika zaidi.