MWONGOZO WA AI wa Sauti

Tathmini ya Alama ya Maoni

Alama ya Maoni ya Wastani (MOS) ni ukadiriaji wa wastani wa 1 hadi 5 kutoka kwa wasikilizaji wa kibinadamu ambao hupima jinsi sauti za sauti zilizounganishwa au zinazopitishwa.

dk 2 kusomaIlisasishwa mwisho

Muhtasari

It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.

Dive ya kina

MOS inatokana na upimaji wa mtandao wa simu uliosanifishwa na ITU (Pendekezo P.800). Wasikilizaji husikia klipu fupi za sauti na kukadiria kila moja kwa mizani ya pointi tano: 5 = bora, 4 = nzuri, 3 = haki, 2 = duni, 1 = mbaya. Ukadiriaji wa wastani kwenye klipu nyingi na wasikilizaji hutoa MOS. Vibadala vinalenga maswali mahususi: MOS-LQS kwa ubora wa jumla, MOS ya kulinganisha (CMOS) kwa mapendeleo ya A/B, na MUSHRA kwa kulinganisha kodeki iliyoboreshwa. Katika utafiti wa kisasa wa usemi wa AI, MOS ndio kipimo kikuu cha mifumo kama WaveNet, Tacotron na VALL-E. Kwa sababu tathmini ya binadamu ni ya polepole na ya gharama kubwa, miundo ya MOS iliyotabiriwa (DNSMOS, UTMOS, NISQA) sasa inakadiria alama kiotomatiki, ingawa MOS ya binadamu inasalia kuwa rejeleo linaloaminika.

Ufahamu wa Kiufundi

Utafiti unaofaa wa MOS hudhibiti hali za usikilizaji: vipokea sauti vinavyobanwa kichwani vilivyorekebishwa, sauti ya sauti isiyobadilika, mpangilio wa klipu wa nasibu, na vikadiriaji vya kutosha (mara nyingi 20+) kwa kila sampuli ili wastani uwe thabiti kitakwimu. Watafiti wanaripoti vipindi vya kujiamini kwa 95% kwa sababu pengo la MOS 0.1 linaweza kuwa kelele. Muhimu, MOS si kipimo kamili cha kimwili; imethibitishwa na klipu na maagizo mahususi katika kipindi hicho, kwa hivyo alama kutoka kwa tafiti tofauti hazilinganishwi moja kwa moja.

Athari za kimkakati

Kufikia na kufikia

Huboresha ufikiaji kupitia manukuu, simulizi na violesura vya sauti.

Cost and budget

Timu za media zinaweza kusafirisha sauti iliyoboreshwa haraka na bajeti ndogo.

Kasi na kiwango

Mifumo inayowakabili wateja inaweza kuchakata mwingiliano wa mazungumzo kwa kiwango kikubwa.

Mustakabali wa Tathmini ya Alama ya Maoni ya Maana

Vitabiri otomatiki vya MOS vinaboreka haraka na vinafunzwa kuhusu shirika kubwa linalokadiriwa na binadamu, hivyo basi, timu zichunguze maelfu ya sampuli kwa bei nafuu kabla ya jaribio la mwisho la binadamu. Tarajia alama tajiri zaidi, zenye nyanja nyingi zinazotenganisha uasilia, ufahamu, kufanana kwa spika na hisia badala ya nambari moja iliyotiwa ukungu. Kadiri usemi wa ukuzaji unavyokaribia usawa wa binadamu, tathmini inaelekezwa kwenye majaribio ya mapendeleo na kugundua vizalia vya siri, kwa kuwa MOS ghafi hujaa karibu 4.5 na haiwezi tena kutofautisha mifumo ya juu.

Utekelezaji wa Ulimwengu Halisi

Kulinganisha sauti mbili za maandishi hadi usemi za programu ya kusogeza kwa kuwauliza wasikilizaji kukadiria uasilia 1-5

Kulinganisha kodeki mpya ya sauti ya neural dhidi ya MP3 kwa kasi sawa ya biti kwa kutumia ukadiriaji wa wasikilizaji

Kuthibitisha ubora wa matokeo ya muundo wa uigaji sauti kabla ya kupelekwa katika bidhaa ya kitabu cha sauti

Wahandisi wa mawasiliano ya simu wakipata ubora wa simu kupitia mtandao mpya wa VoIP ili kuthibitisha kuwa inafikia lengo la 4.0 MOS

Hatari & Walinzi

Hatari za matumizi mabaya ya sauti na uigaji huongezeka wakati kibali kinakosekana.

Usahihi unaweza kushuka katika lafudhi, lahaja au mazingira yenye kelele.

Sauti ya syntetisk inaweza kudhaniwa kimakosa kuwa usemi halisi bila kuweka lebo wazi.

Ramani ya Utekelezaji

1

Pata idhini ya moja kwa moja ya kunasa sauti, kuunda na kutumia tena.

2

Jaribu ubora kwenye spika na hali mbalimbali za usuli.

3

Bainisha wakati ni lazima binadamu akague au aidhinishe matokeo.

4

Weka lebo sauti ya sintetiki na uhifadhi rekodi za asili kwa uwajibikaji.

Endelea Kuchunguza

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mean Opinion Score Evaluation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Anza chemsha bongo

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Mwongozo unaofuata

Misingi ya Tathmini ya AI

Maswali yanayoulizwa mara kwa mara

What is Mean Opinion Score Evaluation?

Alama ya Maoni ya Wastani (MOS) ni ukadiriaji wa wastani wa 1 hadi 5 kutoka kwa wasikilizaji wa kibinadamu ambao hupima jinsi sauti za sauti zilizounganishwa au zinazopitishwa. Ni kigezo cha kiwango cha dhahabu cha kuhukumu maandishi-kwa-hotuba, usanifu wa sauti na kodeki za sauti, kwa sababu hatimaye wanadamu, si mashine, ndio watazamaji.

Je, Alama ya Maoni ya Maana ya 5 inawakilisha nini kwenye mizani ya kawaida?

Kwenye kiwango cha ukadiriaji cha kiwango cha ITU cha alama tano, 5 inamaanisha bora na 1 inamaanisha mbaya.

Kwa nini masomo ya MOS hutumia wasikilizaji wengi kwa kila klipu ya sauti?

Ukadiriaji wa mtu binafsi ni wa kibinafsi na wa kelele, kwa hivyo, wastani wa wakadiriaji wengi hutoa alama thabiti kitakwimu na muda unaoweza kuripotiwa.

Ni shirika gani lililosanifisha mbinu asili ya MOS kwa ubora wa sauti?

Muungano wa Kimataifa wa Mawasiliano ulifafanua jaribio la MOS katika Pendekezo P.800, asilia kwa ubora wa usemi wa simu.

Ni kizuizi gani muhimu cha kulinganisha maadili ya MOS kutoka kwa masomo mawili tofauti?

Kwa sababu ukadiriaji hutegemea sampuli mahususi, nanga na kundi la wasikilizaji, nambari kamili za MOS kutoka vipindi tofauti haziwezi kulinganishwa kwa njia ya kuaminika.

Watabiri wa MOS otomatiki kama DNSMOS au UTMOS hutatua shida gani?

Miundo ya Predicted-MOS iliyofunzwa juu ya ukadiriaji wa binadamu hukadiria alama kiotomatiki, hivyo basi huruhusu timu kukagua sampuli nyingi kwa bei nafuu kabla ya tathmini ya mwisho ya mwanadamu.