የድምጽ AI መመሪያ

የአማካይ አስተያየት ውጤት ግምገማ

አማካኝ አስተያየት ነጥብ (MOS) ምን ያህል ጥሩ የተቀናጁ ወይም የሚተላለፉ የድምጽ ድምፆችን የሚለካ ከሰዎች አድማጮች ከ1-5-5 አማካኝ ደረጃ ነው።

2 ሚን አንብብለመጨረሻ ጊዜ የዘመነው

አጠቃላይ እይታ

It is the gold-standard yardstick for judging text-to-speech, voice cloning, and audio codecs, because ultimately humans, not machines, are the audience.

ጥልቅ ዳይቭ

MOS የሚመጣው በ ITU (የውሳኔ ሃሳብ P.800) ከቴሌፎን-ኔትወርክ ሙከራ ነው። አድማጮች አጫጭር የድምጽ ቅንጥቦችን ሰምተው እያንዳንዳቸው በአምስት ነጥብ ሚዛን 5 = ግሩም፣ 4 = ጥሩ፣ 3 = ፍትሃዊ፣ 2 = ደካማ፣ 1 = መጥፎ። በብዙ ቅንጥቦች እና አድማጮች ላይ በአማካይ ብዙ ደረጃዎችን መስጠት MOSን ይሰጣል። ተለዋዋጮች የተወሰኑ ጥያቄዎችን ኢላማ ያደርጋሉ፡ MOS-LQS ለአጠቃላይ ጥራት፣ MOS (CMOS) ለ A/B ምርጫ፣ እና MUSHRA ለጥሩ-ጥራጥሬ የኮዴክ ንፅፅር። በዘመናዊ AI የንግግር ጥናት ውስጥ፣ MOS እንደ WaveNet፣ Tacotron እና VALL-E ያሉ ስርዓቶች የርእሰ ዜና መለኪያ ነው። የሰዎች ግምገማ ቀርፋፋ እና ውድ ስለሆነ፣ የተገመቱ-MOS ሞዴሎች (DNSMOS፣ UTMOS፣ NISQA) አሁን ውጤቶችን በራስ-ሰር ይገምታሉ፣ ምንም እንኳን የሰው MOS ታማኝ ማጣቀሻ ሆኖ ይቆያል።

ቴክኒካዊ ግንዛቤ

ትክክለኛው የ MOS ጥናት የማዳመጥ ሁኔታዎችን ይቆጣጠራል፡- የተስተካከሉ የጆሮ ማዳመጫዎች፣ ቋሚ ድምጽ፣ የዘፈቀደ ቅንጭብ ቅደም ተከተል እና በቂ ደረጃ አሰጣጦች (ብዙውን ጊዜ 20+) በአንድ ናሙና ስለዚህ አማካዩ በስታቲስቲክስ የተረጋጋ ነው። ተመራማሪዎች 0.1 MOS ክፍተት ጫጫታ ሊሆን ስለሚችል 95% የመተማመን ክፍተቶችን ዘግበዋል. በአስፈላጊ ሁኔታ, MOS ፍጹም አካላዊ መለኪያ አይደለም; እሱ በዚያ ክፍለ ጊዜ ውስጥ ባሉት ልዩ ቅንጥቦች እና መመሪያዎች መልህቅ ነው፣ ስለዚህ ከተለያዩ ጥናቶች የተገኙ ውጤቶች በቀጥታ የሚወዳደሩ አይደሉም።

ስልታዊ ተጽእኖ

መድረስ እና መድረስ

በጽሑፍ፣ በትረካ እና በድምፅ በይነገጾች ተደራሽነትን ያሻሽላል።

ወጪ እና በጀት

የሚዲያ ቡድኖች በትንሽ በጀቶች የተጣራ ድምጽ በፍጥነት መላክ ይችላሉ።

ፍጥነት እና ልኬት

ከደንበኛ ጋር የሚገናኙ ስርዓቶች የንግግር ግንኙነቶችን በትልቁ ደረጃ ማካሄድ ይችላሉ።

የወደፊት የአማካይ አስተያየት የውጤት ግምገማ

አውቶማቲክ MOS ትንበያዎች በፍጥነት እየተሻሻሉ ነው እና በሰዎች ደረጃ በተሰጣቸው ትልቅ ኮርፖራ ላይ የሰለጠኑ ናቸው፣ ይህም ቡድኖቹ ከመጨረሻው የሰው ልጅ ፈተና በፊት በሺዎች የሚቆጠሩ ናሙናዎችን በርካሽ እንዲያጣሩ ያስችላቸዋል። ከአንድ ብዥታ ቁጥር ይልቅ ተፈጥሯዊነትን፣ ማስተዋልን፣ የተናጋሪን ተመሳሳይነት እና ስሜትን የሚለዩ የበለጸጉ፣ ባለ ብዙ ልኬት ውጤቶች ይጠብቁ። የትውልድ ንግግር ወደ ሰው እኩልነት ሲቃረብ፣ ጥሬው MOS በ 4.5 አካባቢ ስለሚሞላ እና ከፍተኛ ስርዓቶችን መለየት ስለማይችል ግምገማው ወደ ምርጫዎች ፈተናዎች እና ስውር ቅርሶች እየተለወጠ ነው።

የእውነተኛ-ዓለም አተገባበር

ለአሰሳ መተግበሪያ ሁለት የጽሑፍ-ወደ-ንግግር ድምጾችን ማወዳደር አድማጮች ተፈጥሯዊነትን 1-5 እንዲሰጡ በመጠየቅ

የአድማጭ ደረጃዎችን በመጠቀም አዲስ የነርቭ ኦዲዮ ኮዴክ በተመሳሳይ የቢት ፍጥነት ከMP3 ጋር ማመሳሰል

በኦዲዮ መጽሐፍ ምርት ውስጥ ከመሰማራቱ በፊት የድምጽ-ክሎኒንግ ሞዴል የውጤት ጥራት ማረጋገጥ

የቴሌኮም መሐንዲሶች የ4.0 MOS ዒላማ ማሟሉን ለማረጋገጥ በአዲሱ የቪኦአይፒ አውታረ መረብ ላይ የጥሪ ጥራትን ያስመዘገቡ

አደጋዎች እና የጥበቃ መንገዶች

ስምምነት ሲጠፋ የድምፅ አላግባብ መጠቀም እና የማስመሰል አደጋዎች ይጨምራሉ።

ትክክለኛነት በአነጋገር ዘዬዎች፣ ቀበሌኛዎች ወይም ጫጫታ አካባቢዎች ላይ ሊወድቅ ይችላል።

ሰራሽ ኦዲዮ ግልጽ ምልክት ሳይደረግበት ለትክክለኛ ንግግር ሊሳሳት ይችላል።

የትግበራ ፍኖተ ካርታ

1

ለድምጽ ቀረጻ፣ ክሎኒንግ እና እንደገና ጥቅም ላይ ለማዋል ግልጽ የሆነ ፈቃድ ያግኙ።

2

በተለያዩ የድምጽ ማጉያዎች እና የበስተጀርባ ሁኔታዎች ላይ ጥራትን ይሞክሩ።

3

አንድ ሰው መቼ ውጤቶችን መገምገም ወይም ማጽደቅ እንዳለበት ይግለጹ።

4

ሰው ሰራሽ ኦዲዮን ይሰይሙ እና ለተጠያቂነት የፕሮቨንስ መዝገቦችን ያስቀምጡ።

ማሰስዎን ይቀጥሉ

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mean Opinion Score Evaluation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ጥያቄ ጀምር

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

በተደጋጋሚ የሚጠየቁ ጥያቄዎች

What is Mean Opinion Score Evaluation?

አማካኝ አስተያየት ነጥብ (MOS) ምን ያህል ጥሩ የተቀናጁ ወይም የሚተላለፉ የድምጽ ድምፆችን የሚለካ ከሰዎች አድማጮች ከ1-5-5 አማካኝ ደረጃ ነው። የጽሑፍ-ወደ-ንግግር፣ የድምጽ ክሎኒንግ እና የድምጽ ኮዴክ ለመፍረድ የወርቅ-ደረጃ መለኪያ ነው፣ ምክንያቱም በመጨረሻ ሰዎች እንጂ ማሽኖች አይደሉም፣ ተመልካቾች ናቸው።

የ 5 አማካኝ አስተያየት ነጥብ በመደበኛ ሚዛን ላይ ምን ይወክላል?

በመደበኛው ITU ባለ አምስት ነጥብ ፍፁም ምድብ የደረጃ አሰጣጥ ሚዛን፣ 5 ማለት በጣም ጥሩ እና 1 ማለት መጥፎ ማለት ነው።

ለምንድን ነው የ MOS ጥናቶች በአንድ የድምጽ ቅንጥብ ብዙ አድማጮችን ይጠቀማሉ?

የግለሰብ ደረጃ አሰጣጦች ተጨባጭ እና ጫጫታ ያላቸው ናቸው፣ ስለዚህ በአማካይ በብዙ ሬተሮች ላይ ስታቲስቲካዊ የተረጋጋ ውጤት ሪፖርት ሊደረግ የሚችል በራስ የመተማመን ጊዜ ይሰጣል።

የመጀመሪያውን የኤምኦኤስ ዘዴ ለድምጽ ጥራት ደረጃውን የሰጠው የትኛው ድርጅት ነው?

የአለም አቀፍ የቴሌኮሙኒኬሽን ህብረት የ MOS ፈተናን በውሳኔ P.800 ገልፆ፣ በመጀመሪያ ለስልክ ንግግር ጥራት።

የ MOS እሴቶችን ከሁለት የተለያዩ ጥናቶች ጋር የማነፃፀር ቁልፍ ገደብ ምንድን ነው?

ደረጃ አሰጣጦች በተወሰኑ ናሙናዎች፣ መልህቆች እና የአድማጭ ገንዳዎች ላይ ስለሚመሰረቱ፣ ከተለያዩ ክፍለ-ጊዜዎች የመጡ ፍጹም MOS ቁጥሮች በአስተማማኝ ሁኔታ ሊነፃፀሩ አይችሉም።

እንደ DNSMOS ወይም UTMOS ያሉ አውቶማቲክ MOS ትንበያዎች ምን ችግር ይፈታሉ?

የተገመቱ-MOS ሞዴሎች በሰዎች ደረጃ አሰጣጥ ላይ የሰለጠኑ ውጤቶችን በራስ-ሰር ይገምታሉ፣ ይህም ቡድኖች ከመጨረሻው የሰው ልጅ ግምገማ በፊት ብዙ ናሙናዎችን በርካሽ እንዲያጣሩ ያስችላቸዋል።