ऑडियो एआई गाइड

PESQ और STOI भाषण गुणवत्ता मेट्रिक्स

पीईएसक्यू और एसटीओआई मानक वस्तुनिष्ठ मेट्रिक्स हैं जो यह स्कोर करते हैं कि मानव श्रोताओं की आवश्यकता के बिना संसाधित भाषण कितना अच्छा लगता है और यह कितना समझने योग्य है।

2 मिनट लालअंतिम बार अद्यतन किया गया

सिंहावलोकन

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

गहरा गोता

PESQ (भाषण गुणवत्ता का अवधारणात्मक मूल्यांकन), जिसे ITU-T P.862 के रूप में मानकीकृत किया गया है, मुख्य रूप से टेलीफोन और कोडेक परीक्षण के लिए भाषण की अनुमानित गुणवत्ता की भविष्यवाणी करता है। यह एक स्वच्छ संदर्भ सिग्नल की तुलना एक खराब संदर्भ सिग्नल से करता है और मानव श्रवण धारणा को मॉडलिंग करते हुए एमओएस-जैसे पैमाने (लगभग -0.5 से 4.5) पर एक स्कोर आउटपुट करता है। एसटीओआई (शॉर्ट-टाइम ऑब्जेक्टिव इंटेलिजिबिलिटी), जिसे 2010 में पेश किया गया था, इसके बजाय समझदारी की भविष्यवाणी करता है: एक श्रोता वास्तव में कितने शब्द समझेगा। यह फ़्रीक्वेंसी बैंड में स्वच्छ और संसाधित भाषण के कम समय के अस्थायी लिफाफे को सहसंबंधित करता है, जिससे 0 से 1 तक का स्कोर उत्पन्न होता है। दोनों घुसपैठ (संदर्भ-आधारित) मेट्रिक्स हैं। PESQ उत्तर देता है 'क्या यह अच्छा लगता है?' जबकि STOI उत्तर देता है 'क्या आप इसे समझ सकते हैं?' साथ में वे वाक् संवर्द्धन, डीनोइज़िंग और डीरेवरबरेशन सिस्टम के लिए डिफ़ॉल्ट मूल्यांकन उपकरण हैं।

तकनीकी अंतर्दृष्टि

दोनों मेट्रिक्स दखल देने वाले हैं: वे स्कोरिंग से पहले खराब सिग्नल के साथ एक साफ संदर्भ को संरेखित करते हैं। पीईएसक्यू दोनों संकेतों को एक मनोध्वनिक लाउडनेस स्केल (बार्क बैंड) पर मैप करता है, समय के साथ अवधारणात्मक गड़बड़ी की गणना करता है, और इसे एमओएस-जैसे मूल्य पर वापस लाता है। STOI भाषण को एक-तिहाई-ऑक्टेव बैंड में विभाजित करता है, छोटे ~400 एमएस लिफाफा खंड लेता है, क्लिप करता है और उन्हें सामान्य करता है, फिर संदर्भ और अपमानित लिफाफे के बीच सहसंबंध की गणना करता है। उन सहसंबंधों का औसत निकालने पर 0 से 1 सुगमता स्कोर प्राप्त होता है।

सामरिक प्रभाव

पहुंच और पहुंच

यह प्रतिलेखन, कथन और ध्वनि इंटरफेस के माध्यम से पहुंच में सुधार करता है।

लागत और बजट

मीडिया टीमें छोटे बजट में बेहतर ऑडियो तेजी से भेज सकती हैं।

गति और पैमाना

ग्राहक-सामना करने वाली प्रणालियाँ बड़े पैमाने पर बोली जाने वाली बातचीत को संसाधित कर सकती हैं।

PESQ और STOI भाषण गुणवत्ता मेट्रिक्स का भविष्य

क्योंकि पीईएसक्यू और एसटीओआई को एक साफ संदर्भ की आवश्यकता है, अनुसंधान डीएनएसएमओएस और एनआईएसक्यूए जैसे गैर-घुसपैठ वाले, संदर्भ-मुक्त मेट्रिक्स की ओर बढ़ रहा है जो तंत्रिका नेटवर्क का उपयोग करके अकेले खराब सिग्नल से गुणवत्ता स्कोर करते हैं। नए डीप-लर्निंग मॉडल को सीधे मानव एमओएस की भविष्यवाणी करने के लिए भी प्रशिक्षित किया जाता है। फिर भी, पीईएसक्यू और एसटीओआई मजबूत बेंचमार्क बने हुए हैं, और एक प्रमुख प्रवृत्ति उन्हें अलग-अलग बना रही है ताकि उन्हें केवल तथ्य-पश्चात मूल्यांकन के बजाय सीधे भाषण-वृद्धि नेटवर्क के लिए प्रशिक्षण हानि कार्यों के रूप में उपयोग किया जा सके।

वास्तविक विश्व कार्यान्वयन

मानक परीक्षण सेटों पर बेंचमार्किंग भाषण-वृद्धि और शोर-दमन मॉडल

नेटवर्क इंजीनियरिंग के दौरान टेलीफोन और वीओआईपी कोडेक गुणवत्ता की तुलना करना

अधिकतम सुगमता के लिए ट्यूनिंग हियरिंग-एड और कॉकलियर-इम्प्लांट प्रोसेसिंग

कॉन्फ्रेंसिंग और वॉयस-असिस्टेंट पाइपलाइनों में डीरेवरबरेशन एल्गोरिदम को मान्य करना

जोखिम और रेलिंग

सहमति के अभाव में आवाज के दुरुपयोग और प्रतिरूपण के जोखिम बढ़ जाते हैं।

उच्चारण, बोलियों या शोर भरे वातावरण में सटीकता कम हो सकती है।

स्पष्ट लेबलिंग के बिना सिंथेटिक ऑडियो को प्रामाणिक भाषण समझने की भूल की जा सकती है।

कार्यान्वयन रोडमैप

1

वॉयस कैप्चर, क्लोनिंग और पुन: उपयोग के लिए स्पष्ट सहमति प्राप्त करें।

2

विभिन्न वक्ताओं और पृष्ठभूमि स्थितियों में गुणवत्ता का परीक्षण करें।

3

परिभाषित करें कि किसी इंसान को आउटपुट की समीक्षा या अनुमोदन कब करना चाहिए।

4

जवाबदेही के लिए सिंथेटिक ऑडियो को लेबल करें और उद्गम रिकॉर्ड रखें।

अन्वेषण करते रहें

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

प्रश्नोत्तरी प्रारंभ करें

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

अगली गाइड

भाषण संश्लेषण गुणवत्ता

अक्सर पूछे जाने वाले प्रश्नों

What is PESQ and STOI Speech Quality Metrics?

पीईएसक्यू और एसटीओआई मानक वस्तुनिष्ठ मेट्रिक्स हैं जो यह स्कोर करते हैं कि मानव श्रोताओं की आवश्यकता के बिना संसाधित भाषण कितना अच्छा लगता है और यह कितना समझने योग्य है। वे इंजीनियरों को स्वचालित रूप से कोडेक्स, शोर कम करने वाले और भाषण-वृद्धि मॉडल को बेंचमार्क करने देते हैं।

PESQ मुख्य रूप से क्या मापता है?

पीईएसक्यू (आईटीयू-टी पी.862) एमओएस जैसे पैमाने पर कथित भाषण गुणवत्ता की भविष्यवाणी करता है।

STOI मुख्य रूप से क्या भविष्यवाणी करता है?

एसटीओआई 0 से 1 पैमाने पर सुगमता का अनुमान लगाता है, यानी भाषण कितना समझने योग्य है।

PESQ और STOI दोनों को 'घुसपैठिया' मेट्रिक्स के रूप में वर्णित किया गया है। इसका क्या मतलब है?

इंट्रूसिव मेट्रिक्स किसी स्कोर की गणना करने के लिए ख़राब सिग्नल की तुलना एक साफ़ संदर्भ से करते हैं।

STOI की अनुमानित स्कोर सीमा क्या है?

STOI 0 और 1 के बीच एक मान आउटपुट करता है, जहां उच्चतर का मतलब अधिक समझदार है।

PESQ किस प्रकार की अवधारणात्मक आवृत्ति पैमाने का उपयोग करके मानव श्रवण का मॉडल तैयार करता है?

PESQ बार्क-बैंड प्रोसेसिंग का उपयोग करके एक मनोध्वनिक ध्वनि प्रतिनिधित्व पर संकेतों को मैप करता है।