Mesures de qualité vocale PESQ et STOI
PESQ et STOI sont des mesures objectives standard qui évaluent la qualité du traitement de la parole et sa compréhensibilité, sans avoir recours à des auditeurs humains.
Aperçu
Ils permettent aux ingénieurs de tester automatiquement les codecs, les réducteurs de bruit et les modèles d’amélioration vocale.
Plongée profonde
PESQ (Perceptual Evaluation of Speech Quality), normalisé sous le nom d'ITU-T P.862, prédit la qualité perçue de la parole, principalement pour les tests téléphoniques et codecs. Il compare un signal de référence propre à un signal dégradé et génère un score sur une échelle de type MOS (environ -0,5 à 4,5), modélisant la perception auditive humaine. STOI (Short-Time Objective Intelligibility), introduit en 2010, prédit plutôt l'intelligibilité : combien de mots un auditeur comprendrait réellement. Il met en corrélation les enveloppes temporelles à court terme de la parole propre et traitée sur toutes les bandes de fréquences, produisant un score de 0 à 1. Les deux sont des mesures intrusives (basées sur des références). PESQ répond « est-ce que ça sonne bien ? » tandis que STOI répond « pouvez-vous comprendre ? » Ensemble, ils constituent les outils d'évaluation par défaut pour les systèmes d'amélioration de la parole, de débruitage et de déréverbération.
Aperçu technique
Les deux métriques sont intrusives : elles alignent une référence propre avec le signal dégradé avant de noter. PESQ mappe les deux signaux sur une échelle d'intensité psychoacoustique (bandes d'écorce), calcule la perturbation de la perception au fil du temps et la régresse à une valeur de type MOS. STOI divise la parole en bandes d'un tiers d'octave, prend des segments d'enveloppe courts d'environ 400 ms, les coupe et les normalise, puis calcule la corrélation entre les enveloppes de référence et dégradées. La moyenne de ces corrélations donne le score d'intelligibilité de 0 à 1.
Impact stratégique
Accès et portée
Il améliore l'accessibilité grâce à la transcription, à la narration et aux interfaces vocales.
Coût et budget
Les équipes médias peuvent produire un son de qualité plus rapidement avec des budgets plus réduits.
Vitesse et échelle
Les systèmes orientés client peuvent traiter les interactions orales à plus grande échelle.
L’avenir des mesures de qualité vocale PESQ et STOI
Parce que PESQ et STOI ont besoin d'une référence propre, la recherche s'oriente vers des mesures non intrusives et sans référence comme DNSMOS et NISQA qui évaluent la qualité uniquement à partir du signal dégradé à l'aide de réseaux neuronaux. Des modèles d’apprentissage en profondeur plus récents sont également formés pour prédire directement la MOS humaine. Néanmoins, PESQ et STOI restent des références bien établies, et une tendance clé est de les rendre différenciables afin qu'ils puissent être utilisés directement comme fonctions de perte de formation pour les réseaux d'amélioration de la parole plutôt que uniquement comme évaluations après coup.
Mise en œuvre dans le monde réel
Analyse comparative des modèles d'amélioration de la parole et de suppression du bruit sur des ensembles de tests standard
Comparaison de la qualité des codecs téléphoniques et VoIP lors de l'ingénierie réseau
Ajustement du traitement des aides auditives et des implants cochléaires pour une intelligibilité maximale
Validation des algorithmes de déréverbération dans les pipelines de conférence et d'assistant vocal
Risques et garde-fous
Les risques d’utilisation abusive de la voix et d’usurpation d’identité augmentent lorsque le consentement fait défaut.
La précision peut chuter en fonction des accents, des dialectes ou des environnements bruyants.
L’audio synthétique peut être confondu avec une parole authentique sans étiquetage clair.
Feuille de route de mise en œuvre
Obtenez un consentement explicite pour la capture vocale, le clonage et la réutilisation.
Testez la qualité sur divers locuteurs et conditions d’arrière-plan.
Définissez quand un humain doit examiner ou approuver les résultats.
Étiquetez l’audio synthétique et conservez des enregistrements de provenance pour des raisons de responsabilité.
Continuez à explorer
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Guide suivant
Qualité de la synthèse vocale
Questions fréquemment posées
Qu’est-ce que les métriques de qualité de la parole PESQ et STOI ?
PESQ et STOI sont des mesures objectives standard qui évaluent la qualité du traitement de la parole et sa compréhensibilité, sans avoir recours à des auditeurs humains. Ils permettent aux ingénieurs d’évaluer automatiquement les codecs, les réducteurs de bruit et les modèles d’amélioration de la parole.
Que mesure principalement le PESQ ?
PESQ (ITU-T P.862) prédit la qualité de la parole perçue sur une échelle de type MOS.
Que prédit principalement STOI ?
STOI estime l'intelligibilité, c'est-à-dire le degré de compréhension de la parole, sur une échelle de 0 à 1.
PESQ et STOI sont tous deux décrits comme des mesures « intrusives ». Qu'est-ce que cela signifie?
Des métriques intrusives comparent le signal dégradé à une référence propre pour calculer un score.
Quelle est la plage de scores approximative du STOI ?
STOI génère une valeur comprise entre 0 et 1, où plus élevée signifie plus intelligible.
PESQ modélise l'audition humaine en utilisant quel type d'échelle de fréquence perceptuelle ?
PESQ mappe les signaux sur une représentation psychoacoustique de l'intensité sonore à l'aide du traitement Bark-band.