Métricas de calidad del habla PESQ y STOI
PESQ y STOI son métricas objetivas estándar que califican qué tan bien suena el habla procesada y qué tan comprensible es, sin necesidad de oyentes humanos.
Descripción general
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
Buceo profundo
PESQ (Evaluación perceptual de la calidad del habla), estandarizado como ITU-T P.862, predice la calidad percibida del habla, principalmente para pruebas telefónicas y de códecs. Compara una señal de referencia limpia con una degradada y genera una puntuación en una escala similar a MOS (aproximadamente -0,5 a 4,5), modelando la percepción auditiva humana. STOI (Inteligibilidad objetiva a corto plazo), introducido en 2010, predice en cambio la inteligibilidad: cuántas palabras entendería realmente un oyente. Correlaciona envolventes temporales de corta duración de voz limpia y procesada en bandas de frecuencia, produciendo una puntuación de 0 a 1. Ambas son métricas intrusivas (basadas en referencias). PESQ responde '¿suena bien?' mientras STOI responde '¿puedes entenderlo?' Juntas son las herramientas de evaluación predeterminadas para sistemas de mejora del habla, eliminación de ruido y desverberación.
Información técnica
Ambas métricas son intrusivas: alinean una referencia limpia con la señal degradada antes de puntuar. PESQ asigna ambas señales a una escala de sonoridad psicoacústica (bandas de corteza), calcula la perturbación perceptiva a lo largo del tiempo y la regresa a un valor similar a MOS. STOI divide la voz en bandas de un tercio de octava, toma segmentos envolventes cortos de ~400 ms, los recorta y los normaliza, luego calcula la correlación entre las envolventes de referencia y degradadas. Al promediar esas correlaciones se obtiene una puntuación de inteligibilidad de 0 a 1.
Impacto Estratégico
Access and reach
Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.
Costo y presupuesto
Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.
Speed and scale
Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.
El futuro de las métricas de calidad del habla PESQ y STOI
Debido a que PESQ y STOI necesitan una referencia limpia, la investigación está cambiando hacia métricas no intrusivas y sin referencias como DNSMOS y NISQA que califican la calidad únicamente a partir de la señal degradada utilizando redes neuronales. Los modelos más nuevos de aprendizaje profundo también están entrenados para predecir directamente el MOS humano. Aún así, PESQ y STOI siguen siendo puntos de referencia arraigados, y una tendencia clave es hacerlos diferenciables para que puedan usarse directamente como funciones de pérdida de entrenamiento para redes de mejora del habla en lugar de solo como evaluaciones posteriores.
Implementación en el mundo real
Evaluación comparativa de modelos de mejora del habla y supresión de ruido en equipos de prueba estándar
Comparación de la calidad de los códecs telefónicos y VoIP durante la ingeniería de redes
Ajuste del procesamiento de audífonos e implantes cocleares para una máxima inteligibilidad
Validación de algoritmos de desreverberación en canales de conferencias y asistentes de voz
Riesgos y barandillas
Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.
La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.
El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.
Hoja de ruta de implementación
Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.
Pruebe la calidad en diversos oradores y condiciones de fondo.
Defina cuándo un humano debe revisar o aprobar los resultados.
Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.
Sigue explorando
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Siguiente guía
Calidad de síntesis de voz
Preguntas frecuentes
What is PESQ and STOI Speech Quality Metrics?
PESQ y STOI son métricas objetivas estándar que califican qué tan bien suena el habla procesada y qué tan comprensible es, sin necesidad de oyentes humanos. Permiten a los ingenieros comparar códecs, reductores de ruido y modelos de mejora del habla automáticamente.
¿Qué mide principalmente PESQ?
PESQ (ITU-T P.862) predice la calidad del habla percibida en una escala similar a MOS.
¿Qué predice principalmente STOI?
STOI estima la inteligibilidad, es decir, qué tan comprensible es el discurso, en una escala de 0 a 1.
Tanto PESQ como STOI se describen como métricas "intrusivas". ¿Qué significa eso?
Las métricas intrusivas comparan la señal degradada con una referencia limpia para calcular una puntuación.
¿Cuál es el rango de puntuación aproximado de STOI?
STOI genera un valor entre 0 y 1, donde más alto significa más inteligible.
¿PESQ modela la audición humana utilizando qué tipo de escala de frecuencia perceptiva?
PESQ asigna señales a una representación de volumen psicoacústico utilizando el procesamiento de banda Bark.