GUÍA de IA en audio

Métricas de calidad del habla PESQ y STOI

PESQ y STOI son métricas objetivas estándar que califican qué tan bien suena el habla procesada y qué tan comprensible es, sin necesidad de oyentes humanos.

2 minutos de lecturaÚltima actualización

Descripción general

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Buceo profundo

PESQ (Evaluación perceptual de la calidad del habla), estandarizado como ITU-T P.862, predice la calidad percibida del habla, principalmente para pruebas telefónicas y de códecs. Compara una señal de referencia limpia con una degradada y genera una puntuación en una escala similar a MOS (aproximadamente -0,5 a 4,5), modelando la percepción auditiva humana. STOI (Inteligibilidad objetiva a corto plazo), introducido en 2010, predice en cambio la inteligibilidad: cuántas palabras entendería realmente un oyente. Correlaciona envolventes temporales de corta duración de voz limpia y procesada en bandas de frecuencia, produciendo una puntuación de 0 a 1. Ambas son métricas intrusivas (basadas en referencias). PESQ responde '¿suena bien?' mientras STOI responde '¿puedes entenderlo?' Juntas son las herramientas de evaluación predeterminadas para sistemas de mejora del habla, eliminación de ruido y desverberación.

Información técnica

Ambas métricas son intrusivas: alinean una referencia limpia con la señal degradada antes de puntuar. PESQ asigna ambas señales a una escala de sonoridad psicoacústica (bandas de corteza), calcula la perturbación perceptiva a lo largo del tiempo y la regresa a un valor similar a MOS. STOI divide la voz en bandas de un tercio de octava, toma segmentos envolventes cortos de ~400 ms, los recorta y los normaliza, luego calcula la correlación entre las envolventes de referencia y degradadas. Al promediar esas correlaciones se obtiene una puntuación de inteligibilidad de 0 a 1.

Impacto Estratégico

Access and reach

Mejora la accesibilidad a través de transcripción, narración e interfaces de voz.

Costo y presupuesto

Los equipos de medios pueden enviar audio pulido más rápido con presupuestos más pequeños.

Speed and scale

Los sistemas de cara al cliente pueden procesar interacciones habladas a mayor escala.

El futuro de las métricas de calidad del habla PESQ y STOI

Debido a que PESQ y STOI necesitan una referencia limpia, la investigación está cambiando hacia métricas no intrusivas y sin referencias como DNSMOS y NISQA que califican la calidad únicamente a partir de la señal degradada utilizando redes neuronales. Los modelos más nuevos de aprendizaje profundo también están entrenados para predecir directamente el MOS humano. Aún así, PESQ y STOI siguen siendo puntos de referencia arraigados, y una tendencia clave es hacerlos diferenciables para que puedan usarse directamente como funciones de pérdida de entrenamiento para redes de mejora del habla en lugar de solo como evaluaciones posteriores.

Implementación en el mundo real

Evaluación comparativa de modelos de mejora del habla y supresión de ruido en equipos de prueba estándar

Comparación de la calidad de los códecs telefónicos y VoIP durante la ingeniería de redes

Ajuste del procesamiento de audífonos e implantes cocleares para una máxima inteligibilidad

Validación de algoritmos de desreverberación en canales de conferencias y asistentes de voz

Riesgos y barandillas

Los riesgos de uso indebido de voz y suplantación de identidad aumentan cuando falta el consentimiento.

La precisión puede disminuir según los acentos, los dialectos o los entornos ruidosos.

El audio sintético puede confundirse con el habla auténtica sin un etiquetado claro.

Hoja de ruta de implementación

1

Obtenga consentimiento explícito para la captura, clonación y reutilización de voz.

2

Pruebe la calidad en diversos oradores y condiciones de fondo.

3

Defina cuándo un humano debe revisar o aprobar los resultados.

4

Etiquete el audio sintético y mantenga registros de procedencia para la rendición de cuentas.

Sigue explorando

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Iniciar prueba

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Siguiente guía

Calidad de síntesis de voz

Preguntas frecuentes

What is PESQ and STOI Speech Quality Metrics?

PESQ y STOI son métricas objetivas estándar que califican qué tan bien suena el habla procesada y qué tan comprensible es, sin necesidad de oyentes humanos. Permiten a los ingenieros comparar códecs, reductores de ruido y modelos de mejora del habla automáticamente.

¿Qué mide principalmente PESQ?

PESQ (ITU-T P.862) predice la calidad del habla percibida en una escala similar a MOS.

¿Qué predice principalmente STOI?

STOI estima la inteligibilidad, es decir, qué tan comprensible es el discurso, en una escala de 0 a 1.

Tanto PESQ como STOI se describen como métricas "intrusivas". ¿Qué significa eso?

Las métricas intrusivas comparan la señal degradada con una referencia limpia para calcular una puntuación.

¿Cuál es el rango de puntuación aproximado de STOI?

STOI genera un valor entre 0 y 1, donde más alto significa más inteligible.

¿PESQ modela la audición humana utilizando qué tipo de escala de frecuencia perceptiva?

PESQ asigna señales a una representación de volumen psicoacústico utilizando el procesamiento de banda Bark.