Аудио РУКОВОДСТВО ПО ИИ

Показатели качества речи PESQ и STOI

PESQ и STOI — это стандартные объективные показатели, которые оценивают, насколько хорошо звучит обработанная речь и насколько она понятна, без необходимости участия слушателей-людей.

2 минуты чтенияПоследнее обновление

Обзор

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Глубокое погружение

PESQ (перцептивная оценка качества речи), стандартизированная как ITU-T P.862, прогнозирует воспринимаемое качество речи, в основном для тестирования телефонов и кодеков. Он сравнивает чистый эталонный сигнал с ухудшенным и выводит оценку по шкале MOS (примерно от -0,5 до 4,5), моделируя слуховое восприятие человека. STOI (краткосрочная объективная разборчивость), представленная в 2010 году, вместо этого предсказывает разборчивость: сколько слов на самом деле поймет слушатель. Он сопоставляет кратковременные временные конверты чистой и обработанной речи по полосам частот, получая оценку от 0 до 1. Оба показателя являются навязчивыми (основанными на эталонах). PESQ отвечает: «Звучит хорошо?» в то время как СТОИ отвечает: «Ты можешь это понять?» Вместе они являются инструментами оценки по умолчанию для систем улучшения речи, шумоподавления и дереверберации.

Техническая информация

Обе метрики являются навязчивыми: перед оценкой они сравнивают чистый эталон с ухудшенным сигналом. PESQ отображает оба сигнала на психоакустическую шкалу громкости (полосы Барка), вычисляет перцептивные нарушения с течением времени и регрессирует их до значения, подобного MOS. STOI разделяет речь на третьоктавные полосы, берет короткие сегменты огибающей ~400 мс, обрезает и нормализует их, а затем вычисляет корреляцию между эталонными и ухудшенными огибающими. Усреднение этих корреляций дает оценку разборчивости от 0 до 1.

Стратегическое воздействие

Доступ и охват

Это улучшает доступность за счет транскрипции, повествования и голосовых интерфейсов.

Стоимость и бюджет

Медиа-команды могут выпускать качественное аудио быстрее с меньшими бюджетами.

Скорость и масштаб

Системы, работающие с клиентами, могут обрабатывать устные взаимодействия в большем масштабе.

Будущее показателей качества речи PESQ и STOI

Поскольку PESQ и STOI нуждаются в чистом эталоне, исследования смещаются в сторону неинтрузивных, не требующих ссылок показателей, таких как DNSMOS и NISQA, которые оценивают качество только по ухудшенному сигналу с использованием нейронных сетей. Новые модели глубокого обучения также обучены напрямую прогнозировать MOS человека. Тем не менее, PESQ и STOI остаются устоявшимися эталонами, и ключевая тенденция заключается в том, чтобы сделать их дифференцируемыми, чтобы их можно было использовать непосредственно в качестве функций потерь при обучении для сетей улучшения речи, а не только в качестве оценок постфактум.

Реальная реализация

Сравнительный анализ моделей улучшения речи и шумоподавления на стандартных тестовых наборах

Сравнение качества кодеков телефона и VoIP во время проектирования сети

Настройка слухового аппарата и кохлеарного имплантата для максимальной разборчивости

Проверка алгоритмов дереверберации в конвейерах конференц-связи и голосовых помощников

Риски и ограничения

Риски неправильного использования голоса и выдачи себя за другое лицо возрастают при отсутствии согласия.

Точность может снижаться из-за акцентов, диалектов или шумной обстановки.

Синтетический звук можно принять за аутентичную речь без четкой маркировки.

Дорожная карта реализации

1

Получите явное согласие на захват, клонирование и повторное использование голоса.

2

Проверьте качество звука при использовании различных динамиков и фоновых условий.

3

Определите, когда человек должен проверять или утверждать результаты.

4

Маркируйте синтетический звук и сохраняйте записи о происхождении для обеспечения ответственности.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

Качество синтеза речи

Часто задаваемые вопросы

What is PESQ and STOI Speech Quality Metrics?

PESQ и STOI — это стандартные объективные показатели, которые оценивают, насколько хорошо звучит обработанная речь и насколько она понятна, без необходимости участия слушателей-людей. Они позволяют инженерам автоматически тестировать кодеки, средства шумоподавления и модели улучшения речи.

Что в первую очередь измеряет PESQ?

PESQ (ITU-T P.862) прогнозирует воспринимаемое качество речи по шкале, подобной MOS.

Что в первую очередь предсказывает СТОИ?

STOI оценивает разборчивость, то есть насколько понятна речь, по шкале от 0 до 1.

И PESQ, и STOI описываются как «навязчивые» метрики. Что это значит?

Интрузивные метрики сравнивают ухудшенный сигнал с чистым эталоном для вычисления оценки.

Каков приблизительный диапазон баллов STOI?

STOI выводит значение от 0 до 1, где большее значение означает более понятный.

PESQ моделирует человеческий слух, используя какую шкалу частот восприятия?

PESQ отображает сигналы на психоакустическое представление громкости с использованием обработки Bark-band.