Аудіо AI GUIDE

Показники якості мовлення PESQ і STOI

PESQ і STOI — це стандартні об’єктивні показники, які оцінюють, наскільки добре звучить оброблена мова та наскільки вона зрозуміла, не потребуючи слухачів.

2 хвилини читанняОстаннє оновлення

Огляд

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Глибоке занурення

PESQ (Перцептуальна оцінка якості мовлення), стандартизована як ITU-T P.862, передбачає сприйману якість мовлення, головним чином для тестування телефону та кодеків. Він порівнює чистий опорний сигнал із погіршеним і видає оцінку за шкалою MOS (приблизно від -0,5 до 4,5), моделюючи слухове сприйняття людини. STOI (Short-Time Objective Intelligibility), представлений у 2010 році, натомість передбачає розбірливість: скільки слів слухач насправді зрозуміє. Він корелює короткочасні часові огинаючі чистого та обробленого мовлення в діапазонах частот, виробляючи оцінку від 0 до 1. Обидва показники є нав’язливими (на основі довідкових даних). PESQ відповідає "це добре звучить?" у той час як STOI відповідає "чи можете ви це зрозуміти?" Разом вони є інструментами оцінки за замовчуванням для систем покращення мовлення, шумозаглушення та деверберації.

Технічне розуміння

Обидві метрики є нав’язливими: вони вирівнюють чисте посилання з погіршеним сигналом перед оцінкою. PESQ відображає обидва сигнали на психоакустичну шкалу гучності (смуги Барка), обчислює порушення сприйняття з часом і регресує до значення, подібного до MOS. STOI розбиває мовлення на смуги в одну третину октави, бере короткі сегменти огинаючої ~400 мс, кліпи та нормалізує їх, а потім обчислює кореляцію між еталонною та деградованою огинаючою. Усереднення цих кореляцій дає оцінку розбірливості 0:1.

Стратегічний вплив

Доступ і охоплення

Це покращує доступність завдяки транскрипції, дикторському тексту та голосовому інтерфейсу.

Вартість і бюджет

Медіа-команди можуть доставляти якісний аудіо швидше за менші бюджети.

Швидкість і масштаб

Системи, орієнтовані на клієнта, можуть обробляти голосову взаємодію у більшому масштабі.

Майбутнє показників якості мовлення PESQ і STOI

Оскільки PESQ і STOI потребують чіткого посилання, дослідження зміщуються в бік ненав’язливих метрик без посилань, таких як DNSMOS і NISQA, які оцінюють якість лише за погіршеним сигналом за допомогою нейронних мереж. Новіші моделі глибокого навчання також навчені безпосередньо прогнозувати MOS людини. Тим не менш, PESQ і STOI залишаються вкоріненими еталонними тестами, і головна тенденція полягає в тому, щоб зробити їх диференційованими, щоб їх можна було використовувати безпосередньо як функції втрат навчання для мереж покращення мовлення, а не лише як оцінку після факту.

Реалізація в реальному світі

Порівняльний аналіз моделей покращення мови та придушення шуму на стандартних наборах тестів

Порівняння якості кодека телефону та VoIP під час проектування мережі

Налаштування слухового апарату та обробки кохлеарних імплантів для максимальної розбірливості

Перевірка алгоритмів деверберації в конвеєрах конференц-зв’язку та голосового помічника

Ризики та огорожі

Ризик неправильного використання голосу та видавання себе за іншу особу зростає, якщо згоди немає.

Точність може впасти через акценти, діалекти чи шумне середовище.

Синтетичне аудіо можна прийняти за автентичне мовлення без чіткого маркування.

Дорожня карта впровадження

1

Отримайте чітку згоду на захоплення голосу, клонування та повторне використання.

2

Перевірте якість на різних динаміках і фонових умовах.

3

Визначте, коли людина повинна переглядати або затверджувати результати.

4

Позначайте синтетичне аудіо та зберігайте записи про походження для підзвітності.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Якість синтезу мовлення

Часті запитання

What is PESQ and STOI Speech Quality Metrics?

PESQ і STOI — це стандартні об’єктивні показники, які оцінюють, наскільки добре звучить оброблена мова та наскільки вона зрозуміла, не потребуючи слухачів. Вони дозволяють інженерам автоматично тестувати кодеки, шумозаглушувачі та моделі покращення мови.

Що в основному вимірює PESQ?

PESQ (ITU-T P.862) прогнозує сприйману якість мовлення за шкалою MOS.

Що в першу чергу передбачає STOI?

STOI оцінює розбірливість, тобто наскільки зрозуміла мова, за шкалою від 0 до 1.

І PESQ, і STOI описуються як «нав’язливі» метрики. Що це означає?

Інтрузивні метрики порівнюють погіршений сигнал із чистим посиланням, щоб обчислити оцінку.

Який приблизний діапазон балів STOI?

STOI виводить значення від 0 до 1, де більше означає більш зрозуміле.

PESQ моделює людський слух, використовуючи яку частотну шкалу сприйняття?

PESQ відображає сигнали на психоакустичне представлення гучності за допомогою обробки Bark-band.