PESQ и STOI показатели за качество на речта
PESQ и STOI са стандартни обективни показатели, които оценяват колко добре звучи обработената реч и колко разбираема е тя, без да са необходими човешки слушатели.
Преглед
They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.
Дълбоко гмуркане
PESQ (Перцептуална оценка на качеството на речта), стандартизиран като ITU-T P.862, предвижда възприеманото качество на речта, главно за тестване на телефон и кодек. Той сравнява чист референтен сигнал с влошен и извежда резултат по скала, подобна на MOS (приблизително -0,5 до 4,5), моделирайки човешкото слухово възприятие. STOI (краткосрочна обективна разбираемост), въведена през 2010 г., вместо това предсказва разбираемостта: колко думи действително би разбрал слушателят. Той корелира кратковременните времеви обвивки на чиста и обработена реч в честотните ленти, като дава резултат от 0 до 1. И двете са натрапчиви (базирани на референтни) показатели. PESQ отговаря „добре ли звучи?“ докато STOI отговаря "можете ли да го разберете?" Заедно те са инструментите за оценка по подразбиране за системи за подобряване на речта, обезшумяване и деверберация.
Техническа информация
И двата показателя са натрапчиви: те подравняват чистата референция с влошения сигнал преди оценка. PESQ картографира и двата сигнала върху психоакустична скала за гръмкост (ленти на Барк), изчислява смущението на възприятието във времето и го регресира до стойност, подобна на MOS. STOI разделя речта на ленти от една трета октава, взема кратки сегменти от ~400 ms обвивка, клипове и ги нормализира, след което изчислява корелацията между референтните и влошените обвивки. Осредняването на тези корелации дава резултата за разбираемост 0 към 1.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на показателите за качество на речта PESQ и STOI
Тъй като PESQ и STOI се нуждаят от чиста референция, изследванията се насочват към ненатрапчиви показатели без референции като DNSMOS и NISQA, които оценяват качеството само от влошения сигнал, използвайки невронни мрежи. По-новите модели за задълбочено обучение също са обучени да предсказват директно човешки MOS. Все пак PESQ и STOI остават утвърдени еталони и ключова тенденция ги прави разграничими, така че да могат да се използват директно като функции за загуба на обучение за мрежи за подобряване на речта, а не само като последващи оценки.
Внедряване в реалния свят
Сравнителен анализ на модели за подобряване на речта и потискане на шума върху стандартни набори от тестове
Сравняване на качеството на телефонен и VoIP кодек по време на мрежово инженерство
Настройка на слуховия апарат и обработката на кохлеарния имплант за максимална разбираемост
Валидиране на алгоритми за деверберация в конферентни връзки и тръбопроводи за гласови асистенти
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the PESQ and STOI Speech Quality Metrics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Качество на синтез на реч
Frequently asked questions
What is PESQ and STOI Speech Quality Metrics?
PESQ и STOI са стандартни обективни показатели, които оценяват колко добре звучи обработената реч и колко разбираема е тя, без да са необходими човешки слушатели. Те позволяват на инженерите автоматично да сравняват кодеците, шумопонижителите и моделите за подобряване на речта.
Какво основно измерва PESQ?
PESQ (ITU-T P.862) прогнозира възприеманото качество на речта по скала, подобна на MOS.
Какво основно прогнозира STOI?
STOI оценява разбираемостта, т.е. колко разбираема е речта, по скала от 0 до 1.
И PESQ, и STOI се описват като „натрапчиви“ показатели. какво значи това
Натрапчивите показатели сравняват влошения сигнал с чиста референция, за да изчислят резултат.
Какъв е приблизителният диапазон на резултатите на STOI?
STOI извежда стойност между 0 и 1, където по-високата означава по-разбираема.
PESQ моделира човешкия слух, използвайки кой вид честотна скала на възприемане?
PESQ преобразува сигнали в психоакустично представяне на силата на звука, използвайки обработка на Bark-band.