HƯỚNG DẪN AI âm thanh

Số liệu chất lượng giọng nói PESQ và STOI

PESQ và STOI là các số liệu khách quan tiêu chuẩn để đánh giá âm thanh của lời nói được xử lý tốt như thế nào và mức độ dễ hiểu của nó mà không cần người nghe.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They let engineers benchmark codecs, noise reducers, and speech-enhancement models automatically.

Lặn sâu

PESQ (Đánh giá cảm nhận về chất lượng giọng nói), được tiêu chuẩn hóa theo ITU-T P.862, dự đoán chất lượng cảm nhận của giọng nói, chủ yếu để kiểm tra điện thoại và codec. Nó so sánh tín hiệu tham chiếu rõ ràng với tín hiệu bị suy giảm và đưa ra điểm số theo thang điểm giống MOS (khoảng -0,5 đến 4,5), mô hình hóa nhận thức thính giác của con người. Thay vào đó, STOI (Khả năng hiểu khách quan trong thời gian ngắn), được giới thiệu vào năm 2010, dự đoán mức độ dễ hiểu: người nghe thực sự có thể hiểu được bao nhiêu từ. Nó tương quan với các đường bao tạm thời trong thời gian ngắn của giọng nói sạch và đã được xử lý trên các dải tần số, tạo ra điểm từ 0 đến 1. Cả hai đều là số liệu xâm nhập (dựa trên tham chiếu). PESQ trả lời 'nghe có hay không?' trong khi STOI trả lời 'bạn có hiểu được không?' Chúng cùng nhau là các công cụ đánh giá mặc định cho hệ thống tăng cường giọng nói, khử nhiễu và khử âm.

Hiểu biết kỹ thuật

Cả hai số liệu đều có tính xâm phạm: chúng căn chỉnh một tham chiếu rõ ràng với tín hiệu bị suy giảm trước khi tính điểm. PESQ ánh xạ cả hai tín hiệu vào thang âm lượng tâm lý (dải Bark), tính toán nhiễu loạn nhận thức theo thời gian và hồi quy nó về giá trị giống MOS. STOI chia giọng nói thành các dải 1/3 quãng tám, lấy các đoạn đường bao ngắn ~400 ms, cắt bớt và chuẩn hóa chúng, sau đó tính toán mối tương quan giữa đường bao tham chiếu và đường bao bị suy giảm. Tính trung bình các mối tương quan đó mang lại điểm dễ hiểu từ 0 đến 1.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của các thước đo chất lượng giọng nói PESQ và STOI

Vì PESQ và STOI cần một tài liệu tham khảo rõ ràng nên nghiên cứu đang chuyển sang các số liệu không xâm phạm, không có tham chiếu như DNSMOS và NISQA để chấm điểm chất lượng chỉ từ tín hiệu bị suy giảm bằng cách sử dụng mạng thần kinh. Các mô hình học sâu mới hơn cũng được đào tạo để dự đoán trực tiếp MOS của con người. Tuy nhiên, PESQ và STOI vẫn là các tiêu chuẩn cố định và xu hướng chính là làm cho chúng trở nên khác biệt để có thể được sử dụng trực tiếp làm chức năng đào tạo mất mát cho mạng nâng cao giọng nói thay vì chỉ đánh giá sau thực tế.

Triển khai trong thế giới thực

So sánh các mô hình tăng cường giọng nói và giảm tiếng ồn trên các bộ thử nghiệm tiêu chuẩn

So sánh chất lượng codec điện thoại và VoIP trong quá trình kỹ thuật mạng

Điều chỉnh máy trợ thính và quá trình cấy ốc tai điện tử để có độ rõ tối đa

Xác thực các thuật toán giảm âm vang trong quy trình hội nghị và hỗ trợ giọng nói

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the PESQ and STOI Speech Quality Metrics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Chất lượng tổng hợp giọng nói

Câu hỏi thường gặp

What is PESQ and STOI Speech Quality Metrics?

PESQ và STOI là các số liệu khách quan tiêu chuẩn để đánh giá âm thanh của lời nói được xử lý tốt như thế nào và mức độ dễ hiểu của nó mà không cần người nghe. Chúng cho phép các kỹ sư tự động đánh giá các codec, bộ giảm tiếng ồn và mô hình nâng cao giọng nói.

PESQ chủ yếu đo lường những gì?

PESQ (ITU-T P.862) dự đoán chất lượng giọng nói được cảm nhận trên thang đo giống MOS.

STOI chủ yếu dự đoán điều gì?

STOI ước tính mức độ dễ hiểu, tức là mức độ dễ hiểu của bài phát biểu, theo thang điểm từ 0 đến 1.

Cả PESQ và STOI đều được mô tả là các số liệu 'xâm nhập'. Điều đó có nghĩa là gì?

Các số liệu xâm nhập so sánh tín hiệu bị suy giảm với tín hiệu tham chiếu rõ ràng để tính điểm.

Phạm vi điểm gần đúng của STOI là bao nhiêu?

STOI xuất ra giá trị từ 0 đến 1, trong đó cao hơn có nghĩa là dễ hiểu hơn.

PESQ lập mô hình thính giác của con người bằng cách sử dụng loại thang tần số cảm nhận nào?

PESQ ánh xạ tín hiệu vào biểu diễn âm lượng tâm lý bằng cách sử dụng xử lý băng tần Bark.