HƯỚNG DẪN AI âm thanh

Khử nhiễu giọng nói bằng RNNoise

RNNoise là một mạng thần kinh nhỏ, nhanh, giúp loại bỏ tiếng ồn xung quanh khỏi lời nói trong thời gian thực.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Được tạo ra bởi Jean-Marc Valin của Xiph.Org, nó kết hợp xử lý tín hiệu cổ điển với một mạng nhỏ lặp lại để chạy trên CPU thông thường và thậm chí cả các thiết bị nhúng.

Lặn sâu

RNNoise, được phát hành vào năm 2017, được thiết kế để khử tiếng ồn có độ trễ thấp trong các cuộc gọi thoại. Thay vì học mọi thứ từ đầu đến cuối, nó chia giọng nói thành khoảng 22 dải tần được mô hình hóa trên tai người (thang đo giống như Bark) và sử dụng mạng thần kinh tái phát với Đơn vị tái phát có cổng để ước tính mức tăng (0 đến 1) cho mỗi dải trên mỗi khung hình. Những lợi ích đó làm giảm các dải nhiễu trong khi vẫn giữ nguyên các dải bị chi phối bởi giọng nói. Bộ lọc cao độ bổ sung giúp loại bỏ tiếng ồn dư thừa giữa các hài âm của giọng nói hữu thanh. Toàn bộ mô hình có trọng lượng khoảng 85.000, chạy nhanh hơn thời gian thực trên một lõi CPU và là nguồn mở theo giấy phép BSD, đó là lý do tại sao nó được tích hợp vào các dự án như hệ sinh thái codec Opus, Mumble và OBS Studio.

Hiểu biết kỹ thuật

Lựa chọn thiết kế chính đang hoạt động dựa trên mức tăng băng tần cảm nhận thay vì các thùng quang phổ thô. Bằng cách chỉ dự đoán ~22 giá trị khuếch đại trên mỗi khung hình, mạng GRU vẫn ở mức nhỏ và tránh được các tạo tác nhiễu âm nhạc thường gặp trong các phương pháp trừ phổ cũ. Các tính năng được tạo thủ công (năng lượng băng tần, chu kỳ cao độ, tương quan cao độ) cung cấp mạng, kết hợp kiến ​​thức DSP với việc học. Đầu ra hoạt động bằng giọng nói riêng biệt giúp tăng cổng trong các khung có tiếng ồn thuần túy.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của việc khử nhiễu lời nói với RNNoise

RNNoise đã truyền cảm hứng cho một làn sóng công việc nâng cao thời gian thực nhẹ nhàng; nghiên cứu kế nhiệm của nó (PerceptNet, DeepFilterNet) đẩy chất lượng lên cao hơn trong khi vẫn duy trì ngân sách CPU ở mức thấp. Mong đợi bộ khử nhiễu được nhúng trực tiếp vào tai nghe, máy trợ thính và chip hội nghị, kết hợp với chức năng khử tiếng vang và khử âm vang, đồng thời sử dụng các mục tiêu nhận thức và thậm chí là tổng hợp. Công thức kết hợp DSP-cộng với mạng nhỏ vẫn có ảnh hưởng ở bất cứ nơi nào độ trễ thấp, công suất thấp và việc cấp phép nguồn mở quan trọng hơn kích thước mô hình thô.

Triển khai trong thế giới thực

Loại bỏ tiếng kêu bàn phím và tiếng ồn của quạt trong cuộc gọi điện video trong các ứng dụng đi kèm RNNoise.

Dọn dẹp micrô của người phát trực tiếp trong OBS Studio thông qua bộ lọc khử tiếng ồn RNNoise tích hợp.

Cải thiện tính dễ hiểu của trò chuyện thoại trong trò chơi và công cụ VoIP như Mumble trên phần cứng tiêu thụ điện năng thấp.

Xử lý trước các bản ghi trường có nhiễu để tính năng nhận dạng giọng nói xuôi dòng nhận được tín hiệu rõ ràng hơn.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Sự tách biệt lời nói và vấn đề tiệc cocktail

Câu hỏi thường gặp

Khử nhiễu giọng nói với RNNoise là gì?

RNNoise là một mạng thần kinh nhỏ, nhanh, giúp loại bỏ tiếng ồn xung quanh khỏi lời nói trong thời gian thực. Được tạo bởi Jean-Marc Valin của Xiph.Org, nó kết hợp quá trình xử lý tín hiệu cổ điển với một mạng định kỳ nhỏ để chạy trên các CPU thông thường và thậm chí cả các thiết bị nhúng.

RNNoise chủ yếu dự đoán điều gì cho mỗi khung âm thanh ngắn?

RNNoise ước tính mức tăng trên mỗi băng tần làm giảm các dải nhiễu chiếm ưu thế trong khi vẫn duy trì các dải chiếm ưu thế bằng giọng nói, thay vì hoạt động trên mọi thùng quang phổ.

Loại mạng lưới thần kinh nào là cốt lõi của RNNoise?

RNNoise sử dụng mạng thần kinh tái phát nhỏ gọn được xây dựng bằng Đơn vị tái phát có cổng, mang lại cho nó bộ nhớ tạm thời trong khi vẫn ở kích thước nhỏ.

Tại sao RNNoise sử dụng dải tần cảm nhận thay vì các thùng quang phổ thô?

Chỉ dự đoán mức tăng băng tần ~22 giúp mạng nhỏ, nhanh và ít bị ảnh hưởng bởi các tạo tác nhiễu âm nhạc gây khó khăn cho các phương pháp mỗi thùng.

Mô hình RNNoise lớn đến mức nào?

RNNoise có trọng lượng khoảng 85.000, đủ nhỏ để chạy nhanh hơn thời gian thực trên một lõi CPU.

Vai trò của bộ lọc cao độ trong RNNoise là gì?

Bộ lọc lược/cao độ khai thác cấu trúc hài hòa của giọng nói hữu thanh để triệt tiêu tiếng ồn nằm giữa các hài âm, bổ sung cho lợi ích của băng tần.