Thử thách khử tiếng ồn sâu
Thử thách Giảm tiếng ồn sâu (DNS) là một cuộc thi do Microsoft tổ chức nhằm thúc đẩy các nhà nghiên cứu xây dựng mạng lưới thần kinh giúp loại bỏ tiếng ồn xung quanh khỏi lời nói trong thời gian thực.
Tổng quan
It set the modern benchmarks that power features like Teams and Zoom noise removal.
Lặn sâu
Được Microsoft phát động vào năm 2020 và lặp lại trong vài năm (thường là tại INTERSPEECH và ICASSP), Thử thách DNS đã mang đến cho các đội một tập dữ liệu lớn, được tiêu chuẩn hóa về giọng nói rõ ràng, clip tiếng ồn và các bản ghi âm tạp âm tổng hợp. Điều quan trọng là nó đã chuyển việc đánh giá từ phép toán tín hiệu cũ hơn như PESQ sang điểm số khả năng nghe của con người và các yếu tố dự đoán đã học được về chất lượng cảm nhận. Nó cũng bổ sung thêm các điều kiện khắc nghiệt trong thế giới thực: phòng vang vọng, tiếng ồn không cố định (đánh máy, tiếng chó, còi báo động), tiếng ồn âm sắc và các kịch bản được cá nhân hóa trong đó mô hình phải ngăn chặn tất cả mọi người ngoại trừ một diễn giả mục tiêu đã đăng ký. Bằng cách phát hành dữ liệu, đường cơ sở và bộ thử nghiệm chung, nó cho phép các phòng thí nghiệm so sánh táo với táo và đẩy nhanh quá trình chuyển từ thủ thuật lọc sang học sâu toàn diện để cải thiện giọng nói.
Hiểu biết kỹ thuật
Các mục nhập thường cung cấp biến đổi Fourier thời gian ngắn của dạng sóng nhiễu thành mạng hồi quy hoặc mạng chập để dự đoán mặt nạ tần số thời gian. Nhân mặt nạ với phổ nhiễu sẽ làm giảm các thùng bị nhiễu chiếm ưu thế trong khi vẫn bảo toàn các thùng chiếm ưu thế bằng giọng nói, sau đó STFT nghịch đảo sẽ xây dựng lại dạng sóng. Các quy tắc thời gian thực giới hạn độ trễ thuật toán (khoảng 40 mili giây) và yêu cầu xử lý nhân quả, do đó, các mô hình không thể xem âm thanh trong tương lai khi làm sạch khung hình hiện tại.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Thử thách giảm tiếng ồn sâu trong tương lai
Mong đợi khuôn khổ này sẽ mở rộng theo hướng ngăn chặn được cá nhân hóa và đa phương thức, trong đó chuyển động của môi hoặc giọng nói của người nói sẽ hướng dẫn những gì cần giữ. Các mẫu máy đang ngày càng thu nhỏ để chạy trên thiết bị dành cho tai nghe nhét tai và máy trợ thính, đồng thời khả năng xử lý toàn dải 48 kHz đang trở thành tiêu chuẩn để âm nhạc và tần số cao tồn tại. Các phương pháp tiếp cận mang tính sáng tạo nhằm tổng hợp lại lời nói trong sáng, thay vì chỉ che đậy tiếng ồn, là một lĩnh vực đang hoạt động và đôi khi gây tranh cãi.
Triển khai trong thế giới thực
Loại bỏ tiếng ồn trong nền theo thời gian thực trong Microsoft Nhóm và các ứng dụng gọi điện video khác
Ghi lại giọng nói rõ ràng hơn trong tai nghe nhét tai và tai nghe khi đi làm hoặc các quán cà phê đông đúc
Xử lý trước các bản ghi trường có tiếng ồn trước khi chép lời hoặc chú thích tự động
Cải thiện khả năng hiểu của máy trợ thính và thiết bị trợ thính
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Deep Noise Suppression Challenge quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Học sâu
Câu hỏi thường gặp
What is Deep Noise Suppression Challenge?
Thử thách Giảm tiếng ồn sâu (DNS) là một cuộc thi do Microsoft tổ chức nhằm thúc đẩy các nhà nghiên cứu xây dựng mạng lưới thần kinh giúp loại bỏ tiếng ồn xung quanh khỏi lời nói trong thời gian thực. Nó đặt ra các tiêu chuẩn hiện đại hỗ trợ các tính năng như Teams và loại bỏ tiếng ồn trong Zoom.
Tổ chức nào đã phát động Thử thách ngăn chặn tiếng ồn sâu (DNS)?
Microsoft đã phát động Thử thách DNS vào năm 2020 và chạy nó tại các địa điểm như INTERSPEECH và ICASSP.
Mục tiêu chính của các hệ thống được xây dựng cho Thử thách DNS là gì?
Thử thách này nhắm tới việc nâng cao khả năng nói theo thời gian thực, giảm tiếng ồn trong khi vẫn giữ được giọng nói của người nói.
Tại sao quá trình xử lý DNS thời gian thực lại cấm các mô hình sử dụng khung âm thanh trong tương lai?
Cuộc trò chuyện trực tiếp yêu cầu xử lý nhân quả, độ trễ thấp nên mô hình chỉ có thể sử dụng âm thanh trong quá khứ và hiện tại.
Một kỹ thuật phổ biến trong các mục DNS là dự đoán 'mặt nạ'. Mặt nạ có tác dụng gì?
Mặt nạ tần số thời gian được nhân với phổ nhiễu để triệt tiêu các thùng nhiễu chiếm ưu thế và giữ lại giọng nói.
Thử thách DNS đã thay đổi cách đánh giá việc nâng cao giọng nói như thế nào?
Thử thách chuyển sang các bài kiểm tra khả năng nghe của con người và học các yếu tố dự đoán chất lượng nhận thức thay vì chỉ tính toán tín hiệu.