Cải thiện giọng nói Noise2Noise
Noise2Noise là một thủ thuật đào tạo cho phép mô hình học cách loại bỏ nhiễu mà không bao giờ nhìn thấy một tham chiếu rõ ràng, bằng cách học từ các cặp phiên bản nhiễu khác nhau của cùng một tín hiệu.
Tổng quan
For speech enhancement it matters because clean recordings are expensive or impossible to obtain, yet noisy ones are everywhere.
Lặn sâu
Được các nhà nghiên cứu NVIDIA giới thiệu vào năm 2018, Noise2Noise đã đưa ra một tuyên bố đáng ngạc nhiên: bạn có thể huấn luyện bộ khử nhiễu chỉ bằng cách sử dụng các mẫu bị hỏng. Cái nhìn sâu sắc là thống kê. Nếu bạn cung cấp cho mạng hai phiên bản nhiễu của cùng một tín hiệu cơ bản và yêu cầu mạng ánh xạ cái này với cái kia bằng cách sử dụng lỗi bình phương trung bình như tổn thất, thì mạng không thể dự đoán nhiễu ngẫu nhiên ở mục tiêu, vì vậy điều tốt nhất nó có thể làm là xuất ra giá trị mong đợi, tức là tín hiệu sạch. Tiếng ồn ở mức trung bình. Áp dụng cho lời nói, bạn có một cách phát âm rõ ràng, thêm hai mẫu tiếng ồn độc lập và huấn luyện mô hình để dự đoán một đoạn tiếng ồn từ một đoạn tiếng ồn khác. Khi suy luận, mô hình sẽ loại bỏ nhiễu khỏi bản ghi thực. Điều này giúp giải quyết nút thắt cốt lõi của việc khử nhiễu có giám sát: cần âm thanh trung thực hoàn toàn rõ ràng.
Hiểu biết kỹ thuật
Phép toán dựa trên đặc tính là tổn thất L2 (lỗi bình phương trung bình) được giảm thiểu ở mức trung bình có điều kiện. Nếu nhiễu được thêm vào mục tiêu có giá trị trung bình bằng 0 và không phụ thuộc vào nhiễu của đầu vào thì nhiễu không thể đoán trước chỉ góp phần tạo ra phương sai không đổi dẫn đến suy hao, do đó, việc giảm độ dốc sẽ đẩy mạng về phía tín hiệu sạch cơ bản. Ý tưởng tương tự cũng áp dụng được với các công cụ ước tính khác: tổn thất L1 sẽ phục hồi giá trị trung bình, hữu ích đối với nhiễu xung.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Noise2Noise Cải thiện giọng nói
Noise2Noise đã mở ra một nhóm các phương pháp khử nhiễu tự giám sát, bao gồm Noise2Void và Noise2Self, giúp giảm bớt các yêu cầu hơn nữa trong việc học từ các mẫu nhiễu đơn lẻ. Đối với bài phát biểu, hãy kỳ vọng những ý tưởng này sẽ hỗ trợ việc cải tiến thiết bị cho máy trợ thính, cuộc gọi và bản ghi âm hiện trường khi việc thu thập tài liệu tham khảo rõ ràng là không thực tế. Kết hợp với bộ phát âm tổng hợp, các hệ thống trong tương lai có thể không chỉ loại bỏ tiếng ồn mà còn tái tạo lại nội dung giọng nói bị che giấu hoặc bị phá hủy một cách hợp lý trong khi vẫn trung thành với người nói.
Triển khai trong thế giới thực
Dọn dẹp các bản ghi hiện trường hoặc lưu trữ khi không có tham chiếu rõ ràng về bài phát biểu gốc
Cải thiện độ rõ nét của cuộc gọi thoại trên điện thoại và máy tính xách tay bằng cách huấn luyện bộ khử nhiễu về khả năng ghi lại tiếng ồn trong thế giới thực
Cải thiện giọng nói cho máy trợ thính bằng cách sử dụng các bản ghi ồn được ghép nối thay vì âm thanh sạch không thể thu được
Khôi phục các băng podcast hoặc băng phỏng vấn cũ ồn ào mà chỉ những phiên bản xuống cấp mới tồn tại được
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Noise2Noise Speech Enhancement quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bộ công cụ nhận dạng giọng nói Kaldi
Câu hỏi thường gặp
What is Noise2Noise Speech Enhancement?
Noise2Noise là một thủ thuật đào tạo cho phép mô hình học cách loại bỏ nhiễu mà không bao giờ nhìn thấy một tham chiếu rõ ràng, bằng cách học từ các cặp phiên bản nhiễu khác nhau của cùng một tín hiệu. Để cải thiện giọng nói, điều này rất quan trọng vì các bản ghi âm sạch thì đắt tiền hoặc không thể có được, tuy nhiên những bản ghi âm ồn thì có ở khắp mọi nơi.
Tuyên bố cốt lõi đáng ngạc nhiên của Noise2Noise là gì?
Noise2Noise cho thấy bạn có thể huấn luyện một bộ khử nhiễu hiệu quả chỉ bằng cách sử dụng các cặp mẫu bị hỏng mà không cần có mục tiêu rõ ràng.
Tại sao mạng không thể ghi nhớ tiếng ồn trong clip mục tiêu?
Vì nhiễu của mục tiêu là ngẫu nhiên và độc lập với đầu vào nên mạng không thể dự đoán được nó và thay vào đó hội tụ về giá trị dự kiến rõ ràng.
Khi bị mất L2 (lỗi bình phương trung bình), mạng sẽ hội tụ về hướng nào?
Suy hao L2 được giảm thiểu ở mức trung bình có điều kiện, do đó, với nhiễu mục tiêu độc lập trung bình bằng 0, mạng sẽ tạo ra tín hiệu sạch cơ bản.
Điều gì phải đúng về tiếng ồn được thêm vào mục tiêu để thủ thuật có hiệu quả?
Tiếng ồn mục tiêu cần phải có giá trị trung bình bằng 0 và độc lập về mặt thống kê với tiếng ồn đầu vào để nó đạt mức trung bình trong quá trình huấn luyện.
Việc chuyển từ mất L2 sang mất L1 khiến mạng phục hồi thống kê nào?
Mất mát L1 (lỗi tuyệt đối) được giảm thiểu ở mức trung bình, giúp chống lại nhiễu xung tốt hơn.