HƯỚNG DẪN AI âm thanh

Bộ phát âm khuếch tán DiffWave

DiffWave là một bộ mã hóa dựa trên khuếch tán, tổng hợp âm thanh bằng cách khử nhiễu ngẫu nhiên lặp đi lặp lại thành dạng sóng, được điều chỉnh trên biểu đồ mel.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It brought diffusion models to high-fidelity speech, rivaling GANs and WaveNet without adversarial training.

Lặn sâu

DiffWave, được giới thiệu bởi Kong et al. vào năm 2020, áp dụng khung mô hình xác suất khuếch tán khử nhiễu cho âm thanh thô. Trong quá trình huấn luyện, nó dần dần thêm nhiễu Gaussian vào dạng sóng rõ ràng qua nhiều bước, sau đó học mạng để dự đoán và loại bỏ nhiễu đó ở mỗi bước. Tại thời điểm tạo ra, nó bắt đầu từ tiếng ồn thuần túy và chạy quy trình ngược lại, dựa trên biểu đồ mel, để khôi phục giọng nói trong trẻo. Xương sống là một mạng tích chập giãn nở, không tự hồi quy giống như WaveNet nhưng dự đoán nhiễu hơn là dự đoán mẫu. DiffWave phù hợp với các bộ phát âm mạnh về chất lượng và đặc biệt mạnh mẽ, thậm chí tạo ra giọng nói vô điều kiện hợp lý và kết quả nhất quán trên các loa. Sự đánh đổi chính là tốc độ: việc lấy mẫu ban đầu cần hàng chục đến hàng nghìn bước, mặc dù lịch trình nhanh chóng cắt giảm con số này xuống chỉ còn sáu.

Hiểu biết kỹ thuật

DiffWave tìm hiểu độ dốc của phân phối dữ liệu bằng cách đào tạo mạng để dự đoán nhiễu được thêm vào ở bước khuếch tán ngẫu nhiên, sử dụng mục tiêu L2 có trọng số đơn giản. Việc lấy mẫu đảo ngược lịch trình tiếng ồn cố định và số bước đánh đổi chất lượng lấy tốc độ; các nhà nghiên cứu nhận thấy lịch trình ngắn gọn được lựa chọn cẩn thận gồm khoảng sáu bước sẽ đảm bảo độ chính xác cao nhất, biến quy trình hàng nghìn bước thành một thứ gì đó gần gũi hơn với thực tế.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của bộ mã hóa khuếch tán DiffWave

DiffWave đã khởi động các bộ mã hóa khuếch tán và các phiên bản kế thừa nhanh hơn như PriorGrad và FastDiff giúp giảm số bước. Lĩnh vực này đang hội tụ các kỹ thuật chưng cất và mô hình nhất quán nhằm mục đích lấy mẫu khuếch tán một bước, thu hẹp khoảng cách về tốc độ với bộ phát âm GAN trong khi vẫn duy trì khả năng huấn luyện ổn định và mạnh mẽ của khuếch tán. Mong đợi các ý tưởng phổ biến sẽ lan rộng hơn nữa vào âm nhạc, bộ giải mã thần kinh và việc tạo ra âm thanh phổ quát nơi phạm vi phủ sóng của chế độ đóng vai trò quan trọng.

Triển khai trong thế giới thực

Phần cuối của tính năng chuyển văn bản thành giọng nói thần kinh có độ chính xác cao giúp tránh quá trình đào tạo GAN không ổn định

Tạo giọng nói vô điều kiện để tăng cường dữ liệu và nghiên cứu âm thanh

Tổng hợp giọng nói mạnh mẽ của loa trong đó một mô hình xử lý nhiều giọng nói một cách nhất quán

Nền tảng thử nghiệm cho nghiên cứu khuếch tán lấy mẫu nhanh, áp dụng lịch trình tiếng ồn ngắn cho âm thanh thời gian thực

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DiffWave Diffusion Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Khuếch tán tiềm ẩn âm thanh ổn định

Câu hỏi thường gặp

What is DiffWave Diffusion Vocoder?

DiffWave là một bộ mã hóa dựa trên khuếch tán, tổng hợp âm thanh bằng cách khử nhiễu ngẫu nhiên lặp đi lặp lại thành dạng sóng, được điều chỉnh trên biểu đồ mel. Nó mang đến các mô hình khuếch tán cho bài phát biểu có độ trung thực cao, sánh ngang với GAN và WaveNet mà không cần đào tạo đối nghịch.

DiffWave tạo ra âm thanh tại thời điểm suy luận như thế nào?

DiffWave bắt đầu từ nhiễu Gaussian và thực hiện quá trình khuếch tán ngược, khử nhiễu liên tục trong khi điều hòa trên biểu đồ mel, để tạo ra dạng sóng.

Mạng DiffWave thực sự học được gì để dự đoán trong quá trình đào tạo?

DiffWave huấn luyện mạng để dự đoán nhiễu Gaussian được thêm vào ở bước khuếch tán được chọn ngẫu nhiên, sử dụng tổn thất L2 có trọng số.

Hạn chế thực tế chính của DiffWave so với bộ phát âm GAN là gì?

Lấy mẫu khuếch tán ngây thơ cần nhiều bước ngược lại; mặc dù lịch trình nhanh có ích nhưng quá trình lặp lại là chi phí chính về tốc độ.

DiffWave có lợi thế gì so với bộ phát âm GAN trong đào tạo?

Các mô hình khuếch tán được huấn luyện với mục tiêu kiểu hồi quy ổn định, tránh sự mất ổn định mà quá trình huấn luyện GAN đối thủ có thể gặp phải.

Mạng dự đoán tiếng ồn của DiffWave giống với kiến trúc nào?

DiffWave sử dụng xương sống không tự hồi quy gồm các tích chập giãn tương tự như WaveNet, nhưng nó dự đoán tiếng ồn thay vì các mẫu âm thanh.