HƯỚNG DẪN AI âm thanh

Bộ mã hóa dựa trên dòng chảy WaveGlow

WaveGlow là một bộ mã hóa thần kinh dựa trên dòng chảy của NVIDIA, tổng hợp các dạng sóng giọng nói từ các ảnh phổ mel trong một lần truyền mà không có quá trình tự hồi quy.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it delivers high-quality audio faster than real time using only a simple likelihood loss.

Lặn sâu

WaveGlow, được phát hành bởi Prenger, Valle và Catanzaro tại NVIDIA vào năm 2018, kết hợp các ý tưởng từ Glow và WaveNet để xây dựng một bộ phát âm vừa nhanh vừa dễ đào tạo. Không giống như bộ mã hóa GAN, nó là một luồng chuẩn hóa: nó học cách ánh xạ không thể đảo ngược giữa phân bố Gaussian đơn giản và dạng sóng âm thanh, được điều chỉnh trên biểu đồ mel. Quá trình đào tạo tối đa hóa khả năng ghi nhật ký chính xác của dữ liệu, do đó, nó không cần có bộ phân biệt đối xử riêng biệt, không có hồi quy tự động và không cần có sự chắt lọc giữa giáo viên và học sinh hai mạng mà các phương pháp WaveNet song song trước đó yêu cầu. Để tạo ra âm thanh, bạn lấy mẫu nhiễu Gaussian và chạy ngược lại mạng có thể đảo ngược. WaveGlow tạo ra giọng nói có chất lượng tương đương với WaveNet trong khi tổng hợp nhanh hơn nhiều so với thời gian thực trên GPU hiện đại.

Hiểu biết kỹ thuật

WaveGlow sắp xếp các bước dòng chảy có thể đảo ngược, mỗi bước kết hợp một lớp ghép affine với tích chập 1x1 có thể đảo ngược được mượn từ Glow. Các mẫu âm thanh được nhóm thành các vectơ thông qua thao tác nén để các lớp ghép có thể biến đổi chúng một cách hiệu quả. Bởi vì mỗi bước đều có thể đảo ngược nên hướng thuận sẽ tính toán khả năng huấn luyện và hướng ngược lại ánh xạ nhiễu thành âm thanh để suy luận. Một mạng duy nhất và một mục tiêu có khả năng ghi nhật ký âm giúp cho việc đào tạo trở nên ổn định và đơn giản một cách đáng chú ý.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của Bộ mã hóa dựa trên dòng chảy WaveGlow

WaveGlow đã chứng minh rằng bộ mã hóa luồng thuần túy có thể cạnh tranh với chất lượng tự hồi quy, ảnh hưởng đến các mô hình âm thanh phù hợp với luồng và luồng sau này. Tính đơn giản khi mất một lần của nó vẫn hấp dẫn, mặc dù các bộ phát âm GAN như HiFi-GAN hiện nay thường chiếm ưu thế về kích thước và tốc độ. Nhìn về phía trước, các ý tưởng dựa trên dòng chảy và kết hợp dòng chảy đang xuất hiện trở lại trong TTS liền kề khuếch tán hiện đại và các thiết kế đảo ngược kiểu WaveGlow tiếp tục cung cấp thông tin nghiên cứu về khả năng tạo dạng sóng hiệu quả, có thể kiểm soát và có khả năng chính xác.

Triển khai trong thế giới thực

Ghép nối với Tacotron 2 trong quy trình TTS tham chiếu của NVIDIA để tạo ra giọng nói tự nhiên có chất lượng phòng thu

Tổng hợp giọng nói GPU nhanh cho quy trình tường thuật, lồng tiếng và tạo nội dung

Tạo âm thanh đào tạo và demo trong nghiên cứu trong đó ưu tiên đào tạo ổn định, mất một lần

Đầu ra giọng nói có khả năng theo thời gian thực trong các hệ thống tương tác chạy trên phần cứng NVIDIA

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveGlow Flow-Based Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tạo giọng nói khớp với luồng hộp thoại

Câu hỏi thường gặp

What is WaveGlow Flow-Based Vocoder?

WaveGlow là một bộ mã hóa thần kinh dựa trên dòng chảy của NVIDIA, tổng hợp các dạng sóng giọng nói từ các ảnh phổ mel trong một lần truyền mà không có quá trình tự hồi quy. Điều này quan trọng vì nó mang lại âm thanh chất lượng cao nhanh hơn thời gian thực mà chỉ có khả năng mất âm thanh đơn giản.

WaveGlow kết hợp ý tưởng kiến ​​trúc từ hai mô hình nào?

WaveGlow kết hợp cấu trúc dòng không thể đảo ngược của Glow với thiết kế mô hình hóa âm thanh của WaveNet.

WaveGlow là loại mô hình nào?

WaveGlow là một luồng chuẩn hóa tìm hiểu ánh xạ không thể đảo ngược giữa nhiễu Gaussian và âm thanh.

WaveGlow tạo ra dạng sóng tại thời điểm suy luận như thế nào?

Vì mạng không thể đảo ngược nên bạn vẽ nhiễu Gaussian và cho dòng chảy ngược lại, được điều chỉnh trên biểu đồ mel.

WaveGlow tối ưu hóa mục tiêu nào trong quá trình đào tạo?

Là một luồng, WaveGlow tối đa hóa khả năng ghi nhật ký chính xác, không yêu cầu sự phân biệt hay chắt lọc.

Hai thành phần nào tạo nên mỗi bước có thể đảo ngược trong WaveGlow?

Mỗi bước luồng sẽ ghép một lớp ghép affine với tích chập 1x1 có thể đảo ngược được áp dụng từ Glow.