Bộ mã hóa HiFi-GAN và GAN
HiFi-GAN là một bộ mã hóa âm thanh tổng hợp đối nghịch, biến biểu đồ mel thành dạng sóng âm thanh thô gần như ngay lập tức, tạo ra giọng nói chất lượng phòng thu nhanh hơn nhiều so với thời gian thực.
Tổng quan
It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.
Lặn sâu
Bộ mã hóa âm thanh là bước cuối cùng trong hầu hết các quy trình TTS: một mô hình như Tacotron hoặc FastSpeech dự đoán biểu đồ mel (một hình ảnh thu gọn về tần số theo thời gian) và bộ mã hóa âm thanh sẽ điền vào các mẫu dạng sóng thực tế. Các bộ phát âm thần kinh ban đầu như WaveNet nghe có vẻ tuyệt vời nhưng lại tạo ra âm thanh theo từng mẫu, khiến chúng chạy rất chậm. HiFi-GAN, do Kong, Kim và Bae phát hành vào năm 2020, đã thay thế vòng lặp tự hồi quy đó bằng một trình tạo chuyển tiếp nguồn cấp dữ liệu duy nhất được đào tạo một cách đối nghịch. Bí quyết chính của nó là sử dụng nhiều bộ phân biệt để đánh giá âm thanh ở các thang âm khác nhau và theo các mẫu định kỳ khác nhau, buộc trình tạo phải có được cả kết cấu mịn và tần số cao độ phù hợp. Kết quả là giọng nói 22 kHz được tổng hợp nhanh hơn hàng trăm lần so với thời gian thực trên GPU, với chất lượng sánh ngang với âm thanh trung thực.
Hiểu biết kỹ thuật
Trình tạo của HiFi-GAN lấy mẫu biểu đồ phổ mel thông qua các cấu trúc chuyển đổi, với các khối Trường đa tiếp nhận xếp chồng lên nhau kết hợp các kích thước hạt nhân và độ giãn nở khác nhau để thu được các dạng sóng khác nhau. Hai họ bộ phân biệt thực hiện việc kiểm soát: Bộ phân biệt nhiều chu kỳ định hình lại tín hiệu 1D thành lưới 2D ở các số nguyên tố như 2, 3, 5, 7, 11 để nắm bắt tính chu kỳ cao độ và Bộ phân biệt đa tỷ lệ kiểm tra dạng sóng ở một số độ phân giải được lấy mẫu xuống. Mel-spectrogram và tổn thất phù hợp với tính năng giúp quá trình đào tạo ổn định.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Bộ mã hóa HiFi-GAN và GAN
Bộ mã hóa GAN ngày càng nhỏ hơn và nhanh hơn: các hệ thống kế thừa như BigVGAN thêm các kích hoạt khử răng cưa để khái quát hóa các ca sĩ, nhạc cụ và ngôn ngữ chưa được nhìn thấy, trong khi UnivNet và Vocos hướng tới sự tổng hợp toàn cầu, toàn dải. Các biến thể phát trực tuyến và trên thiết bị hiện chạy mã hóa giọng nói bên trong điện thoại và tai nghe dành cho trợ lý có độ trễ thấp. Các mô hình âm thanh khuếch tán và khớp luồng ngày càng được chắt lọc thành các bộ tạo một lượt kiểu GAN, kết hợp độ trung thực của khuếch tán với tốc độ GAN. Mong đợi bộ phát âm sẽ chuyển sang bộ giải mã âm thanh thần kinh có mục đích chung cung cấp năng lượng cho cả giọng nói và âm nhạc.
Triển khai trong thế giới thực
Tạo đầu ra bằng giọng nói của trợ lý ảo và ứng dụng điều hướng cần phản hồi mà không có độ trễ âm thanh.
Cung cấp năng lượng cho các công cụ sao chép và lồng tiếng giọng nói theo thời gian thực, trong đó biểu đồ mel-spectrogram được nhân bản được hiển thị thành âm thanh có âm thanh tự nhiên.
Thúc đẩy nền tảng tường thuật sách nói và podcast tổng hợp hàng giờ phát biểu một cách nhanh chóng và ít tốn kém.
Đóng vai trò là giai đoạn dạng sóng bên trong bộ tổng hợp giọng hát và trình diễn âm nhạc thông qua bộ phát âm phổ dụng kiểu BigVGAN.
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the HiFi-GAN and GAN Vocoders quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bộ mã hóa WaveGAN song song
Câu hỏi thường gặp
What is HiFi-GAN and GAN Vocoders?
HiFi-GAN là một bộ mã hóa âm thanh tổng hợp đối nghịch, biến biểu đồ mel thành dạng sóng âm thanh thô gần như ngay lập tức, tạo ra giọng nói chất lượng phòng thu nhanh hơn nhiều so với thời gian thực. Nó đã trở thành giai đoạn tiêu chuẩn cuối cùng của quá trình chuyển văn bản thành giọng nói hiện đại vì nó nhanh, nhẹ và khó phân biệt với các bản ghi âm thực.
Công việc chính của bộ phát âm như HiFi-GAN trong quá trình chuyển văn bản thành giọng nói là gì?
Bộ mã hóa âm thanh là giai đoạn cuối cùng tổng hợp các mẫu dạng sóng thực tế từ ảnh phổ mel do mô hình âm thanh tạo ra.
Tại sao HiFi-GAN nhanh hơn nhiều so với bộ phát âm WaveNet trước đây?
WaveNet tạo ra âm thanh theo từng mẫu (tự động hồi quy), trong khi bộ tạo chuyển tiếp nguồn cấp dữ liệu của HiFi-GAN xuất ra dạng sóng trong một lần chụp, đạt tốc độ nhanh hơn nhiều so với thời gian thực.
Công cụ phân biệt nhiều chu kỳ của HiFi-GAN giúp nắm bắt cụ thể điều gì?
Bộ phân biệt nhiều chu kỳ định hình lại dạng sóng 1D thành 2D bằng cách sử dụng các chu kỳ được đánh số nguyên tố để phát hiện cấu trúc tuần hoàn gắn với cao độ.
Bộ phát âm GAN được đào tạo 'ngược lại'. Điều đó có nghĩa là gì ở đây?
Trong thiết lập GAN, trình tạo học cách tạo ra các dạng sóng đủ thực tế để đánh lừa các mạng phân biệt được đào tạo để phân biệt âm thanh thực và âm thanh tổng hợp.
Bộ phát âm sau này mở rộng HiFi-GAN để khái quát hóa tốt hơn các giọng nói, giọng hát và nhạc cụ không thể nhìn thấy?
BigVGAN mở rộng quy mô HiFi-GAN và bổ sung các kích hoạt khử răng cưa định kỳ, cải thiện khả năng khái quát hóa cho âm thanh ngoài phạm vi phân phối như ca hát và nhạc cụ.