HƯỚNG DẪN AI âm thanh

Bộ mã hóa HiFi-GAN và GAN

HiFi-GAN là một bộ mã hóa âm thanh tổng hợp đối nghịch, biến biểu đồ mel thành dạng sóng âm thanh thô gần như ngay lập tức, tạo ra giọng nói chất lượng phòng thu nhanh hơn nhiều so với thời gian thực.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.

Lặn sâu

Bộ mã hóa âm thanh là bước cuối cùng trong hầu hết các quy trình TTS: một mô hình như Tacotron hoặc FastSpeech dự đoán biểu đồ mel (một hình ảnh thu gọn về tần số theo thời gian) và bộ mã hóa âm thanh sẽ điền vào các mẫu dạng sóng thực tế. Các bộ phát âm thần kinh ban đầu như WaveNet nghe có vẻ tuyệt vời nhưng lại tạo ra âm thanh theo từng mẫu, khiến chúng chạy rất chậm. HiFi-GAN, do Kong, Kim và Bae phát hành vào năm 2020, đã thay thế vòng lặp tự hồi quy đó bằng một trình tạo chuyển tiếp nguồn cấp dữ liệu duy nhất được đào tạo một cách đối nghịch. Bí quyết chính của nó là sử dụng nhiều bộ phân biệt để đánh giá âm thanh ở các thang âm khác nhau và theo các mẫu định kỳ khác nhau, buộc trình tạo phải có được cả kết cấu mịn và tần số cao độ phù hợp. Kết quả là giọng nói 22 kHz được tổng hợp nhanh hơn hàng trăm lần so với thời gian thực trên GPU, với chất lượng sánh ngang với âm thanh trung thực.

Hiểu biết kỹ thuật

Trình tạo của HiFi-GAN lấy mẫu biểu đồ phổ mel thông qua các cấu trúc chuyển đổi, với các khối Trường đa tiếp nhận xếp chồng lên nhau kết hợp các kích thước hạt nhân và độ giãn nở khác nhau để thu được các dạng sóng khác nhau. Hai họ bộ phân biệt thực hiện việc kiểm soát: Bộ phân biệt nhiều chu kỳ định hình lại tín hiệu 1D thành lưới 2D ở các số nguyên tố như 2, 3, 5, 7, 11 để nắm bắt tính chu kỳ cao độ và Bộ phân biệt đa tỷ lệ kiểm tra dạng sóng ở một số độ phân giải được lấy mẫu xuống. Mel-spectrogram và tổn thất phù hợp với tính năng giúp quá trình đào tạo ổn định.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của Bộ mã hóa HiFi-GAN và GAN

Bộ mã hóa GAN ngày càng nhỏ hơn và nhanh hơn: các hệ thống kế thừa như BigVGAN thêm các kích hoạt khử răng cưa để khái quát hóa các ca sĩ, nhạc cụ và ngôn ngữ chưa được nhìn thấy, trong khi UnivNet và Vocos hướng tới sự tổng hợp toàn cầu, toàn dải. Các biến thể phát trực tuyến và trên thiết bị hiện chạy mã hóa giọng nói bên trong điện thoại và tai nghe dành cho trợ lý có độ trễ thấp. Các mô hình âm thanh khuếch tán và khớp luồng ngày càng được chắt lọc thành các bộ tạo một lượt kiểu GAN, kết hợp độ trung thực của khuếch tán với tốc độ GAN. Mong đợi bộ phát âm sẽ chuyển sang bộ giải mã âm thanh thần kinh có mục đích chung cung cấp năng lượng cho cả giọng nói và âm nhạc.

Triển khai trong thế giới thực

Tạo đầu ra bằng giọng nói của trợ lý ảo và ứng dụng điều hướng cần phản hồi mà không có độ trễ âm thanh.

Cung cấp năng lượng cho các công cụ sao chép và lồng tiếng giọng nói theo thời gian thực, trong đó biểu đồ mel-spectrogram được nhân bản được hiển thị thành âm thanh có âm thanh tự nhiên.

Thúc đẩy nền tảng tường thuật sách nói và podcast tổng hợp hàng giờ phát biểu một cách nhanh chóng và ít tốn kém.

Đóng vai trò là giai đoạn dạng sóng bên trong bộ tổng hợp giọng hát và trình diễn âm nhạc thông qua bộ phát âm phổ dụng kiểu BigVGAN.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HiFi-GAN and GAN Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Bộ mã hóa WaveGAN song song

Câu hỏi thường gặp

What is HiFi-GAN and GAN Vocoders?

HiFi-GAN là một bộ mã hóa âm thanh tổng hợp đối nghịch, biến biểu đồ mel thành dạng sóng âm thanh thô gần như ngay lập tức, tạo ra giọng nói chất lượng phòng thu nhanh hơn nhiều so với thời gian thực. Nó đã trở thành giai đoạn tiêu chuẩn cuối cùng của quá trình chuyển văn bản thành giọng nói hiện đại vì nó nhanh, nhẹ và khó phân biệt với các bản ghi âm thực.

Công việc chính của bộ phát âm như HiFi-GAN trong quá trình chuyển văn bản thành giọng nói là gì?

Bộ mã hóa âm thanh là giai đoạn cuối cùng tổng hợp các mẫu dạng sóng thực tế từ ảnh phổ mel do mô hình âm thanh tạo ra.

Tại sao HiFi-GAN nhanh hơn nhiều so với bộ phát âm WaveNet trước đây?

WaveNet tạo ra âm thanh theo từng mẫu (tự động hồi quy), trong khi bộ tạo chuyển tiếp nguồn cấp dữ liệu của HiFi-GAN xuất ra dạng sóng trong một lần chụp, đạt tốc độ nhanh hơn nhiều so với thời gian thực.

Công cụ phân biệt nhiều chu kỳ của HiFi-GAN giúp nắm bắt cụ thể điều gì?

Bộ phân biệt nhiều chu kỳ định hình lại dạng sóng 1D thành 2D bằng cách sử dụng các chu kỳ được đánh số nguyên tố để phát hiện cấu trúc tuần hoàn gắn với cao độ.

Bộ phát âm GAN được đào tạo 'ngược lại'. Điều đó có nghĩa là gì ở đây?

Trong thiết lập GAN, trình tạo học cách tạo ra các dạng sóng đủ thực tế để đánh lừa các mạng phân biệt được đào tạo để phân biệt âm thanh thực và âm thanh tổng hợp.

Bộ phát âm sau này mở rộng HiFi-GAN để khái quát hóa tốt hơn các giọng nói, giọng hát và nhạc cụ không thể nhìn thấy?

BigVGAN mở rộng quy mô HiFi-GAN và bổ sung các kích hoạt khử răng cưa định kỳ, cải thiện khả năng khái quát hóa cho âm thanh ngoài phạm vi phân phối như ca hát và nhạc cụ.