HƯỚNG DẪN AI âm thanh

VITS Tổng hợp giọng nói từ đầu đến cuối

VITS là mô hình chuyển văn bản thành giọng nói, biến văn bản trực tiếp thành dạng sóng âm thanh thô trong một hệ thống được đào tạo duy nhất, bỏ qua quy trình hai giai đoạn thông thường.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

By combining variational inference with adversarial training, it produces remarkably natural, expressive speech.

Lặn sâu

VITS (Suy luận đa dạng với học tập đối nghịch để chuyển văn bản thành giọng nói từ đầu đến cuối), được Kim, Kong và Son giới thiệu vào năm 2021, hợp nhất ba ý tưởng mà các hệ thống cũ vẫn tách biệt. Bộ mã hóa tự động biến đổi có điều kiện (VAE) tìm hiểu cách thể hiện giọng nói tiềm ẩn, chuẩn hóa các luồng làm cho phân phối tiềm ẩn đó đủ linh hoạt để thu được chi tiết âm thanh tinh tế và bộ phân biệt kiểu GAN đẩy dạng sóng được tạo về phía hiện thực. Điều quan trọng là VITS đào tạo mô hình âm thanh và bộ phát âm cùng nhau chứ không phải thành hai giai đoạn, loại bỏ sự không khớp làm giảm chất lượng khi các mô-đun được đào tạo riêng biệt. Nó cũng giới thiệu một công cụ dự đoán thời lượng ngẫu nhiên, do đó, cùng một câu có thể được nói với các nhịp điệu nghe tự nhiên khác nhau mỗi lần.

Hiểu biết kỹ thuật

VITS giải quyết vấn đề căn chỉnh bằng Tìm kiếm căn chỉnh đơn điệu (MAS), tìm ra cách ánh xạ tốt nhất giữa mã thông báo văn bản và khung âm thanh trong quá trình đào tạo mà không cần bộ căn chỉnh bên ngoài. Phần sau VAE được tính toán từ âm thanh thực tế, trong khi phần sau được điều chỉnh trước trên văn bản được định hình lại bằng cách chuẩn hóa các luồng để khớp với nó. Khi suy luận, bạn lấy mẫu từ văn bản trước đó và giải mã thẳng thành dạng sóng, do đó không cần mel-Spectrogram riêng biệt và không cần bộ phát âm riêng biệt.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của VITS tổng hợp giọng nói end-to-end

VITS đã tạo ra một nhóm kế thừa thống trị TTS nguồn mở. VITS2 đã đơn giản hóa kiến ​​trúc và cải thiện tính tự nhiên, trong khi YourTTS và Coqui XTTS được sử dụng rộng rãi đã mở rộng phương pháp tiếp cận nhân bản giọng nói không cần ghi âm và nhiều ngôn ngữ. Mong đợi tiếp tục làm việc trên các biến thể trên thiết bị nhẹ hơn, theo thời gian thực, phạm vi đa ngôn ngữ tốt hơn cho các ngôn ngữ có nguồn tài nguyên thấp và kiểm soát chặt chẽ hơn cảm xúc cũng như phong cách nói vì thiết kế toàn diện là nền tảng hấp dẫn, dễ hiểu để xây dựng.

Triển khai trong thế giới thực

Coqui TTS cung cấp các mô hình dựa trên VITS mà các nhà phát triển tinh chỉnh để sao chép giọng nói của người kể chuyện cụ thể cho sách nói.

Trợ lý giọng nói nguồn mở trên phần cứng Raspberry Pi-class sử dụng các mô hình VITS nhỏ gọn để phát ra giọng nói hoàn toàn ngoại tuyến.

Các ứng dụng học ngôn ngữ tạo ra các ví dụ phát âm tự nhiên bằng cách sử dụng các biến thể VITS đa ngôn ngữ như YourTTS.

Các studio trò chơi độc lập tổng hợp các câu thoại NPC khác nhau, dựa vào công cụ dự đoán thời lượng ngẫu nhiên để có nhịp điệu không phải của robot.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the VITS End-to-End Speech Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tổng hợp lời nói cảm xúc

Câu hỏi thường gặp

What is VITS End-to-End Speech Synthesis?

VITS là mô hình chuyển văn bản thành giọng nói, biến văn bản trực tiếp thành dạng sóng âm thanh thô trong một hệ thống được đào tạo duy nhất, bỏ qua quy trình hai giai đoạn thông thường. Bằng cách kết hợp suy luận đa dạng với đào tạo đối nghịch, nó tạo ra lời nói có tính biểu cảm và tự nhiên đáng kể.

Từ viết tắt VITS có nghĩa là gì?

VITS là viết tắt của Suy luận đa dạng với phương pháp học đối nghịch để chuyển văn bản thành giọng nói từ đầu đến cuối, phản ánh ba thành phần cốt lõi của nó.

Sự khác biệt chính về mặt kiến trúc giữa VITS và đường ống TTS truyền thống là gì?

VITS là end-to-end: nó học chuyển văn bản thành dạng sóng trong một mô hình, tránh sự không khớp giữa mô hình âm thanh và bộ mã hóa giọng nói riêng biệt.

VITS tìm hiểu sự căn chỉnh giữa khung văn bản và âm thanh bằng cách nào?

VITS sử dụng Tìm kiếm căn chỉnh đơn điệu để khám phá cách căn chỉnh nội bộ văn bản theo khung tốt nhất mà không cần căn chỉnh bên ngoài.

Tại sao VITS bao gồm công cụ dự đoán thời lượng ngẫu nhiên?

Công cụ dự đoán thời lượng ngẫu nhiên cho phép nói cùng một câu với các nhịp điệu tự nhiên khác nhau, tránh nhịp điệu bằng phẳng, như máy móc.

Thành phần nào đẩy đầu ra VITS hướng tới âm thanh trung thực?

VITS sử dụng chương trình đào tạo đối nghịch (GAN), trong đó người phân biệt sẽ đánh giá xem dạng sóng có phát ra âm thanh chân thực hay không, từ đó cải thiện chất lượng cảm nhận.