HƯỚNG DẪN AI âm thanh

Khuếch tán phong cách StyleTTS 2

StyleTTS 2 là mô hình chuyển văn bản thành giọng nói xử lý 'phong cách' giọng nói - giai điệu, cảm xúc và âm sắc của người nói - như một biến ngẫu nhiên được lấy mẫu bằng mô hình khuếch tán, sau đó tổng hợp âm thanh với quá trình đào tạo đối nghịch dựa trên mô hình ngôn ngữ lời nói lớn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It matters because it reached human-level naturalness on single-speaker benchmarks without needing a reference clip at inference time.

Lặn sâu

StyleTTS 2, do các nhà nghiên cứu tại Đại học Columbia phát hành vào năm 2023, tạo ra giọng nói bằng cách trước tiên lấy mẫu một 'vectơ kiểu' tiềm ẩn bằng cách sử dụng quy trình khuếch tán chỉ dựa trên văn bản đầu vào, sau đó giải mã kiểu đó cùng với các âm vị thành dạng sóng. Vectơ phong cách kiểm soát mọi thứ không được viết trong văn bản: tốc độ nói, đường viền ngữ điệu, khoảng dừng và màu sắc cảm xúc. Điều quan trọng là nó bổ sung quá trình đào tạo đối nghịch với các mô hình ngôn ngữ lời nói được đào tạo trước (WavLM) lớn làm yếu tố phân biệt đối xử, đẩy đầu ra về phía âm thanh thực sự giống con người. Trên điểm chuẩn LJSpeech, nó đã vượt qua bản ghi âm của con người về xếp hạng người nghe và trên LibriTTS nhiều loa, nó phù hợp với sự thật cơ bản — một cột mốc quan trọng về chất lượng TTS thần kinh từ đầu đến cuối.

Hiểu biết kỹ thuật

Bí quyết chính là phổ biến phong cách: thay vì dự đoán một giai điệu cố định, StyleTTS 2 mô hình hóa phong cách dưới dạng phân bố xác suất và các mẫu từ nó thông qua mô hình khuếch tán chạy trong không gian tiềm ẩn có chiều thấp, do đó, cùng một câu có thể được nói theo nhiều cách tự nhiên. Từ đầu đến cuối, bộ dự đoán thời lượng, bộ mã hóa kiểu, bộ giải mã và bộ phân biệt đối nghịch dựa trên WavLM được đào tạo cùng nhau, cho phép độ dốc truyền từ chất lượng dạng sóng trở lại toàn bộ đường dẫn.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của sự lan tỏa phong cách StyleTTS 2

Mong đợi sự phổ biến phong cách sẽ hợp nhất với tính năng sao chép giọng nói không cần quay để một vài giây âm thanh tham chiếu sẽ định hướng phong cách được lấy mẫu và với các tay cầm có thể điều khiển được cho phép người sáng tạo điều chỉnh cảm xúc, điểm nhấn hoặc tốc độ một cách rõ ràng. Các phiên bản chưng cất nhẹ hơn nhằm mục đích cắt giảm việc lấy mẫu khuếch tán nhiều bước để sử dụng trong thời gian thực trên thiết bị. Khi các mô hình này đạt đến chất lượng phát sóng, hình mờ và xác minh sự đồng ý sẽ trở thành tiêu chuẩn để giải quyết các mối lo ngại về việc sử dụng sai mục đích giả mạo giọng nói và giả mạo sâu.

Triển khai trong thế giới thực

Tạo lời tường thuật trong sách nói trong đó cùng một người nói thay đổi giai điệu giữa các chương một cách tự nhiên thay vì phát ra âm thanh đơn điệu

Tạo giọng nói biểu cảm của nhân vật cho các trò chơi và hoạt hình độc lập mà không cần thuê nhiều diễn viên lồng tiếng

Cung cấp năng lượng cho trình đọc màn hình trợ năng có âm thanh đủ giống con người để nghe trong thời gian dài

Tạo giọng thuyết minh e-learning được bản địa hóa với điểm nhấn và nhịp độ tự nhiên từ văn bản tập lệnh đơn giản

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the StyleTTS 2 Style Diffusion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Khuếch tán phổ khuếch tán

Câu hỏi thường gặp

What is StyleTTS 2 Style Diffusion?

StyleTTS 2 là mô hình chuyển văn bản thành giọng nói xử lý 'phong cách' giọng nói - giai điệu, cảm xúc và âm sắc của người nói - như một biến ngẫu nhiên được lấy mẫu bằng mô hình khuếch tán, sau đó tổng hợp âm thanh với quá trình đào tạo đối nghịch dựa trên mô hình ngôn ngữ lời nói lớn. Điều này quan trọng vì nó đã đạt được độ tự nhiên ở cấp độ con người trên các tiêu chuẩn loa đơn mà không cần clip tham chiếu tại thời điểm suy luận.

Mô hình StyleTTS 2 sử dụng quy trình khuếch tán là gì?

StyleTTS 2 lấy mẫu vectơ phong cách có chiều thấp với mô hình khuếch tán, ghi lại các đặc điểm nhịp điệu, cảm xúc và người nói không được văn bản chỉ định.

Mô hình giọng nói được đào tạo trước nào được sử dụng làm công cụ phân biệt đối xử trong StyleTTS 2?

StyleTTS 2 sử dụng các mô hình ngôn ngữ giọng nói lớn như WavLM làm công cụ phân biệt trong đào tạo đối nghịch để đẩy đầu ra về phía âm thanh giống con người.

Tại sao StyleTTS 2 có thể nói cùng một câu theo nhiều cách tự nhiên?

Bởi vì phong cách được coi như một biến số ngẫu nhiên và được lấy mẫu thông qua sự khuếch tán, mỗi thế hệ có thể tạo ra một nhịp điệu khác nhau nhưng tự nhiên cho văn bản giống hệt nhau.

StyleTTS 2 được cho là đã vượt qua bản ghi âm của con người về xếp hạng người nghe ở điểm chuẩn loa đơn nào?

Trên điểm chuẩn LJSpeech, StyleTTS 2 đã đạt được xếp hạng về độ tự nhiên của người nghe vượt xa các bản ghi âm chân thực của con người.

Việc đào tạo 'từ đầu đến cuối' mang lại cho StyleTTS 2 những gì?

Quá trình đào tạo toàn diện chung cho phép sự mất mát về chất lượng âm thanh cuối cùng cập nhật bộ dự đoán thời lượng, bộ mã hóa kiểu và bộ giải mã cùng nhau thay vì ở các giai đoạn riêng biệt.