TTS giọng nói tự nhiên và sự khuếch tán tiềm ẩn
NaturalSpeech là một dòng nghiên cứu của Microsoft TTS hướng đến chất lượng giọng nói ở cấp độ con người, với các phiên bản sau sử dụng khả năng khuếch tán tiềm ẩn để tạo ra giọng nói tự nhiên, phong phú.
Tổng quan
Nó cho thấy các mô hình khuếch tán, nổi tiếng với hình ảnh, có thể tạo ra âm thanh biểu cảm và có thể kiểm soát được như thế nào.
Lặn sâu
NaturalSpeech ban đầu (2022) là hệ thống đầu tiên được báo cáo là đạt chất lượng ngang bằng con người trên điểm chuẩn LJSpeech, được đánh giá bởi những người nghe không thể phân biệt một cách đáng tin cậy với bản ghi âm thực. Nó sử dụng một bộ mã hóa tự động đa dạng với các ưu tiên được đối sánh cẩn thận để thu hẹp khoảng cách giữa đào tạo và suy luận. Sau đó, NaturalSpeech 2 đã áp dụng phương pháp khuếch tán tiềm ẩn: lời nói được mã hóa bằng bộ giải mã âm thanh thần kinh thành các vectơ tiềm ẩn liên tục và mô hình khuếch tán sẽ học cách tạo ra các vectơ tiềm ẩn đó từ văn bản, cho phép sao chép giọng nói mạnh mẽ bằng zero-shot từ một dấu nhắc ngắn. NaturalSpeech 3 đã giới thiệu tính năng khuếch tán theo hệ số, tách lời nói thành các thuộc tính rời rạc như nội dung, nhịp điệu, âm sắc và chi tiết âm học, để mỗi thuộc tính có thể được mô hình hóa và kiểm soát độc lập để có độ trung thực và tính linh hoạt cao hơn.
Hiểu biết kỹ thuật
Khuếch tán tiềm ẩn hoạt động bằng cách thêm tiếng ồn vào một biểu diễn giọng nói tiềm ẩn nhỏ gọn và huấn luyện mạng để đảo ngược tiếng ồn đó từng bước. Thay vì khử nhiễu các dạng sóng thô hoặc biểu đồ phổ đầy đủ, NaturalSpeech 2 khử nhiễu các tiềm ẩn codec, có chiều thấp hơn và dễ mô hình hóa hơn. Việc điều chỉnh văn bản và lời nhắc bằng giọng nói tham chiếu sẽ điều khiển quá trình khuếch tán ngược lại, do đó, tiềm ẩn được lấy mẫu cuối cùng sẽ giải mã thành giọng nói phù hợp với nội dung được yêu cầu và nhận dạng người nói.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của giọng nói tự nhiên và TTS khuếch tán tiềm ẩn
TTS dựa trên sự khuếch tán và được phân tích thành hệ số hướng đến những giọng nói không chỉ tự nhiên mà còn có thể điều chỉnh một cách tinh tế, cho phép người dùng điều chỉnh âm sắc, cảm xúc và giai điệu như những vòng quay độc lập. Mong đợi việc lấy mẫu nhanh hơn thông qua quá trình chưng cất và khuếch tán vài bước, sao chép không ảnh mạnh hơn từ vài giây âm thanh và tích hợp chặt chẽ hơn với các mô hình ngôn ngữ lớn để phân phối theo ngữ cảnh. Những tiến bộ này cũng làm tăng nhu cầu về các biện pháp bảo vệ hình mờ và sự đồng ý, vì việc nhân bản có độ chính xác cao làm tăng rõ ràng các rủi ro lạm dụng.
Triển khai trong thế giới thực
Các xưởng lồng tiếng sao chép giọng nói của diễn viên từ một đoạn mẫu ngắn để bản địa hóa phim bằng cách sử dụng phương pháp nhân bản không cảnh quay theo kiểu NaturalSpeech 2.
Nền tảng sách nói tạo ra lời tường thuật ở cấp độ con người mà người nghe khó có thể phân biệt được với tài năng giọng nói thực sự.
Các công cụ trợ năng tái tạo giọng nói của chính một người từ các bản ghi âm cũ cho những người bị mất giọng nói.
Bộ tạo nội dung cho phép người chỉnh sửa điều chỉnh âm sắc và giai điệu một cách độc lập, tận dụng các thuộc tính được phân tích của NaturalSpeech 3.
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the NaturalSpeech and Latent Diffusion TTS quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Khuếch tán tiềm ẩn âm thanh ổn định
Câu hỏi thường gặp
TTS Tự nhiên và Khuếch tán Tiềm ẩn là gì?
NaturalSpeech là một dòng nghiên cứu của Microsoft TTS hướng đến chất lượng giọng nói ở cấp độ con người, với các phiên bản sau sử dụng khả năng khuếch tán tiềm ẩn để tạo ra giọng nói tự nhiên, phong phú. Nó cho thấy các mô hình khuếch tán, nổi tiếng với hình ảnh, có thể tạo ra âm thanh biểu cảm và có thể kiểm soát được như thế nào.
NaturalSpeech ban đầu (2022) được cho là đã đạt được cột mốc quan trọng nào?
NaturalSpeech được báo cáo là hệ thống đầu tiên đạt được chất lượng ngang bằng con người trên LJSpeech, trong đó người nghe không thể phân biệt nó với lời nói thực một cách đáng tin cậy.
Mô hình khuếch tán tiềm ẩn của NaturalSpeech 2 thực sự tạo ra điều gì?
NaturalSpeech 2 khuếch tán qua các vùng tiềm ẩn codec, nhỏ gọn và dễ tạo mô hình hơn các dạng sóng thô, sau đó giải mã chúng thành âm thanh.
Làm thế nào để một mô hình khuếch tán tạo ra dữ liệu ở mức cao?
Khuếch tán thêm tiếng ồn trong quá trình huấn luyện và học cách đảo ngược nó, tạo ra các mẫu bằng cách khử nhiễu dần dần khỏi tiếng ồn ngẫu nhiên.
Khả năng khuếch tán tiềm ẩn mang lại cho NaturalSpeech 2 khả năng chính nào?
Bằng cách điều chỉnh một lời nhắc bằng giọng nói ngắn, NaturalSpeech 2 có thể sao chép giọng nói của người nói mà nó chưa từng được đào tạo rõ ràng.
Ý tưởng chính của 'sự khuếch tán nhân tố' của NaturalSpeech 3 là gì?
Khuếch tán theo hệ số giúp loại bỏ nội dung, giai điệu, âm sắc và chi tiết âm thanh để mỗi thuộc tính có thể được mô hình hóa và kiểm soát riêng biệt.