Tacotron 2
Tacotron 2 là hệ thống chuyển văn bản thành giọng nói từ đầu đến cuối của Google (2017) biến văn bản viết trực tiếp thành mel-spectrogram, mà một bộ mã hóa thần kinh sẽ chuyển đổi thành giọng nói giống như thật.
Tổng quan
It produced audio rivaling human recordings on key benchmarks.
Lặn sâu
Tacotron 2 có hai phần chính. Đầu tiên, mạng tuần tự với sự chú ý sẽ đọc các ký tự của văn bản và dự đoán từng khung hình mel-spectrogram. Bộ mã hóa biến các ký tự thành dạng biểu diễn ẩn, cơ chế chú ý theo vị trí sẽ căn chỉnh văn bản theo khung âm thanh và bộ giải mã tự hồi quy phát ra biểu đồ phổ trong khi 'mã thông báo dừng' nhận biết khi câu nói kết thúc. Thứ hai, một bộ phát âm WaveNet đã được sửa đổi sẽ chuyển đổi biểu đồ mel đó thành dạng sóng thô. Bằng cách phân chia vấn đề theo cách này, Tacotron 2 học cách phát âm, phát âm và nhịp độ từ dữ liệu với kỹ thuật thủ công tối thiểu. Nó đạt được điểm số ý kiến trung bình gần bằng các bản ghi âm chuyên nghiệp, khiến nó trở thành một bước ngoặt trong việc tổng hợp âm thanh tự nhiên và là khuôn mẫu cho TTS thần kinh sau này.
Hiểu biết kỹ thuật
Mel-Spectrogram là giao diện thông minh giữa hai mạng: nó nhỏ gọn và dễ dàng để mô hình chú ý dự đoán, nhưng vẫn đủ phong phú để bộ phát âm tái tạo lại âm thanh có độ trung thực cao. Sự chú ý nhạy cảm với vị trí sẽ ngăn ngừa các lỗi phổ biến như các từ lặp lại hoặc bị bỏ qua bằng cách xem xét các sắp xếp trước đó và bộ giải mã tự động hồi quy với mã thông báo dừng đã học cho phép mô hình xử lý các câu có độ dài thay đổi một cách duyên dáng.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Tacotron 2
Thiết kế hai giai đoạn của Tacotron 2 đã truyền cảm hứng cho một làn sóng TTS thần kinh. Những phiên bản kế nhiệm không tự hồi quy nhanh hơn như FastSpeech 2 đã loại bỏ bộ giải mã tuần tự để đảm bảo tốc độ và độ ổn định, đồng thời bộ mã hóa WaveNet hiện thường được hoán đổi cho các mô hình HiFi-GAN hoặc khuếch tán. Lĩnh vực này đang hướng tới các hệ thống nhân bản giọng nói hoàn chỉnh từ đầu đến cuối và nhiều loa, biểu cảm và không tiếng vang, nhưng Tacotron 2 vẫn là tài liệu tham khảo nền tảng cho các quy trình dựa trên biểu đồ phổ.
Triển khai trong thế giới thực
Cung cấp giọng nói có âm thanh tự nhiên trong các sản phẩm và trợ lý chuyển văn bản thành giọng nói của Google
Tạo tường thuật biểu cảm cho sách nói và podcast
Cung cấp giọng nói cho trình đọc màn hình và phần mềm trợ năng
Phục vụ như một cơ sở nghiên cứu và ví dụ giảng dạy cho các quy trình TTS thần kinh
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tacotron 2 quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Mô hình điệu điệu
Câu hỏi thường gặp
What is Tacotron 2?
Tacotron 2 là hệ thống chuyển văn bản thành giọng nói từ đầu đến cuối của Google (2017) biến văn bản viết trực tiếp thành mel-spectrogram, mà một bộ mã hóa thần kinh sẽ chuyển đổi thành giọng nói giống như thật. Nó tạo ra âm thanh cạnh tranh với bản ghi âm của con người trên các điểm chuẩn chính.
Tacotron 2 dự đoán biểu diễn trung gian nào từ văn bản?
Mạng tuần tự của Tacotron 2 dự đoán một biểu đồ mel, sau đó bộ mã hóa sẽ chuyển thành âm thanh.
Điều gì chuyển đổi quang phổ của Tacotron 2 thành dạng sóng thực tế?
Tacotron 2 ghép nối bộ dự đoán biểu đồ phổ của nó với bộ phát âm WaveNet đã được sửa đổi để tạo ra âm thanh thô cuối cùng.
Sự chú ý nhạy cảm với vị trí giúp ngăn ngừa vấn đề gì?
Bằng cách xem xét các sắp xếp trước đó, sự chú ý theo vị trí sẽ giảm thiểu các lỗi như lặp lại hoặc bỏ sót từ.
Làm thế nào Tacotron 2 biết khi nào nên ngừng phát âm?
Bộ giải mã tự động dự đoán mã thông báo dừng, cho phép mô hình xử lý các câu có độ dài khác nhau.
Phần chuyển văn bản thành quang phổ sử dụng phong cách kiến trúc tổng thể nào?
Tacotron 2 sử dụng mô hình tuần tự mã hóa-giải mã chú ý đến việc ánh xạ các ký tự vào các khung phổ.