HƯỚNG DẪN AI âm thanh

Tổng hợp tự hồi quy TTS Rùa

Tortoise TTS là một hệ thống chuyển văn bản thành giọng nói mã nguồn mở được đánh giá cao nhờ giọng nói tự nhiên, giàu cảm xúc và khả năng sao chép giọng nói mạnh mẽ chỉ từ một vài clip ngắn.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Tên của nó là một sự đánh đổi: nó chậm nhưng tạo ra giọng nói có chất lượng cao đáng kể.

Lặn sâu

Được tạo bởi James Betker và phát hành vào năm 2022, Tortoise TTS đã mượn ý tưởng từ việc tạo hình ảnh, đặc biệt là các biến áp và khuếch tán tự hồi quy rồi áp dụng chúng vào lời nói. Với một số đoạn clip tham khảo ngắn về giọng nói mục tiêu, nó có thể sao chép giọng nói đó và đọc văn bản tùy ý với nhịp điệu, nhịp độ và cảm xúc thuyết phục. Nó cố tình ưu tiên chất lượng hơn tốc độ, đó là lý do tại sao việc tạo ra có thể mất nhiều giây cho mỗi lần nói, do đó có ẩn dụ về con rùa. Rùa tạo ra một số kết quả đầu ra ứng viên và sử dụng mô hình tính điểm để chọn ra kết quả trung thực nhất. Nó đã trở thành một ứng dụng được cộng đồng yêu thích cho việc lồng tiếng, lồng tiếng cho người hâm mộ và nghiên cứu vì trọng lượng mở cho phép bất kỳ ai thử nghiệm và tính tự nhiên của nó sánh ngang với các hệ thống thương mại cùng thời.

Hiểu biết kỹ thuật

Rùa kết hợp một máy biến áp tự hồi quy để dự đoán các mã thông báo lời nói dựa trên văn bản và nhúng giọng nói tham chiếu, sau đó tinh chỉnh các mã thông báo đó bằng bộ giải mã khuếch tán để tạo ra một biểu đồ mel, cuối cùng được mã hóa thành âm thanh. Một mô hình tính điểm CLVP riêng biệt xếp hạng nhiều thế hệ ứng cử viên dựa trên văn bản, do đó, hệ thống có thể lấy mẫu nhiều lần và giữ lại kết quả tốt nhất, đánh đổi thời gian tính toán để lấy độ chính xác.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của Rùa TTS Tổng hợp tự hồi quy

Rùa đã truyền cảm hứng cho một làn sóng những người kế nhiệm và phân nhánh nhanh hơn nhằm mục đích duy trì chất lượng của nó trong khi cắt giảm độ trễ và các kỹ thuật của nó đã ảnh hưởng đến các hệ thống nhân bản sau này. Định hướng trong tương lai rất rõ ràng: duy trì tính tự nhiên ở cấp độ Rùa trong khi tiếp cận tốc độ thời gian thực, bổ sung khả năng kiểm soát cảm xúc và phong cách tốt hơn, đồng thời kết hợp các mô hình mở như vậy với các biện pháp bảo vệ sự đồng ý và hình mờ khi việc nhân bản giọng nói trở thành xu hướng chủ đạo và được xem xét kỹ lưỡng về mặt đạo đức.

Triển khai trong thế giới thực

Nhân bản giọng nói của người kể chuyện từ các mẫu ngắn để đọc các tập lệnh dài

Tạo giọng nói biểu cảm của nhân vật cho các dự án lồng tiếng và hoạt hình của người hâm mộ

Tạo tin nhắn âm thanh được cá nhân hóa hoặc tường thuật trợ năng

Phục vụ như một cơ sở nghiên cứu để nghiên cứu tổng hợp giọng nói tự phát

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tortoise TTS Autoregressive Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

TTS FastSpeech và không tự động hồi phục

Câu hỏi thường gặp

Tổng hợp tự hồi quy Tortoise TTS là gì?

Tortoise TTS là một hệ thống chuyển văn bản thành giọng nói mã nguồn mở được đánh giá cao nhờ giọng nói tự nhiên, giàu cảm xúc và khả năng sao chép giọng nói mạnh mẽ chỉ từ một vài clip ngắn. Tên của nó là một sự đánh đổi: nó chậm nhưng tạo ra giọng nói có chất lượng cao đáng kể.

Cái tên Rùa TTS gợi ý điều gì?

Ẩn dụ con rùa phản ánh sự đánh đổi có chủ ý giữa việc tạo ra chậm để lấy kết quả rất tự nhiên.

Rùa có thể làm được gì chỉ với vài clip tham khảo ngắn?

Rùa thực hiện nhân bản giọng nói vài lần, tái tạo giọng nói từ một số mẫu ngắn.

Hai gia đình kiểu mẫu nào ảnh hưởng nhiều nhất đến thiết kế của Rùa?

Các kỹ thuật biến đổi và khuếch tán tự hồi quy được điều chỉnh bằng Rùa từ việc tạo hình ảnh đến lời nói.

Rùa chọn như thế nào trong số nhiều ứng cử viên được tạo?

Mô hình tính điểm CLVP xếp hạng các thế hệ ứng viên về mức độ trung thành, giúp Rùa có được kết quả tốt nhất.

Ai đã tạo ra TTS Rùa?

Tortoise TTS được tạo bởi James Betker và phát hành vào khoảng năm 2022.