Mô hình ngôn ngữ VALL-E và Codec
VALL-E đã định dạng lại văn bản thành giọng nói như một vấn đề mô hình hóa ngôn ngữ trên mã thông báo codec âm thanh, cho phép sao chép giọng nói chỉ từ ba giây của một mẫu.
Tổng quan
It showed that the same next-token prediction powering text LLMs can generate remarkably natural, expressive speech.
Lặn sâu
Được Microsoft công bố vào đầu năm 2023, VALL-E coi việc tổng hợp giọng nói giống như mô hình hóa ngôn ngữ. Thay vì dự đoán một biểu đồ phổ, nó dự đoán các mã thông báo âm thanh riêng biệt của bộ giải mã thần kinh (EnCodec), do đó, việc tạo mã thông báo tiếp theo sẽ trở thành dự đoán mã thông báo tiếp theo qua từ vựng âm thanh. Với bản ghi âm dài 3 giây của một người nói không nhìn thấy cộng với văn bản mục tiêu, VALL-E tiếp tục bằng giọng nói của người nói đó, bảo toàn âm sắc và thậm chí cả môi trường âm thanh. Nó được đào tạo dựa trên khoảng 60.000 giờ nói, nhiều hơn rất nhiều so với các bộ dữ liệu TTS thông thường, mang lại cho nó khả năng nhân bản không bị bắn mạnh mẽ. Vì mã thông báo codec được xếp lớp (thông qua RVQ), VALL-E sử dụng hai giai đoạn: mô hình tự hồi quy dự đoán luồng mã thông báo thô đầu tiên được điều chỉnh theo lời nhắc và mô hình không tự hồi quy sẽ điền vào các mã thông báo chi tiết còn lại. Công thức codec-LM này đã truyền cảm hứng cho những phiên bản kế thừa như VALL-E 2 và nhiều mô hình nền tảng giọng nói.
Hiểu biết kỹ thuật
Bí quyết là giải mã kết hợp các mã thông báo codec phân cấp. Giai đoạn tự hồi quy dự đoán lần lượt các mã thông báo sách mã đầu tiên quan trọng nhất, nắm bắt nhịp điệu và nội dung. Các sách mã còn lại, bổ sung thêm chi tiết âm thanh tinh tế, được dự đoán song song bằng mô hình không tự hồi quy được điều chỉnh theo luồng đầu tiên và lời nhắc của người phát biểu. Sự phân tách này đảm bảo chất lượng cao trong khi tránh được chi phí tạo ra mọi mã thông báo một cách tuần tự và việc sử dụng codec có nghĩa là giọng nói và văn bản có thể được mô hình hóa bằng cùng một máy biến áp.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của mô hình ngôn ngữ VALL-E và Codec
Các mô hình ngôn ngữ Codec đang hợp nhất lời nói với các mô hình ngôn ngữ lớn, hướng tới các hệ thống thống nhất nghe, suy luận và nói trong một mô hình. Mong đợi sự ổn định tốt hơn và ít hiện vật hơn, tạo luồng phát trực tuyến theo thời gian thực và kiểm soát chặt chẽ hơn cảm xúc và phong cách. Khả năng nhân bản mạnh mẽ tương tự giúp VALL-E trở nên hữu ích cho khả năng truy cập và lồng tiếng cũng làm dấy lên mối lo ngại về deepfake và sự đồng ý, do đó, hình mờ, các biện pháp bảo vệ xác minh giọng nói và các biện pháp bảo vệ chính sách đang trở thành một phần trọng tâm trong cách triển khai các hệ thống này.
Triển khai trong thế giới thực
Sao chép giọng nói từ một vài giây âm thanh cho trợ lý được cá nhân hóa hoặc các công cụ trợ năng giúp khôi phục giọng nói bị mất
Bản địa hóa và lồng tiếng video sang các ngôn ngữ khác trong khi vẫn giữ nguyên âm sắc của người nói gốc
Tạo lời tường thuật biểu cảm, phù hợp với ngữ cảnh để duy trì môi trường âm thanh của bản ghi
Đóng vai trò là xương sống giọng nói trong trợ lý đa phương thức vừa hiểu vừa tạo ra âm thanh giọng nói
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VALL-E and Codec Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Khả năng nổi bật của các mô hình ngôn ngữ lớn
Câu hỏi thường gặp
What is VALL-E and Codec Language Models?
VALL-E đã định dạng lại văn bản thành giọng nói như một vấn đề mô hình hóa ngôn ngữ trên mã thông báo codec âm thanh, cho phép sao chép giọng nói chỉ từ ba giây của một mẫu. Nó cho thấy rằng văn bản LLM hỗ trợ dự đoán mã thông báo tiếp theo tương tự có thể tạo ra lời nói biểu cảm, tự nhiên đáng kể.
Ý tưởng cốt lõi nào giúp phân biệt VALL-E với các hệ thống chuyển văn bản thành giọng nói trước đây?
VALL-E điều chỉnh lại TTS dưới dạng dự đoán mã thông báo tiếp theo trên mã thông báo codec âm thanh riêng biệt, xử lý việc tạo giọng nói giống như một mô hình ngôn ngữ.
VALL-E cần bao nhiêu âm thanh tham chiếu để sao chép giọng nói của người nói mới?
VALL-E có thể thực hiện sao chép giọng nói zero-shot từ mẫu khoảng 3 giây của một người nói không nhìn thấy.
VALL-E sử dụng codec thần kinh nào để tạo mã thông báo âm thanh?
VALL-E được xây dựng trên EnCodec của Meta, dự đoán các mã thông báo âm thanh rời rạc của nó để tổng hợp giọng nói.
Tại sao VALL-E sử dụng cả giai đoạn tự hồi quy và không tự hồi quy?
Mã thông báo Codec được phân cấp thông qua RVQ; VALL-E dự đoán luồng thô đầu tiên một cách tự động và các mã thông báo chi tiết còn lại song song để đạt hiệu quả.
VALL-E đã đào tạo khoảng bao nhiêu dữ liệu giọng nói để cho phép nhân bản không phát âm mạnh mẽ?
VALL-E đã được đào tạo về khoảng 60.000 giờ diễn thuyết, nhiều hơn nhiều so với các bộ dữ liệu TTS thông thường, điều này đã nâng cao khả năng khái quát hóa không cần bắn của nó.