Bộ giải mã thần kinh SoundStream
SoundStream là bộ giải mã âm thanh thần kinh đầu cuối của Google giúp nén giọng nói và âm nhạc ở tốc độ bit cực thấp trong khi vẫn duy trì chất lượng.
Tổng quan
Điều này quan trọng vì nó đánh bại các codec truyền thống như Opus ở cùng tốc độ bit và cung cấp năng lượng cho các mẫu âm thanh tổng hợp hiện đại.
Lặn sâu
Được Google giới thiệu vào năm 2021, SoundStream là một codec thần kinh hoàn toàn được xây dựng từ ba phần được đào tạo cùng nhau: một bộ mã hóa tích chập biến dạng sóng thô thành một chuỗi vectơ nhỏ gọn, một bộ lượng tử hóa vectơ dư (RVQ) giúp rời rạc hóa các vectơ đó và một bộ giải mã tích chập giúp tái tạo lại dạng sóng. Nó được đào tạo với cả tổn thất tái thiết và bộ phân biệt đối xử kiểu GAN, do đó, đầu ra nghe có vẻ tự nhiên thay vì chỉ gần về mặt số lượng. Một tính năng nổi bật là đào tạo 'có thể mở rộng' hoặc loại bỏ lượng tử hóa: một mô hình duy nhất có thể hoạt động trên tốc độ bit từ khoảng 3 đến 18 kbps chỉ bằng cách sử dụng nhiều hoặc ít lớp lượng tử hóa khi suy luận mà không cần đào tạo lại. Với tốc độ 3 kbps, nó được cho là vượt trội hơn Opus ở tốc độ 12 kbps trong các bài kiểm tra nghe, xử lý lời nói, âm nhạc và âm thanh chung trong một mô hình có thể chạy trong thời gian thực trên CPU điện thoại thông minh.
Hiểu biết kỹ thuật
Dạng sóng đi qua các vòng xoắn có bước giảm mẫu rất nhiều, tạo ra một lần nhúng trên mỗi khung hình (ví dụ: 75 khung hình/giây). RVQ sau đó mã hóa mỗi lần nhúng dưới dạng một chồng các chỉ mục sổ mã. Tốc độ bit bằng tốc độ khung hình nhân với số lượng bộ lượng tử hóa hoạt động nhân với số bit trên mỗi sổ mã. Việc bỏ qua bộ lượng tử hóa sẽ cắt ngẫu nhiên ngăn xếp RVQ trong quá trình huấn luyện, buộc các sách mã trước đó phải mang thông tin quan trọng nhất để codec xuống cấp một cách duyên dáng ở tốc độ thấp hơn.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của Codec thần kinh SoundStream
SoundStream đã thiết lập mẫu mà các codec sau này như EnCodec và DAC đã cải tiến, đồng thời các mã thông báo rời rạc của nó đã trở thành nền tảng cho các hệ thống tổng hợp như AudioLM và MusicLM. Mong đợi con cháu sẽ hướng tới tốc độ bit thậm chí còn thấp hơn, mã thông báo có cấu trúc ngữ nghĩa đóng vai trò là đầu vào cho trình tạo âm thanh kiểu mô hình ngôn ngữ và triển khai chặt chẽ hơn trên thiết bị cho các cuộc gọi trực tiếp, thiết bị trợ thính và phát trực tuyến trong đó băng thông và độ trễ bị hạn chế chặt chẽ.
Triển khai trong thế giới thực
Nén cuộc gọi thoại xuống ~3 kbps trong khi âm thanh rõ ràng hơn các codec cũ ở tốc độ bit cao hơn
Tạo mã thông báo âm thanh riêng biệt cung cấp các mô hình tổng hợp AudioLM và MusicLM của Google
Truyền phát âm thanh băng thông thấp theo thời gian thực trên thiết bị di động với mã hóa và giải mã trên CPU
Lưu trữ hoặc truyền nhạc và âm thanh xung quanh một cách hiệu quả trong một mô hình duy nhất xử lý tất cả các loại nội dung
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SoundStream Neural Codec quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Bộ giải mã âm thanh thần kinh
Câu hỏi thường gặp
Codec thần kinh SoundStream là gì?
SoundStream là bộ giải mã âm thanh thần kinh đầu cuối của Google giúp nén giọng nói và âm nhạc ở tốc độ bit cực thấp trong khi vẫn duy trì chất lượng. Điều này quan trọng vì nó đánh bại các codec truyền thống như Opus ở cùng tốc độ bit và cung cấp năng lượng cho các mẫu âm thanh tổng hợp hiện đại.
Ba thành phần nào tạo nên kiến trúc SoundStream?
SoundStream được xây dựng từ một bộ mã hóa tích chập, một bộ lượng tử hóa vectơ dư để rời rạc hóa các phần nhúng và một bộ giải mã tích chập, tất cả đều được đào tạo từ đầu đến cuối.
Kỹ thuật nào cho phép một mô hình SoundStream duy nhất phân phát nhiều tốc độ bit khác nhau mà không cần đào tạo lại?
Trong quá trình đào tạo, SoundStream ngẫu nhiên loại bỏ các lớp lượng tử hóa để khi suy luận, bạn có thể sử dụng nhiều hoặc ít mức RVQ hơn để đạt được các tốc độ bit khác nhau từ một mô hình.
Trong các bài kiểm tra nghe của Google, SoundStream ở tốc độ 3 kbps được cho là hoạt động tốt hơn codec nào ở tốc độ 12 kbps?
SoundStream ở tốc độ chỉ 3 kbps phù hợp hoặc đánh bại codec Opus được sử dụng rộng rãi chạy ở tốc độ 12 kbps trong các đánh giá chất lượng chủ quan.
SoundStream sử dụng loại tín hiệu đào tạo bổ sung nào để tạo ra âm thanh đầu ra tự nhiên?
Ngoài những tổn thất trong quá trình tái thiết, SoundStream còn sử dụng các bộ phân biệt đối xử (GAN) để quá trình tái tạo nghe có vẻ thực tế về mặt nhận thức thay vì chỉ đơn thuần là gần giống về mặt số lượng.
Tốc độ bit của SoundStream liên quan như thế nào đến bộ lượng tử hóa của nó?
Tốc độ bit thay đổi theo số lượng lớp RVQ đang hoạt động (lần tốc độ khung hình nhân với số bit trên mỗi sổ mã), do đó, việc thêm bộ lượng tử hóa sẽ tăng tốc độ bit và chất lượng.