Nén âm thanh EnCodec
EnCodec là bộ giải mã âm thanh thần kinh có độ trung thực cao của Meta giúp nén giọng nói và âm nhạc ở tốc độ bit rất thấp với chất lượng sánh ngang với các định dạng nặng hơn nhiều.
Tổng quan
It matters because it underpins modern generative audio systems and ships in open-source form for anyone to use.
Lặn sâu
Được phát hành bởi Meta AI vào năm 2022, EnCodec tuân theo bản thiết kế SoundStream của bộ mã hóa, bộ lượng tử hóa vectơ dư (RVQ) và bộ giải mã được đào tạo từ đầu đến cuối nhưng bổ sung thêm một số cải tiến. Nó sử dụng một bộ mã hóa tích chập có khả năng phát trực tuyến, phổ đa tỷ lệ và tổn thất tái tạo miền thời gian cũng như các bộ phân biệt đối nghịch để đảm bảo chất lượng cảm nhận. Một đóng góp đáng chú ý là một mô hình entropy nhỏ dựa trên Transformer giúp nén thêm các mã lượng tử hóa mà không bị mất dữ liệu, loại bỏ các bit bổ sung mà không làm giảm chất lượng. EnCodec cũng giới thiệu một bộ cân bằng tự động cân bằng nhiều tổn thất trong quá trình luyện tập cạnh tranh để chúng luôn ổn định. Nó xử lý âm thanh nổi đơn âm 24 kHz và âm thanh nổi 48 kHz, hoạt động ở các tốc độ bit như 1,5, 3, 6 và 12 kbps và ở tốc độ 6 kbps đạt chất lượng tương đương với MP3 ở tốc độ 64 kbps. Mã thông báo của nó cung cấp năng lượng cho MusicGen và AudioGen của Meta.
Hiểu biết kỹ thuật
Bộ mã hóa của EnCodec lấy mẫu dạng sóng với các vòng xoắn từng bước thành một chuỗi tiềm ẩn mà RVQ chuyển đổi thành các chỉ số sách mã xếp chồng lên nhau. Mô hình ngôn ngữ Transformer nhẹ dự đoán xác suất của các mã thông báo này và mã số học cho chúng, khôi phục khả năng nén thêm miễn phí. Bộ cân bằng huấn luyện điều chỉnh lại tỷ lệ đóng góp của độ dốc từ việc tái cấu trúc, tổn thất quang phổ và tổn thất đối nghịch để không có thuật ngữ đơn lẻ nào chiếm ưu thế, giúp cho quá trình huấn luyện đa mục tiêu ổn định trên toàn bộ phạm vi tốc độ bit.
Tác động chiến lược
Truy cập và tiếp cận
Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.
Chi phí và ngân sách
Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.
Tốc độ và tỷ lệ
Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.
Tương lai của nén âm thanh EnCodec
EnCodec đã là trình mã thông báo mặc định cho một số mô hình âm thanh tổng hợp mở và các mô hình kế thừa của nó đang đẩy độ trung thực cao hơn ở tốc độ bit thấp hơn, tái tạo âm thanh nổi và cấp độ âm nhạc đầy đủ, đồng thời tích hợp chặt chẽ hơn với trình tạo văn bản thành âm thanh và chuyển văn bản thành nhạc. Mong đợi việc áp dụng rộng rãi hơn trong giao tiếp băng thông thấp, phát trực tuyến theo thời gian thực và dưới dạng lớp 'mã thông báo âm thanh' tiêu chuẩn cho phép các kiến trúc kiểu mô hình ngôn ngữ lớn đọc và ghi âm thanh.
Triển khai trong thế giới thực
Mã hóa âm thanh cho trình tạo chuyển văn bản thành âm thanh MusicGen và AudioGen của Meta
Nén giọng nói 24 kHz xuống 1,5-6 kbps để truyền giới hạn băng thông
Mã hóa nhạc âm thanh nổi 48 kHz với chất lượng gần MP3 ở tốc độ bit cao hơn nhiều
Phục vụ như một codec thả vào nguồn mở cho các đường dẫn ML âm thanh và nghiên cứu thông qua các điểm kiểm tra đã phát hành
Rủi ro & lan can
Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.
Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.
Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.
Lộ trình thực hiện
Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.
Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.
Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.
Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.
Tiếp tục khám phá
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the EnCodec Audio Compression quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Hướng dẫn tiếp theo
Học nhúng và biểu diễn âm thanh
Câu hỏi thường gặp
What is EnCodec Audio Compression?
EnCodec là bộ giải mã âm thanh thần kinh có độ trung thực cao của Meta giúp nén giọng nói và âm nhạc ở tốc độ bit rất thấp với chất lượng sánh ngang với các định dạng nặng hơn nhiều. Nó quan trọng vì nó củng cố các hệ thống âm thanh thế hệ hiện đại và cung cấp ở dạng nguồn mở cho bất kỳ ai sử dụng.
Tổ chức nào phát hành EnCodec?
EnCodec được Meta AI (FAIR) giới thiệu vào năm 2022 dưới dạng codec âm thanh thần kinh có độ trung thực cao.
EnCodec bổ sung thêm thành phần nào để nén nhiều hơn từ mã thông báo của nó một cách dễ dàng?
EnCodec huấn luyện một Transformer nhỏ để dự đoán xác suất của mã thông báo và mã hóa số học cho chúng, đạt được khả năng nén không mất dữ liệu bổ sung trên RVQ.
Với tốc độ khoảng 6 kbps, chất lượng của EnCodec được báo cáo là có thể so sánh với MP3 ở tốc độ bit bao nhiêu?
EnCodec ở tốc độ 6 kbps đạt chất lượng chủ quan tương tự như MP3 ở tốc độ 64 kbps, mang lại hiệu quả lớn.
'Bộ cân bằng' của EnCodec giải quyết vấn đề gì trong quá trình đào tạo?
Với nhiều tổn thất (tái tạo, quang phổ, đối nghịch), bộ cân bằng sẽ điều chỉnh lại độ dốc của chúng để không có mục tiêu duy nhất nào chiếm ưu thế, ổn định quá trình đào tạo.
EnCodec chia sẻ phương pháp lượng tử hóa cốt lõi nào với SoundStream?
Giống như SoundStream, EnCodec sử dụng lượng tử hóa vectơ dư để rời rạc hóa phần nhúng bộ mã hóa vào các chỉ mục sách mã xếp chồng lên nhau.