HƯỚNG DẪN AI âm thanh

Bộ giải mã âm thanh thần kinh

Bộ giải mã âm thanh thần kinh sử dụng công nghệ học sâu để nén âm thanh thành các luồng mã thông báo rời rạc nhỏ và tái tạo lại âm thanh đó với độ trung thực cao.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

They both crush bandwidth for calls and streaming and provide the token vocabulary that audio language models speak.

Lặn sâu

Bộ giải mã âm thanh thần kinh là mạng thần kinh mã hóa-giải mã được đào tạo để nén âm thanh và xây dựng lại nó. Bộ mã hóa biến dạng sóng thành dạng tiềm ẩn nhỏ gọn, bộ lượng tử hóa bắt nhanh các mục tiềm ẩn trong sách mã đã học tạo ra các mã thông báo rời rạc và bộ giải mã tái tạo lại dạng sóng. Kỹ thuật chính là Lượng tử hóa vectơ dư (RVQ), được sử dụng bởi SoundStream của Google và EnCodec của Meta: một số sách mã được xếp chồng lên nhau, mỗi sách mã hóa lỗi còn sót lại của sách mã trước đó, vì vậy bạn có thể đánh đổi tốc độ bit để lấy chất lượng bằng cách sử dụng nhiều hoặc ít sách mã hơn. Những mẫu này đạt chất lượng ấn tượng ở tốc độ bit rất thấp, đôi khi vài kilobit/giây, đánh bại các codec cổ điển như Opus hoặc MP3. Điều quan trọng là các token riêng biệt chính xác là những gì các mô hình như VALL-E và MusicGen tạo ra.

Hiểu biết kỹ thuật

RVQ là trái tim của thiết kế. Sách mã đầu tiên ghi lại giá trị gần đúng thô và mỗi sách mã tiếp theo sẽ lượng tử hóa lỗi dư, phân lớp chi tiết tốt hơn. Quá trình đào tạo kết hợp tổn thất tái thiết, thường ở cả miền thời gian và miền quang phổ, với bộ phân biệt đối nghịch giúp đầu ra nghe có vẻ thực, cộng với tổn thất cam kết giúp đầu ra của bộ mã hóa luôn gần với các mục nhập trong sổ mã đã chọn. Kết quả là một biểu diễn phân cấp, rời rạc, vừa có thể nén vừa dễ dàng cho máy biến áp hạ lưu mô hình hóa.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của Codec âm thanh thần kinh

Codec đang hướng tới tốc độ bit thậm chí còn thấp hơn với ít sách mã hơn, khiến cho việc tạo ra các mô hình ngôn ngữ để tạo ra mã thông báo âm thanh rẻ hơn. Nghiên cứu đang hướng tới các biến thể phát trực tuyến, có độ trễ thấp để liên lạc theo thời gian thực và hướng tới các codec hợp nhất xử lý lời nói, âm nhạc và âm thanh chung trong một mô hình. Khi âm thanh tổng hợp bùng nổ, codec ngày càng được coi là mã thông báo chung cho toàn bộ lĩnh vực, do đó, những cải tiến ở đây sẽ lan tỏa đến mọi mô hình chuyển văn bản thành giọng nói và âm nhạc được xây dựng trên đó.

Triển khai trong thế giới thực

Nén giọng nói cho các cuộc gọi băng thông cực thấp và các ứng dụng kiểu bộ đàm

Cung cấp định dạng mã thông báo riêng biệt mà VALL-E, AudioLM và MusicGen tạo ra

Lưu trữ và phát trực tuyến hiệu quả âm thanh chất lượng cao với tốc độ bit MP3 thấp

Truyền giọng nói theo thời gian thực trong điều kiện mạng bị nhiễu hoặc bị hạn chế

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Audio Codecs quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Bộ giải mã thần kinh SoundStream

Câu hỏi thường gặp

What is Neural Audio Codecs?

Bộ giải mã âm thanh thần kinh sử dụng công nghệ học sâu để nén âm thanh thành các luồng mã thông báo rời rạc nhỏ và tái tạo lại âm thanh đó với độ trung thực cao. Cả hai đều phá hủy băng thông cho các cuộc gọi và phát trực tuyến, đồng thời cung cấp vốn từ vựng mã thông báo mà các mô hình ngôn ngữ âm thanh sử dụng.

Bộ giải mã âm thanh thần kinh chủ yếu làm hai việc gì?

Codec thần kinh là mạng mã hóa-giải mã, nén dạng sóng thành các mã thông báo rời rạc nhỏ gọn và sau đó tái tạo lại âm thanh từ chúng.

Kỹ thuật lượng tử hóa nào là trọng tâm của các codec như SoundStream và EnCodec?

RVQ xếp chồng nhiều sổ mã trong đó mỗi sổ mã hóa lỗi còn sót lại của sổ mã trước đó, cho phép cân bằng giữa chất lượng và tốc độ bit.

Trong Lượng tử hóa vectơ dư, mỗi bảng mã liên tiếp mã hóa những gì?

Sách mã đầu tiên đưa ra giá trị gần đúng thô và mỗi sách mã sau đó sẽ lượng tử hóa lỗi còn lại, bổ sung thêm chi tiết tốt hơn.

Tại sao codec âm thanh thần kinh lại quan trọng đối với các mô hình âm thanh tổng hợp?

Các mã thông báo riêng biệt do codec tạo ra sẽ trở thành từ vựng mà các mô hình ngôn ngữ âm thanh dự đoán và tạo ra.

Việc sử dụng nhiều sách mã hơn trong codec thần kinh ảnh hưởng đến đầu ra như thế nào?

Việc thêm sách mã sẽ tăng tốc độ bit nhưng thu được nhiều chi tiết hơn, cải thiện độ trung thực; sử dụng ít chất lượng giao dịch hơn để nén.