HƯỚNG DẪN AI âm thanh

Tổng hợp âm thanh có thể phân biệt DDSP

DDSP (Xử lý tín hiệu số có thể phân biệt) kết hợp các khối xây dựng bộ tổng hợp cổ điển với mạng thần kinh, do đó, học sâu có thể điều khiển trực tiếp bộ dao động và bộ lọc.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It produces strikingly natural, controllable instrument sounds with tiny models and little data.

Lặn sâu

DDSP, được nhóm Magenta của Google giới thiệu vào năm 2020, xem xét lại việc tạo âm thanh thần kinh. Thay vì mạng dự đoán từng mẫu âm thanh thô (như WaveNet) hoặc pixel của biểu đồ phổ, DDSP tạo ra các thành phần DSP truyền thống — bộ dao động phụ gia hài hòa, bộ tạo nhiễu được lọc và hồi âm — có thể phân biệt được. Điều đó có nghĩa là độ dốc có thể chảy qua chúng trong quá trình đào tạo, do đó, một mạng lưới thần kinh nhỏ sẽ học cách xuất ra các tín hiệu điều khiển có thể hiểu được: cao độ cơ bản, âm lượng tổng thể và biên độ của hàng chục sóng hài theo thời gian. Sau đó, bộ tổng hợp sẽ hiển thị âm thanh thực tế từ các điều khiển này. Vì đặc tính vật lý của âm thanh được đưa vào kiến ​​trúc chứ không phải học từ đầu, nên DDSP đạt được chất lượng cao với ít thông số và ví dụ huấn luyện hơn, đồng thời cho phép người dùng điều khiển cao độ, âm lượng và âm sắc một cách độc lập — thậm chí thực hiện chuyển đổi âm sắc, chẳng hạn như tạo giọng hát khi chơi đàn violin.

Hiểu biết kỹ thuật

Cốt lõi là một bộ tổng hợp mô hình quang phổ: một dãy dao động điều hòa tạo ra tổng các sóng hình sin ở bội số nguyên của tần số cơ bản, trong khi một đường dẫn riêng biệt lọc tiếng ồn trắng để tạo ra hơi thở và kết cấu không điều hòa. Mạng thần kinh không bao giờ xuất ra âm thanh trực tiếp - nó xuất ra các tham số điều khiển thay đổi theo thời gian (f0, âm lượng, phân bố hài hòa, hệ số lọc). Quá trình đào tạo sử dụng sự mất mát phổ phổ nhiều tỷ lệ để so sánh âm thanh được tạo và âm thanh đích trên một số kích thước cửa sổ FFT, rất mạnh đối với sự lệch pha.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của tổng hợp âm thanh khác biệt DDSP

DDSP đang thúc đẩy các công cụ thần kinh và hiệu ứng âm thanh theo thời gian thực, có độ trễ thấp chạy trên phần cứng khiêm tốn, bao gồm cả trong trình duyệt và trên các thiết bị nhúng. Bộ điều khiển có thể hiểu được của nó khiến nó trở nên lý tưởng cho các công cụ biểu diễn biểu cảm và bộ tổng hợp kết hợp nơi các nhạc sĩ quay số âm sắc trực tiếp. Các nhà nghiên cứu đang mở rộng ý tưởng DSP có thể phân biệt sang mô hình vật lý, âm thanh trong phòng và chuỗi sản xuất âm thanh đầy đủ, kết hợp khả năng kiểm soát của quá trình xử lý tín hiệu cổ điển với tính hiện thực của deep learning trong quá trình sáng tạo âm nhạc và thiết kế âm thanh.

Triển khai trong thế giới thực

Các công cụ chuyển âm sắc lấy giai điệu ngân nga hoặc hát và kết xuất lại dưới dạng violin, sáo hoặc kèn trong thời gian thực.

Các plugin tổng hợp thần kinh nhẹ mà các nhạc sĩ điều khiển bằng các nút chỉnh cao độ, âm lượng và độ sáng trực quan.

Hiệu chỉnh cao độ và tái tổng hợp biểu cảm của các nhạc cụ đã ghi trong khi vẫn giữ được chi tiết hài hòa tự nhiên.

Bản demo âm nhạc tương tác dựa trên trình duyệt tạo ra âm thanh nhạc cụ chân thực mà không cần mô hình GPU nặng.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DDSP Differentiable Audio Synthesis quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tổng hợp chuyển văn bản thành âm thanh AudioGen

Câu hỏi thường gặp

What is DDSP Differentiable Audio Synthesis?

DDSP (Xử lý tín hiệu số có thể phân biệt) kết hợp các khối xây dựng bộ tổng hợp cổ điển với mạng thần kinh, do đó, học sâu có thể điều khiển trực tiếp bộ dao động và bộ lọc. Nó tạo ra âm thanh nhạc cụ có thể điều khiển, tự nhiên một cách ấn tượng với các mô hình nhỏ và ít dữ liệu.

Sự đổi mới quan trọng đằng sau DDSP là gì?

DDSP biến các khối xây dựng bộ tổng hợp truyền thống thành các mô-đun có thể phân biệt được, cho phép mạng nơ-ron học cách kiểm soát chúng thông qua lan truyền ngược.

Trong DDSP, mạng lưới thần kinh thực sự xuất ra cái gì?

Mạng dự đoán các tham số điều khiển thay đổi theo thời gian và một bộ tổng hợp khác biệt riêng biệt sẽ kết xuất âm thanh từ chúng — mạng không bao giờ xuất trực tiếp các mẫu.

Bộ tổng hợp quang phổ của DDSP kết hợp hai thành phần tạo âm thanh cốt lõi nào?

Bộ tạo dao động phụ gia hài hòa tạo ra phần cao độ, hài hòa trong khi tiếng ồn được lọc bổ sung thêm hơi thở và kết cấu không hài hòa.

Tại sao DDSP có thể đạt được chất lượng cao với các mô hình tương đối nhỏ và ít dữ liệu?

Do cấu trúc xử lý tín hiệu đã biết được tích hợp sẵn chứ không phải học từ đầu nên mạng ít phải học hơn, cải thiện hiệu suất dữ liệu và tham số.

DDSP sử dụng chức năng mất mát nào để so sánh âm thanh được tạo và âm thanh đích một cách rõ ràng?

Việc so sánh các biểu đồ phổ cường độ ở nhiều độ phân giải rất hiệu quả đối với sự khác biệt về pha, điều mà sự thất thoát ở cấp độ mẫu gặp khó khăn.