HƯỚNG DẪN AI âm thanh

Tách nhạc mở-Unmix

Open-Unmix (UMX) là một hệ thống deep learning mã nguồn mở chia bài hát thành các phần: giọng hát, trống, bass và các nhạc cụ khác.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

Nó quan trọng như một cơ sở có chất lượng tham chiếu, có thể tái tạo, giúp các nhà nghiên cứu, nhạc sĩ và những người có sở thích có thể tiếp cận việc tách nguồn âm nhạc.

Lặn sâu

Được phát hành vào năm 2019 bởi Stoter, Uhlich, Liutkus và Mitsufuji, Open-Unmix được xây dựng có chủ ý như một đường cơ sở minh bạch, được ghi chép rõ ràng trong PyTorch (với các cổng TensorFlow và NNabla). Nó huấn luyện một mô hình cho mỗi thân mục tiêu trên biểu đồ cường độ của hỗn hợp. Lõi là LSTM hai chiều ba lớp được bao bọc bởi các lớp được kết nối đầy đủ, dự đoán mặt nạ quang phổ cho nguồn mục tiêu. Bởi vì nó hoạt động dựa trên cường độ nên nó tái sử dụng pha của hỗn hợp và tái tạo lại thân thông qua STFT nghịch đảo, được tinh chỉnh tùy ý bằng bộ lọc Wiener đa kênh. Được đào tạo trên tập dữ liệu MUSDB18 mở, nó không theo đuổi điểm số cao nhất trên bảng xếp hạng; mục tiêu của nó là sự rõ ràng và khả năng tái tạo, mang lại cho cộng đồng một điểm so sánh đáng tin cậy và một nền tảng để xây dựng.

Hiểu biết kỹ thuật

Mỗi thân có mạng riêng hoạt động trên biểu đồ cường độ đầu vào. Các ngăn tần số được chuẩn hóa và giảm kích thước bằng một lớp dày đặc, LSTM hai chiều nắm bắt bối cảnh thời gian theo cả hai hướng và các lớp dày đặc hơn nữa sẽ mở rộng trở lại độ phân giải tần số đầy đủ để tạo ra mặt nạ mềm. Nhân mặt nạ với cường độ hỗn hợp sẽ mang lại nguồn ước tính; pha ban đầu được tái sử dụng và bộ lọc Wiener có thể cùng nhau tinh chỉnh tất cả các thân để có kết quả rõ ràng hơn.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của việc tách nhạc Open-Unmix

Open-Unmix đã bị các mô hình dạng sóng như Demucs và hệ thống dạng sóng quang phổ lai vượt qua về chất lượng thô, nhưng vai trò của nó như một tài liệu tham khảo rõ ràng, có thể hack giúp nó phù hợp cho việc giảng dạy và tạo mẫu nhanh. Dự kiến ​​sẽ tiếp tục được sử dụng trong giáo dục và làm cơ sở kiểm tra độ chính xác, trong khi lĩnh vực rộng hơn sẽ chuyển sang các máy phân tách dựa trên máy biến áp và tổ hợp có độ chính xác cao hơn cũng như hướng tới việc phân tách nhiều danh mục dụng cụ chi tiết hơn.

Triển khai trong thế giới thực

Trích xuất một đoạn vocal riêng biệt để tạo thành phiên bản karaoke hoặc nhạc cụ của bài hát.

Kéo thân trống hoặc bass ra để người sản xuất phối lại và lấy mẫu.

Phục vụ như một cơ sở nghiên cứu có thể tái tạo để đánh giá các mô hình phân tách mới trên MUSDB18.

Để học sinh âm nhạc tách biệt một nhạc cụ để nghiên cứu phần của nó trong một bản hòa âm.

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Unmix Music Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Câu hỏi thường gặp

Tách nhạc Open-Unmix là gì?

Open-Unmix (UMX) là một hệ thống deep learning mã nguồn mở chia bài hát thành các phần: giọng hát, trống, bass và các nhạc cụ khác. Nó quan trọng như một cơ sở có chất lượng tham chiếu, có thể tái tạo, giúp các nhà nghiên cứu, nhạc sĩ và những người có sở thích có thể tiếp cận việc tách nguồn âm nhạc.

Open-Unmix làm gì?

Open-Unmix là một hệ thống tách nguồn nhạc giúp chia hỗn hợp thành từng nhạc cụ và thân giọng hát.

Mạng lưới thần kinh nào là cốt lõi của Open-Unmix?

Open-Unmix dự đoán mặt nạ quang phổ sử dụng LSTM hai chiều được bao bọc bởi các lớp được kết nối đầy đủ.

Open-Unmix hoạt động dựa trên cơ sở nào?

Nó hoạt động trên các biểu đồ phổ cường độ, dự đoán mặt nạ và tái sử dụng pha của hỗn hợp để tái thiết.

Tập dữ liệu nào được Open-Unmix đào tạo?

Open-Unmix sử dụng bộ dữ liệu tách nhạc mở MUSDB18 để đào tạo và đánh giá.

Mục tiêu thiết kế chính của Open-Unmix là gì?

Nó được xây dựng như một đường cơ sở rõ ràng, được ghi chép đầy đủ, có thể tái tạo chứ không phải là một hộp đen đạt điểm cao nhất.