HƯỚNG DẪN AI âm thanh

Tách thân cây Spleeter

Spleeter là một công cụ mã nguồn mở của Deezer giúp chia một bài hát đã hoàn thành thành các bản nhạc riêng biệt (giọng hát, trống, bass, v.v.) bằng cách sử dụng deep learning.

Đọc trong 2 phútCập nhật lần cuối

Tổng quan

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

Lặn sâu

Spleeter, được phát hành bởi công ty phát nhạc trực tuyến Deezer vào năm 2019, tách bản ghi âm hỗn hợp thành các thân nhạc cụ riêng lẻ. Nó có ba cấu hình được đào tạo trước: 2 cuống (giọng hát cộng với nhạc đệm), 4 cuống (giọng hát, trống, bass, loại khác) và 5 cuống (có thêm piano). Bên trong nó sử dụng mạng thần kinh tích chập U-Net hoạt động trên biểu đồ phổ của âm thanh, dự đoán mặt nạ mềm cho từng nguồn. Nhân mặt nạ với biểu đồ phổ ban đầu và đảo ngược về âm thanh sẽ tạo ra mỗi thân. Điều khiến Spleeter nổi tiếng là tốc độ: nó có thể tách âm thanh nhanh hơn khoảng 100 lần so với thời gian thực trên GPU. Nó được sử dụng rộng rãi bởi các DJ, người phối âm, người phiên âm và nhà sản xuất karaoke, đồng thời nó đã gây ra một làn sóng phân tách cạnh tranh như Demucs.

Hiểu biết kỹ thuật

Spleeter hoạt động trong miền tần số thời gian. Âm thanh được chuyển đổi thành biểu đồ phổ cường độ thông qua Biến đổi Fourier thời gian ngắn (STFT). Một U-Net (bộ mã hóa-giải mã có kết nối bỏ qua) học, trên mỗi nguồn, mặt nạ từ 0 đến 1 cho mỗi ngăn tần số thời gian. Biểu đồ phổ bị che được kết hợp lại với pha của hỗn hợp ban đầu, sau đó STFT nghịch đảo sẽ tái tạo lại dạng sóng. Bởi vì nó ước tính mặt nạ mềm chứ không phải âm thanh thô, nên rò rỉ và pha tái sử dụng sẽ gây ra hiện tượng giả.

Tác động chiến lược

Truy cập và tiếp cận

Nó cải thiện khả năng tiếp cận thông qua phiên âm, tường thuật và giao diện giọng nói.

Chi phí và ngân sách

Các nhóm truyền thông có thể gửi âm thanh tinh tế nhanh hơn với ngân sách nhỏ hơn.

Tốc độ và tỷ lệ

Các hệ thống hướng tới khách hàng có thể xử lý các tương tác bằng giọng nói ở quy mô lớn hơn.

Tương lai của việc tách thân Spleeter

Các mô hình miền dạng sóng mới hơn như Demucs và bộ tách biến áp lai hiện đã đánh bại Spleeter về chất lượng, khôi phục các chuyển tiếp sắc nét hơn và ít hiện vật hơn. Xu hướng hướng tới số lượng gốc cao hơn (tách từng guitar hoặc giọng hát đệm), tách riêng trên thiết bị theo thời gian thực trong DAW và điện thoại, đồng thời tích hợp vào các ứng dụng phát trực tuyến để phối lại hoặc khả năng truy cập ngay lập tức. Bản thân Spleeter vẫn là một đường cơ sở phổ biến vì nó nhẹ, miễn phí và dễ chạy, ngay cả khi nghiên cứu thúc đẩy các phương pháp tiếp cận theo giai đoạn và tổng quát.

Triển khai trong thế giới thực

Tạo bài hát karaoke tức thì bằng cách loại bỏ giọng ca chính khỏi bài hát thương mại

DJ và nhà sản xuất đang tách riêng thân trống hoặc bass để xây dựng các bản phối lại và mashup

Học sinh âm nhạc trích xuất một dòng nhạc cụ duy nhất để phiên âm và luyện tập cùng với

Khôi phục hoặc làm sạch các bản ghi cũ bằng cách tách và cân bằng lại các hỗn hợp bùn

Rủi ro & lan can

Rủi ro lạm dụng giọng nói và mạo danh sẽ tăng lên khi thiếu sự đồng ý.

Độ chính xác có thể giảm đối với các giọng, phương ngữ hoặc môi trường ồn ào.

Âm thanh tổng hợp có thể bị nhầm lẫn với lời nói đích thực nếu không có nhãn rõ ràng.

Lộ trình thực hiện

1

Nhận được sự đồng ý rõ ràng để thu âm, sao chép và tái sử dụng giọng nói.

2

Kiểm tra chất lượng trên nhiều loa và điều kiện nền khác nhau.

3

Xác định khi nào con người phải xem xét hoặc phê duyệt kết quả đầu ra.

4

Dán nhãn âm thanh tổng hợp và lưu giữ hồ sơ xuất xứ để đảm bảo trách nhiệm giải trình.

Tiếp tục khám phá

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Bắt đầu bài kiểm tra

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Hướng dẫn tiếp theo

Tách miền thời gian Conv-TasNet

Câu hỏi thường gặp

What is Spleeter Stem Separation?

Spleeter là một công cụ mã nguồn mở của Deezer giúp chia một bài hát đã hoàn thành thành các bản nhạc riêng biệt (giọng hát, trống, bass, v.v.) bằng cách sử dụng deep learning. Nó giúp phân tách thân cây chất lượng cao một cách nhanh chóng, miễn phí và có thể truy cập được đối với bất kỳ ai có máy tính xách tay.

Công ty nào ban đầu phát hành Spleeter?

Spleeter được phát hành dưới dạng mã nguồn mở vào năm 2019 bởi Deezer, công ty phát nhạc trực tuyến của Pháp.

Mô hình 4 gốc của Spleeter tách âm thanh thành gì?

Cấu hình 4 thân tạo ra giọng hát, trống, âm trầm và một thân 'khác' cho mọi thứ khác.

Spleeter sử dụng kiến trúc mạng thần kinh nào?

Spleeter sử dụng mạng tích chập U-Net để dự đoán mặt nạ trên biểu đồ phổ của âm thanh.

Làm thế nào Spleeter thực sự trích xuất một nguồn duy nhất từ ​​hỗn hợp?

Mạng dự đoán mặt nạ cho mỗi nguồn (giá trị từ 0 đến 1) được nhân với biểu đồ phổ hỗn hợp.

Lợi thế thực tiễn quan trọng nào khiến Spleeter trở nên phổ biến?

Spleeter có thể tách âm thanh nhanh hơn khoảng 100 lần so với thời gian thực trên GPU, giúp nó nhanh và dễ tiếp cận.