คู่มือเสียง AI

การแยกก้าน Spleeter

Spleeter เป็นเครื่องมือโอเพ่นซอร์สจาก Deezer ที่แบ่งเพลงที่เสร็จแล้วออกเป็นแทร็กแยกกัน (เสียงร้อง กลอง เบส และอื่นๆ) โดยใช้การเรียนรู้เชิงลึก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It made high-quality stem separation fast, free, and accessible to anyone with a laptop.

เจาะลึก

Spleeter ซึ่งเปิดตัวโดยบริษัทสตรีมมิ่งเพลง Deezer ในปี 2019 ได้แยกการบันทึกแบบมิกซ์ออกเป็นเครื่องดนตรีแต่ละชิ้น โดยมาพร้อมกับรูปแบบที่ฝึกไว้ล่วงหน้าสามรูปแบบ: 2 ก้าน (ร้องนำพร้อมดนตรีประกอบ), 4 ก้าน (ร้องนำ, กลอง, เบส และอื่นๆ) และ 5 ก้าน (ซึ่งเพิ่มเปียโน) ภายใต้ประทุนนั้นใช้โครงข่ายประสาทเทียมแบบ U-Net ซึ่งทำงานบนสเปกโตรแกรมของเสียง โดยคาดการณ์ซอฟต์มาสก์สำหรับแต่ละแหล่ง การคูณมาสก์ด้วยสเปกโตรแกรมดั้งเดิมและการกลับเสียงกลับจะทำให้ได้สเตมแต่ละอัน สิ่งที่ทำให้ Spleeter มีชื่อเสียงคือความเร็ว โดยสามารถแยกเสียงได้เร็วกว่าเรียลไทม์บน GPU ประมาณ 100 เท่า มันถูกใช้กันอย่างแพร่หลายโดยดีเจ รีมิกซ์ ผู้ถอดเสียง และผู้ผลิตคาราโอเกะ และมันจุดประกายให้เกิดคลื่นของตัวแยกที่แข่งขันกันเช่น Demucs

ข้อมูลเชิงลึกทางเทคนิค

Spleeter ทำงานในโดเมนความถี่เวลา เสียงจะถูกแปลงเป็นแมกนิจูดสเปกโตรแกรมผ่านการแปลงฟูริเยร์ช่วงเวลาสั้น (STFT) U-Net (ตัวเข้ารหัส-ตัวถอดรหัสที่มีการเชื่อมต่อแบบข้าม) เรียนรู้ต่อแหล่งที่มา มาสก์ระหว่าง 0 ถึง 1 สำหรับทุกช่องความถี่ สเปกโตรแกรมที่ปิดบังจะรวมตัวใหม่กับเฟสของส่วนผสมดั้งเดิม จากนั้น STFT แบบผกผันจะสร้างรูปคลื่นขึ้นมาใหม่ เนื่องจากเป็นการประมาณค่าซอฟต์มาสก์มากกว่าเสียงดิบ การรั่วไหลและเฟสที่นำกลับมาใช้ใหม่ทำให้เกิดข้อผิดพลาด

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการแยกต้นกำเนิด Spleeter

โมเดลโดเมนรูปคลื่นที่ใหม่กว่า เช่น Demucs และตัวแยกหม้อแปลงแบบไฮบริด ในปัจจุบันเอาชนะ Spleeter ในด้านคุณภาพ โดยสามารถกู้คืนทรานเซียนท์ที่คมชัดกว่าและอาร์ติแฟกต์น้อยลง แนวโน้มนี้อยู่ที่จำนวนก้านที่สูงขึ้น (การแยกกีตาร์แต่ละตัวหรือเสียงร้องสนับสนุน) การแยก DAW และโทรศัพท์แบบเรียลไทม์บนอุปกรณ์ และการผสานรวมเข้ากับแอปสตรีมมิ่งเพื่อการรีมิกซ์หรือการเข้าถึงได้ทันที Spleeter ยังคงเป็นพื้นฐานที่ได้รับความนิยมเนื่องจากมีน้ำหนักเบา ฟรี และใช้งานง่าย แม้ว่าการวิจัยจะผลักดันแนวทางแบบ Phase-Aware และ Generative ก็ตาม

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างแทร็กคาราโอเกะทันทีโดยลบเสียงร้องนำออกจากเพลงโฆษณา

ดีเจและโปรดิวเซอร์แยกก้านกลองหรือเบสเพื่อสร้างรีมิกซ์และแมชอัป

นักเรียนดนตรีแยกเครื่องดนตรีเส้นเดียวออกมาเพื่อถอดเสียงและฝึกฝนไปพร้อมๆ กัน

การกู้คืนหรือทำความสะอาดการบันทึกเก่าโดยการแยกและปรับสมดุลส่วนผสมที่เป็นโคลน

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spleeter Stem Separation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การแยกโดเมนเวลา Conv-TasNet

คำถามที่พบบ่อย

What is Spleeter Stem Separation?

Spleeter เป็นเครื่องมือโอเพ่นซอร์สจาก Deezer ที่แบ่งเพลงที่เสร็จแล้วออกเป็นแทร็กแยกกัน (เสียงร้อง กลอง เบส และอื่นๆ) โดยใช้การเรียนรู้เชิงลึก ทำให้การแยกก้านคุณภาพสูงรวดเร็ว ฟรี และทุกคนที่มีแล็ปท็อปสามารถเข้าถึงได้

บริษัทใดที่ออก Spleeter ในตอนแรก?

Spleeter เปิดตัวเป็นโอเพ่นซอร์สในปี 2019 โดย Deezer บริษัทสตรีมเพลงจากฝรั่งเศส

โมเดล 4 ก้านของ Spleeter แยกเสียงออกเป็นอะไร?

การกำหนดค่า 4 ก้านจะส่งสัญญาณเสียงร้อง กลอง เบส และก้าน 'อื่นๆ' สำหรับอย่างอื่น

Spleeter ใช้สถาปัตยกรรมโครงข่ายประสาทเทียมแบบใด

Spleeter ใช้เครือข่าย Convolutional U-Net ที่ทำนายมาสก์บนสเปกโตรแกรมของเสียง

Spleeter แยกแหล่งข้อมูลเดียวออกจากมิกซ์ได้อย่างไร

เครือข่ายคาดการณ์มาสก์ต่อแหล่งที่มา (ค่า 0 ถึง 1) ที่จะคูณด้วยสเปกโตรแกรมผสม

ข้อใดคือข้อได้เปรียบเชิงปฏิบัติที่สำคัญที่ทำให้ Spleeter ได้รับความนิยม

Spleeter สามารถแยกเสียงได้เร็วกว่าเรียลไทม์บน GPU ประมาณ 100 เท่า ทำให้รวดเร็วและเข้าถึงได้