คู่มือเสียง AI

การถอดเสียงเพลงอัตโนมัติ

การถอดเสียงเพลงอัตโนมัติ (AMT) จะแปลงเสียงบันทึกดิบของเพลงให้เป็นสัญลักษณ์เชิงสัญลักษณ์ เช่น โน้ตเพลง, MIDI หรือเปียโนโรล

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันแก้ปัญหาที่ยากที่สุดอย่างหนึ่งใน AI เสียง: การแก้โน้ตที่ทับซ้อนกันหลายตัวที่เล่นพร้อมกัน

เจาะลึก

ระบบ AMT จะฟังรูปคลื่นเสียงและเอาต์พุตซึ่งมีการเล่นโน้ต เมื่อเริ่มเล่น ระยะเวลาที่เล่น และบางครั้งเครื่องดนตรีใดที่เล่น ความท้าทายหลักคือโพลีโฟนี: เมื่อโน้ตหลายตัวส่งเสียงพร้อมกัน ฮาร์โมนิคของพวกมันจะทับซ้อนกันและเบลอด้วยกันในสเปกตรัมความถี่ ดังนั้น C และ G ตัวเดียวจึงแยกได้ยากจากโน้ตตัวเดียวที่ดังกว่า ระบบสมัยใหม่แปลงเสียงให้เป็นการแสดงความถี่ตามเวลา เช่น เมล-สเปกโตรแกรมหรือการแปลงค่าคงที่คิว จากนั้นใช้โครงข่ายประสาทเทียมระดับลึกเพื่อคาดการณ์การเริ่มต้นของโน้ต ออฟเซ็ต และระดับเสียงสูงต่ำ โมเดล Onsets and Frames ของ Google เป็นจุดสังเกตสำหรับการถอดเสียงเปียโน ในขณะที่โมเดลทรานส์ฟอร์มเมอร์รุ่นใหม่ๆ เช่น MT3 สามารถถอดเสียงเครื่องดนตรีหลายเครื่องพร้อมกันได้

ข้อมูลเชิงลึกทางเทคนิค

ข้อมูลเชิงลึกที่สำคัญคือการแยกการตรวจจับการโจมตีออกจากการตรวจจับระดับเสียงระดับเฟรม โมเดลอย่าง Onsets และ Frames ใช้ Network Head หนึ่งตัวเพื่อระบุช่วงเวลาที่โน้ตเริ่มต้นอย่างแม่นยำ (เหตุการณ์ที่คมชัดและมีพลัง) และอีกอันเพื่อติดตามว่าเสียงใดดังขึ้นในแต่ละเฟรม การคาดการณ์ที่เริ่มต้นจะควบคุมเอาท์พุตของเฟรม ซึ่งช่วยลดบันทึกย่อปลอมได้อย่างมาก การแปลงค่าคงที่-Q ช่วยได้เนื่องจากจะเว้นช่องความถี่แบบลอการิทึม ซึ่งตรงกับวิธีการแบ่งระดับเสียงดนตรีออกจากกันหนึ่งอ็อกเทฟ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการถอดเสียงเพลงอัตโนมัติ

AMT กำลังเปลี่ยนจากเปียโนเดี่ยวไปสู่การถอดเสียงเครื่องดนตรีหลายเครื่องดนตรีและฟูลแบนด์ที่เชื่อถือได้ รวมถึงกลอง เสียงร้อง และเทคนิคการแสดงอารมณ์ เช่น การโค้งงอและเสียงสั่น สถาปัตยกรรมหม้อแปลงไฟฟ้าที่ได้รับการฝึกอบรมเกี่ยวกับชุดข้อมูลสังเคราะห์ขนาดใหญ่และชุดข้อมูลที่สอดคล้องกันกำลังปิดช่องว่าง คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นกับการแยกแหล่งที่มา การถอดเสียงแบบเรียลไทม์สำหรับการแสดงสด และเครื่องมือที่บันทึกช่วงเวลาย่อยและไดนามิก ไม่ใช่แค่บันทึกย่อ เป้าหมายระยะยาวคือระบบที่จะเปลี่ยนการบันทึกใดๆ ให้เป็นคะแนนที่แก้ไขได้และมนุษย์สามารถอ่านได้

การใช้งานจริงในโลกแห่งความเป็นจริง

AnthemScore และแอปที่คล้ายกันจะแปลงการบันทึก MP3 ให้เป็นโน้ตเพลงที่แก้ไขได้สำหรับนักดนตรีที่เรียนรู้เพลงจากหู

การแยก MIDI จากการบันทึกเสียงเปียโน เพื่อให้โปรดิวเซอร์สามารถเปล่งเสียงใหม่หรือกำหนดปริมาณการแสดงใน DAW

เครื่องมือการศึกษาด้านดนตรีที่เปรียบเทียบโน้ตที่เล่นของนักเรียนกับคะแนนเพื่อแจ้งโน้ตที่ผิดหรือพลาด

นักดนตรีที่ถอดเสียงการบันทึกในอดีตหรือแบบด้นสด (เช่น โซโล่แจ๊ส) มาเป็นโน้ตเพื่อการวิเคราะห์

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Automatic Music Transcription quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างดนตรีเชิงสัญลักษณ์

คำถามที่พบบ่อย

การถอดเสียงเพลงอัตโนมัติคืออะไร?

การถอดเสียงเพลงอัตโนมัติ (AMT) จะแปลงเสียงบันทึกดิบของเพลงให้เป็นสัญลักษณ์เชิงสัญลักษณ์ เช่น โน้ตเพลง, MIDI หรือเปียโนโรล มันจัดการหนึ่งในปัญหาที่ยากที่สุดในเสียง AI: แก้โน้ตที่ทับซ้อนกันหลายอันที่เล่นในคราวเดียว

การถอดเสียงเพลงอัตโนมัติให้เอาท์พุตอะไรเป็นหลัก?

AMT แปลงการบันทึกเสียงเป็นสัญลักษณ์สัญลักษณ์ เช่น MIDI เปียโนโรล หรือแผ่นโน้ตเพลงที่อธิบายโน้ตที่เล่น

เหตุใดเพลงโพลีโฟนิกจึงยากต่อการถอดเสียงเป็นพิเศษ?

เมื่อโน้ตหลายตัวส่งเสียงพร้อมกัน เสียงฮาร์โมนิคจะทับซ้อนกัน ทำให้ยากต่อการแยกแยะว่าเสียงใดมีอยู่บ้าง

สิ่งที่น่าทึ่งเกี่ยวกับโมเดล Onsets and Frames ของ Google

การโจมตีและเฟรมใช้หัวหนึ่งเพื่อตรวจจับการโจมตีของโน้ตที่แม่นยำ และอีกหัวหนึ่งสำหรับระดับเสียงที่ต่อเนื่อง โดยการโจมตีจะกำหนดเอาท์พุตของเฟรม

เหตุใด Constant-Q Transform จึงมีประโยชน์สำหรับดนตรี

ระดับเสียงดนตรีจะถูกเว้นระยะห่างแบบลอการิทึม (ความถี่สองเท่าของอ็อกเทฟ) และถังขยะที่เว้นระยะห่างจากบันทึกของ CQT จะจัดเรียงตามสิ่งนี้ตามธรรมชาติ

'การโจมตี' หมายถึงอะไรในการถอดความ

การโจมตีคือช่วงเวลาที่คมชัดและมีพลังเมื่อโน้ตเริ่มเล่น ซึ่งง่ายต่อการระบุตำแหน่งอย่างแม่นยำมากกว่าการรักษาไว้