การสร้างดนตรีเชิงสัญลักษณ์
การสร้างเพลงสัญลักษณ์จะสร้างเพลงในรูปแบบสัญกรณ์ที่มีโครงสร้าง — โน้ต ระดับเสียงสูงต่ำ ระยะเวลา และเวลา (มักจะเป็น MIDI) — แทนที่จะเป็นเสียงดิบ
ภาพรวม
It gives composers editable, instrument-agnostic output they can tweak note by note.
เจาะลึก
แทนที่จะสร้างรูปคลื่นที่เสร็จสมบูรณ์ ระบบสัญลักษณ์จะสร้าง 'สกอร์': ลำดับของโน้ตที่มีระดับเสียงสูงต่ำ ระยะเวลา ความเร็ว และเวลา โดยทั่วไปจะอยู่ในรูปแบบ MIDI หรือเปียโนโรล เนื่องจากเอาต์พุตเป็นแบบสัญลักษณ์ จึงสามารถแก้ไขได้อย่างสมบูรณ์ คุณสามารถเปลี่ยนโน้ตเดี่ยว สลับเครื่องดนตรี สลับคีย์ หรือมอบให้นักแสดงที่เป็นมนุษย์ได้ โปรเจ็กต์สำคัญ ได้แก่ Google MelodyRNN และ MusicVAE ของ Magenta, MuseNet ของ OpenAI (2019) ซึ่งสร้างผลงานการเรียบเรียงเครื่องดนตรีหลายเครื่องดนตรีในหลากหลายสไตล์ และงาน Anticipatory Music Transformer ข้อเสียเปรียบกับเครื่องมือเสียงดิบอย่าง Suno คือโมเดลเชิงสัญลักษณ์ไม่ได้สร้างเสียงจริงหรือเสียงร้องที่สมจริง พวกเขาต้องการซินธิไซเซอร์หรือแซมเพลอร์จึงจะได้ยิน แต่มีความแม่นยำ สามารถควบคุมได้ และนำเสนอข้อมูลขนาดเล็กและรวดเร็ว
ข้อมูลเชิงลึกทางเทคนิค
โมเดลเหล่านี้ปฏิบัติต่อดนตรีเหมือนกับภาษา: โน้ต (หรือกิจกรรมโน้ตเช่น 'note-on', 'note-off', การเปลี่ยนเวลา) จะกลายเป็นโทเค็น และแบบจำลองลำดับ - ในอดีตคือ RNN/LSTM ซึ่งปัจจุบันมักจะเป็น Transformer - ทำนายเหตุการณ์ถัดไป บางคนใช้ VAE เพื่อเรียนรู้พื้นที่แฝงที่ราบรื่น เพื่อให้คุณสามารถสอดแทรกระหว่างท่วงทำนองต่างๆ ได้ เนื่องจากลำดับสัญลักษณ์นั้นสั้นกว่ารูปคลื่นดิบหลายพันเท่า โมเดลเหล่านี้จึงฝึกฝนและสร้างได้เร็วกว่าโมเดลเสียงมาก และเอาต์พุตของพวกมันจะสามารถแก้ไขได้โดยตรงในซอฟต์แวร์บันทึกใดๆ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการสร้างดนตรีเชิงสัญลักษณ์
การสร้างสัญลักษณ์นั้นจับคู่กับเสียงมากขึ้น: Transformer จะแต่งโน้ตเพลง จากนั้นซินธิไซเซอร์หรือแซมเพลอร์ประสาทคุณภาพสูงจะเรนเดอร์ โดยผสมผสานความสามารถในการแก้ไขเข้ากับเสียงที่สมจริง คาดหวังว่าจะมีการผสานรวมเข้ากับ DAW และเครื่องมือบันทึกโน้ตอย่างเข้มงวดยิ่งขึ้นในฐานะ copilots ที่แนะนำฮาร์โมนี เติมเต็มการเรียบเรียง หรือเล่นทำนองตามความต้องการ เมื่อการควบคุมดีขึ้น นักดนตรีมักจะปฏิบัติต่อ AI สัญลักษณ์ในฐานะคู่หูในการแต่งเพลงแบบโต้ตอบ โดยมีไปป์ไลน์สัญลักษณ์บวกเสียงที่เชื่อมช่องว่างกับเอาต์พุตคุณภาพสตูดิโอ
การใช้งานจริงในโลกแห่งความเป็นจริง
นักแต่งเพลงที่ใช้ Google เครื่องมือ Magenta เพื่อสร้างแนวคิดทำนองหรือความสามัคคี จากนั้นจึงแก้ไขโน้ตทีละโน้ตใน DAW
สตูดิโอเกมจะสร้างเพลงพื้นหลัง MIDI ตามขั้นตอนซึ่งปรับให้เข้ากับการเล่นเกมและเรนเดอร์ด้วยเครื่องดนตรีทุกชุด
ซอฟต์แวร์การศึกษาด้านดนตรีที่สร้างแบบฝึกหัดอัตโนมัติและดนตรีประกอบในคีย์และความยากที่เลือก
โปรดิวเซอร์ที่ใช้โมเดลสไตล์ MuseNet เพื่อร่างการเรียบเรียงเครื่องดนตรีหลายเครื่องดนตรีในประเภทต่างๆ จากนั้นจึงปรับแต่งและเรียบเรียงใหม่
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Symbolic Music Generation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
MusicLM การสร้างดนตรีแบบลำดับชั้น
คำถามที่พบบ่อย
What is Symbolic Music Generation?
การสร้างเพลงสัญลักษณ์จะสร้างเพลงในรูปแบบสัญกรณ์ที่มีโครงสร้าง — โน้ต ระดับเสียงสูงต่ำ ระยะเวลา และเวลา (มักจะเป็น MIDI) — แทนที่จะเป็นเสียงดิบ ช่วยให้ผู้แต่งสามารถแก้ไขได้และไม่เชื่อเรื่องอุปกรณ์ตามเครื่องดนตรี โดยสามารถปรับแต่งโน้ตทีละโน้ตได้
จริงๆ แล้ว ดนตรีเชิงสัญลักษณ์ก่อให้เกิดอะไร?
ระบบสัญลักษณ์จะแสดง 'คะแนน' — บันทึกเหตุการณ์ต่างๆ เช่น ระดับเสียง ระยะเวลา และเวลา — แทนที่จะเป็นเสียงจริง
ข้อได้เปรียบที่สำคัญของเอาต์พุตเชิงสัญลักษณ์เหนือการสร้างเสียงดิบคืออะไร
เนื่องจากเอาต์พุตเป็นสัญลักษณ์เชิงสัญลักษณ์ โน้ตทุกตัวจึงสามารถแก้ไขได้และสามารถย้าย เครื่องดนตรีใหม่ หรือดำเนินการโดยมนุษย์ได้
ข้อใดคือโมเดลเพลงสัญลักษณ์ที่รู้จักกันดีจาก OpenAI
MuseNet (2019) สร้างสรรค์ผลงานเชิงสัญลักษณ์ที่มีเครื่องดนตรีหลายเครื่องในสไตล์ดนตรีต่างๆ
โดยทั่วไปแล้วโมเดลสัญลักษณ์สมัยใหม่จะปฏิบัติต่อดนตรีด้วยการคำนวณอย่างไร
โมเดลสัญลักษณ์สร้างโทเค็นเหตุการณ์บันทึก (เช่น การจดบันทึก การจดบันทึก การเลื่อนเวลา) และใช้แบบจำลองลำดับ เช่น Transformers เพื่อทำนายเหตุการณ์ถัดไป
เหตุใดโดยทั่วไปโมเดลสัญลักษณ์จึงฝึกและสร้างได้เร็วกว่าโมเดลเสียงดิบ
ลำดับสัญลักษณ์มีขนาดเล็กกว่าตัวอย่างเสียงหลายล้านตัวอย่างอย่างมาก ดังนั้นโมเดลจึงประมวลผลได้อย่างมีประสิทธิภาพมากขึ้น