คู่มือเสียง AI

MusicLM: โทเค็นความหมายและอะคูสติกแบบลำดับชั้น

MusicLM คือโมเดลการแปลงข้อความเป็นเพลงของ Google ที่สร้างเสียงแบบยาวผ่านลำดับชั้นของโทเค็นความหมายสำหรับโครงสร้างดนตรีและโทเค็นอะคูสติกสำหรับรายละเอียดเสียง

อ่าน 2 นาทีอัปเดตล่าสุด

เจาะลึก

ประกาศโดย Google การวิจัยเมื่อต้นปี 2023 MusicLM วางกรอบการสร้างเพลงเป็นการทำนายลำดับของโทเค็นเสียงที่แยกจากกัน เหมือนกับที่โมเดลภาษาทำนายคำศัพท์ โดยจะใช้ลำดับชั้นของการเป็นตัวแทน: โทเค็นความหมาย (จากโมเดลที่เรียกว่า w2v-BERT) จับโครงสร้างระดับสูง เช่น เมโลดี้และจังหวะในช่วงระยะยาว ในขณะที่โทเค็นอะคูสติก (จากตัวแปลงสัญญาณประสาท SoundStream) จับรายละเอียดเล็กๆ น้อยๆ เช่น เสียงร้องและพื้นผิว ขั้นแรกจะสร้างโทเค็นความหมายจากข้อความพร้อมท์ จากนั้นขั้นตอนต่อมาจะเติมรายละเอียดเสียงที่มีเงื่อนไขตามความหมายเหล่านั้น การปรับสภาพข้อความมาจาก MuLM/MuLan ซึ่งเป็นการฝังข้อความเพลงร่วมที่ได้รับการฝึกเพื่อให้คำอธิบายและเสียงอยู่ในพื้นที่เดียวกัน วิธีการแบบเป็นฉากนี้ช่วยให้ MusicLM คงความสอดคล้องทางดนตรีไว้เป็นเวลาไม่กี่นาที แทนที่จะลอยไปในเวลาไม่กี่วินาที

ข้อมูลเชิงลึกทางเทคนิค

แนวคิดหลักคือการแยกโครงสร้างออกจากพื้นผิวข้ามลำดับชั้นโทเค็น โทเค็นความหมายแบบหยาบนั้นกระจัดกระจายและเปลี่ยนแปลงช้า ดังนั้น Transformer สามารถสร้างแบบจำลองรูปแบบระยะยาวโดยไม่ต้องมีลำดับที่ยาวมาก โทเค็นเสียงมีความหนาแน่นและมีอัตราสูง แต่เพียงต้องคาดการณ์เงื่อนไขตามซีแมนทิกส์ที่กำหนดไว้แล้ว ซึ่งจะทำให้แต่ละขั้นตอนสามารถเข้าใจได้ การหาปริมาณเวกเตอร์ตกค้างของ SoundStream จะสร้างโค้ดอะคูสติกแบบเป็นชั้นๆ ซึ่งตัวถอดรหัสสุดท้ายจะเปลี่ยนกลับเป็นรูปแบบคลื่น 24 kHz

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ MusicLM: โทเค็นความหมายและอะคูสติกแบบลำดับชั้น

วิธีการโทเค็นแบบลำดับชั้นของ MusicLM กลายเป็นเทมเพลตสำหรับระบบรุ่นหลัง เช่น MusicGen และเครื่องมือเพลงเชิงพาณิชย์ คาดว่าจะมีการปรับสภาพเมโลดี้ที่แน่นขึ้น (ฮัมเพลง รับการเรียบเรียงเต็มรูปแบบ) เพลงที่มีโครงสร้างเต็มรูปแบบยาวขึ้นพร้อมท่อนท่อนและคอรัส และสามารถควบคุมเครื่องดนตรีและคีย์ได้ดีขึ้น ปัญหายุ่งยากคือเรื่องกฎหมายและจริยธรรม: การให้สิทธิ์การใช้งานข้อมูลการฝึกอบรม ความยินยอมของศิลปิน และการสร้างลายน้ำให้กับเสียงเพื่อให้สามารถแยกความแตกต่างจากเพลงที่มนุษย์สร้างขึ้นได้กลายมาเป็นหัวใจสำคัญของการใช้งานแล้ว

การใช้งานจริงในโลกแห่งความเป็นจริง

เปลี่ยนคำอธิบายฉากที่เป็นลายลักษณ์อักษรให้เป็นเพลงประกอบภาพยนตร์หรือตัวอย่าง เช่น 'มหากาพย์ออเคสตราสร้างพร้อมคณะนักร้องประสานเสียง'

การสร้างเพลงพื้นหลังตามคำบรรยายภาพ หรือแม้แต่คำอธิบายการวาดภาพสำหรับงานศิลปะจัดวาง

ขยายทำนองฮัมเพลงสั้นหรือเสียงหวีดหวิวให้เป็นการเรียบเรียงเครื่องดนตรีเต็มรูปแบบ

การผลิตแทร็กเพลงสต็อกที่หลากหลายในจังหวะและอารมณ์ที่แตกต่างกันสำหรับการโฆษณาและผู้สร้างเนื้อหา

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicLM: Hierarchical Semantic and Acoustic Tokens quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การสร้างดนตรีเชิงสัญลักษณ์

คำถามที่พบบ่อย

What is MusicLM: Hierarchical Semantic and Acoustic Tokens?

MusicLM คือโมเดลการแปลงข้อความเป็นเพลงของ Google ที่สร้างเสียงแบบยาวผ่านลำดับชั้นของโทเค็นความหมายสำหรับโครงสร้างดนตรีและโทเค็นอะคูสติกสำหรับรายละเอียดเสียง

MusicLM ปฏิบัติต่องานสร้างเพลงโดยพื้นฐานอย่างไร

MusicLM วางกรอบการสร้างเพลงเป็นการคาดเดาแบบอัตโนมัติบนโทเค็นเสียงแบบแยก คล้ายกับวิธีที่โมเดลภาษาทำนายคำศัพท์

บทบาทของโทเค็นความหมายใน MusicLM คืออะไร

โทเค็นความหมาย (จาก w2v-BERT) จับโครงสร้างที่หยาบและเปลี่ยนแปลงช้า เช่น ทำนองและจังหวะในช่วงระยะยาว

ส่วนประกอบใดที่ให้รายละเอียดเสียงที่ดี เช่น โทนเสียงและพื้นผิว

โทเค็นเสียงมาจากตัวแปลงสัญญาณประสาท SoundStream และเข้ารหัสรายละเอียดเล็กๆ น้อยๆ เช่น เสียงร้องและพื้นผิว

MusicLM เชื่อมต่อข้อความแจ้งกับเสียงดนตรีอย่างไร

MuLan ได้รับการฝึกอบรมเพื่อให้คำอธิบายข้อความและแผนที่เสียงที่ตรงกันกับจุดใกล้เคียงในพื้นที่ฝังที่ใช้ร่วมกัน ช่วยให้สามารถปรับสภาพข้อความได้

เหตุใดการออกแบบที่มีลำดับชั้นและจัดฉากจึงช่วยในเรื่องโครงสร้างระยะไกล

โทเค็นความหมายแบบกระจัดกระจายเปลี่ยนแปลงอย่างช้าๆ ดังนั้น Transformer สามารถสร้างแบบจำลองรูปแบบระยะยาวได้อย่างมีประสิทธิภาพก่อนที่จะกรอกรายละเอียดเสียงที่หนาแน่น