คู่มือเสียง AI

มิวสิคเจน

MusicGen คือโมเดล AI ของ Meta ที่สร้างเพลงจากคำอธิบายข้อความ และอาจเลือกทำนองที่คุณฮัมหรืออัปโหลดก็ได้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it puts high-quality, controllable music creation into a single, openly released model that hobbyists and researchers can actually run.

เจาะลึก

MusicGen เปิดตัวโดย Meta AI ในปี 2023 โดยเป็นส่วนหนึ่งของโปรเจ็กต์ AudioCraft โดยเปลี่ยนข้อความเช่น 'เพลงซินธ์ป็อปที่มีจังหวะสนุกสนานในยุค 80 พร้อมเบสไลน์ที่ขับดัน' ให้กลายเป็นคลิปเพลงความยาวประมาณ 12 วินาที (ขยายได้) ต่างจากระบบหลายขั้นตอน MusicGen ใช้โมเดลภาษา Transformer เดียวที่คาดการณ์โทเค็นเสียงที่สร้างโดยตัวแปลงสัญญาณประสาท EnCodec ของ Meta การสนับสนุนที่ชาญฉลาดของมันคือรูปแบบการสลับโทเค็น (เรียกว่าการสลับการหน่วงเวลา) ซึ่งช่วยให้โมเดลหนึ่งจัดการสตรีมโทเค็นแบบขนานหลายรายการของ EnCodec ได้อย่างมีประสิทธิภาพ โดยหลีกเลี่ยงการเรียงซ้อนของโมเดลที่แยกจากกันซึ่งต้องใช้แนวทางก่อนหน้านี้ MusicGen สามารถเลือกได้สองวิธีในคราวเดียว: โดยใช้คำอธิบายข้อความและทำนองอ้างอิง ดังนั้นคุณจึงสามารถขอเพลง 'เวอร์ชันแจ๊ส' ที่คุณฮัมได้ Meta เผยแพร่โค้ดและน้ำหนักอย่างเปิดเผย ทำให้เกิดกระแสเครื่องมือและการทดลองของชุมชน

ข้อมูลเชิงลึกทางเทคนิค

MusicGen นำเสนอเสียงในรูปแบบสตรีมขนานของโทเค็นแยกจากตัวแปลงสัญญาณ EnCodec โดยแต่ละสตรีมจะบันทึกรายละเอียดที่แตกต่างกัน แทนที่จะสร้างโมเดลสตรีมด้วยโมเดลที่แยกจากกัน MusicGen จะแทรกสตรีมเหล่านั้นด้วยความล่าช้าที่ควบคุม ดังนั้น Transformer แบบ autoregressive ตัวเดียวจะคาดการณ์สตรีมเหล่านั้นในการส่งผ่านครั้งเดียว การปรับสภาพข้อความมาจากตัวเข้ารหัสข้อความ T5 ในขณะที่การปรับสภาพเมโลดี้เสริมจะใช้โครมาแกรม (โปรไฟล์ระดับระดับเสียงของเสียง) ดังนั้นโมเดลจะติดตามเพลงโดยไม่ต้องคัดลอกการบันทึกที่แน่นอน

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ MusicGen

การเปิดตัวแบบเปิดของ MusicGen ถือเป็นบรรทัดฐานที่ผู้สืบทอดมุ่งหวังที่จะเอาชนะด้วยเอาท์พุตสเตอริโอที่ยาวกว่า มีความเที่ยงตรงสูงกว่า พร้อมการควบคุมโครงสร้าง เครื่องดนตรี และท่อนเพลงที่ละเอียดยิ่งขึ้น คาดหวังการผสานรวมที่เข้มงวดยิ่งขึ้นในซอฟต์แวร์การผลิตเพลง การสร้างเชิงโต้ตอบแบบเรียลไทม์ และเครื่องมือที่ดีกว่าสำหรับการแก้ไขหรือขยายแทร็กที่มีอยู่ เช่นเดียวกับดนตรีแนวสร้างสรรค์อื่นๆ คำถามนี้ทำให้เกิดคำถามที่ชัดเจนเกี่ยวกับลิขสิทธิ์ข้อมูลการฝึกอบรม ค่าตอบแทนของศิลปิน และวิธีการติดป้ายกำกับเพลงที่สร้างโดย AI ในตลาดที่มีน้ำท่วมขัง

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างเพลงประกอบที่ไม่มีค่าลิขสิทธิ์สำหรับวิดีโอ YouTube จากข้อความแจ้ง

ฮัมเพลงและขอให้ MusicGen เรียบเรียงออเคสตราแบบเต็ม

นักพัฒนาเกมสร้างต้นแบบเพลงประกอบระดับต่างๆ ในประเภทต่างๆ ได้อย่างรวดเร็ว

นักวิจัยและมือสมัครเล่นที่ใช้ตุ้มน้ำหนักแบบโอเพ่นซอร์สเพื่อทดลองการแปลงข้อความเป็นเพลง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MusicGen quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การจัดตำแหน่งแบบบังคับ

คำถามที่พบบ่อย

What is MusicGen?

MusicGen คือโมเดล AI ของ Meta ที่สร้างเพลงจากคำอธิบายข้อความ และอาจเลือกทำนองที่คุณฮัมหรืออัปโหลดก็ได้ สิ่งสำคัญคือเพราะมันรวมการสร้างสรรค์เพลงคุณภาพสูงที่ควบคุมได้ไว้ในโมเดลเดียวที่เผยแพร่อย่างเปิดเผยที่นักเล่นอดิเรกและนักวิจัยสามารถทำได้จริง

อินพุตสองประเภทใดที่สามารถควบคุม MusicGen ได้ในเวลาเดียวกัน

MusicGen ยอมรับข้อความแจ้งและเมโลดี้ (ไม่บังคับ) ดังนั้นคุณจึงสามารถขอเวอร์ชั่นโวหารของเพลงที่คุณให้มาได้

ตัวแปลงสัญญาณประสาทใดที่สร้างโทเค็นเสียงที่ MusicGen คาดการณ์

MusicGen สร้างแบบจำลองโทเค็นแยกที่สร้างโดยตัวแปลงสัญญาณ EnCodec ของ Meta ซึ่งจะถอดรหัสโทเค็นที่คาดการณ์กลับเป็นเสียงด้วย

การลดความซับซ้อนทางสถาปัตยกรรมที่สำคัญของ MusicGen เหนือแนวทางก่อนหน้านี้คืออะไร

ด้วยการแทรกสตรีมโทเค็นแบบขนานของ EnCodec เข้ากับการหน่วงเวลาที่ได้รับการควบคุม Transformer แบบ autoregressive ตัวหนึ่งสามารถสร้างโมเดลเหล่านั้นได้ในการส่งผ่านครั้งเดียว โดยหลีกเลี่ยงการเรียงซ้อนของโมเดล

MusicGen ติดตามทำนองที่ให้มาโดยไม่คัดลอกการบันทึกที่แน่นอนได้อย่างไร

โครมาแกรมจะบันทึกคลาสของระดับเสียงที่มีอยู่ในช่วงเวลาหนึ่ง เพื่อให้ MusicGen จับคู่ความกลมกลืนและรูปร่างของเพลงโดยไม่ต้องสร้างเสียงร้องต้นฉบับขึ้นมาใหม่

โปรเจ็กต์และบริษัทใดที่เปิดตัว MusicGen?

MusicGen เปิดตัวในปี 2023 โดยเป็นส่วนหนึ่งของ Meta โปรเจ็กต์ AudioCraft ของ AI พร้อมโค้ดแบบเปิดและน้ำหนักโมเดล