ตู้เพลง
Jukebox คือโครงข่ายประสาทเทียมในปี 2020 ของ OpenAI ที่สร้างเสียงดนตรีดิบ พร้อมด้วยเสียงร้อง เครื่องดนตรี และแม้แต่เนื้อเพลงในสไตล์ของศิลปินเฉพาะ
ภาพรวม
It was a landmark proof that AI could model the actual waveform of song-length music, not just notes.
เจาะลึก
Jukebox เปิดตัวโดย OpenAI ในเดือนเมษายน 2020 โดยสร้างเพลงในรูปแบบเสียงดิบแทนที่จะเป็นโน้ตสัญลักษณ์ ซึ่งหมายความว่าจะสร้างเสียงจริงรวมถึงเสียงร้องด้วย ได้รับการฝึกฝนเกี่ยวกับเพลงประมาณ 1.2 ล้านเพลง (ประมาณครึ่งหนึ่งของภาษาอังกฤษ) ที่คัดลอกมาจากเว็บ จับคู่กับเนื้อเพลงและข้อมูลเมตาจาก LyricWiki คุณสามารถกำหนดเงื่อนไขให้กับแนวเพลง สไตล์ของศิลปิน และเนื้อเพลงได้ และเพลงจะร้องได้อย่างเป็นที่รู้จัก (หากไม่ชัดเจน) เหมือนศิลปินคนนั้น เอาต์พุตใช้เวลานานหลายนาที สิ่งที่จับได้คือความเร็วและความเที่ยงตรง: การสร้างทำได้ช้ามาก โดยใช้เวลาประมาณเก้าชั่วโมงในการแสดงเสียงหนึ่งนาที และผลลัพธ์ที่ได้ก็มีคุณภาพไม่ชัดและมีเสียงรบกวน Jukebox เป็นการวิจัย ไม่ใช่ผลิตภัณฑ์ขัดเกลา แต่เป็นการปรับเปลี่ยนความคาดหวังสำหรับสิ่งที่เป็นไปได้
ข้อมูลเชิงลึกทางเทคนิค
Jukebox บีบอัดเสียง Raw โดยใช้ตัวเข้ารหัสอัตโนมัติ VQ-VAE ที่ความละเอียดสามเท่า เปลี่ยนรูปคลื่นที่ยาวให้เป็นลำดับโค้ดแยกที่สั้นลงมาก จากนั้นหม้อแปลงแบบออโต้รีเกรสซีฟจะคาดเดาโค้ดเหล่านี้ทีละโค้ด โดยขึ้นอยู่กับศิลปิน แนวเพลง และเนื้อเพลง จากนั้นอัปแซมเปลอร์จะเพิ่มรายละเอียดความถี่สูง การถอดรหัสโค้ดระดับล่างกลับเป็นรูปแบบคลื่น 44.1 kHz เป็นสิ่งที่ทำให้การสร้างช้ามาก เนื่องจากต้องมีการสร้างตัวอย่างเสียงหลายล้านตัวอย่างตามลำดับ
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของตู้เพลง
Jukebox ถือเป็นเหตุการณ์สำคัญทางประวัติศาสตร์ในขณะนี้ โดยถูกแทนที่ด้วยรูปแบบการแพร่กระจายที่เร็วขึ้นและเสียงแฝง เช่นรุ่นเบื้องหลัง Suno และ Udio ที่สร้างเพลงคุณภาพใกล้เคียงซีดีในเวลาไม่กี่วินาที แนวคิดหลักของบริษัท — โทเค็นเสียงแยกและการปรับเนื้อเพลง — ยังคงอยู่ในระบบสมัยใหม่ คาดว่าโมเดลเสียงดิบในอนาคตจะลดเวลาในการสร้างลง เพิ่มความคมชัดของเสียงร้อง และเพิ่มการควบคุมที่ดี ในขณะที่คำถามด้านลิขสิทธิ์ของ Jukebox ที่ถูกหยิบยกขึ้นมาเป็นครั้งแรกเกี่ยวกับการฝึกอบรมเกี่ยวกับการบันทึกที่มีลิขสิทธิ์มีแต่จะดังขึ้นเท่านั้น
การใช้งานจริงในโลกแห่งความเป็นจริง
นักวิจัยกำลังศึกษาว่าโครงข่ายประสาทเทียมสามารถสร้างแบบจำลองเสียงดิบและเสียงร้องในรูปแบบยาวได้อย่างไร โดยใช้ Jukebox เป็นสถาปัตยกรรมอ้างอิง
นักดนตรีและนักเล่นอดิเรกสร้าง 'เพลงคัฟเวอร์ AI' ที่น่าขนลุกและน่าขนลุกซึ่งร้องเพลงใหม่ในรูปแบบคร่าวๆ ของศิลปินที่ได้รับเลือก
นักการศึกษาสาธิตการก้าวกระโดดจากการสร้างโน้ตสไตล์ MIDI ไปสู่การสังเคราะห์เสียงดิบเต็มรูปแบบพร้อมเสียงร้อง
นักออกแบบเสียงและศิลปินแนวทดลองเก็บเกี่ยวพื้นผิวที่มัวหมองเหมือนฝันของ Jukebox เป็นวัตถุดิบในการรีมิกซ์และตัดปะ
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Jukebox quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างดนตรีเชิงสัญลักษณ์
คำถามที่พบบ่อย
What is Jukebox?
Jukebox คือโครงข่ายประสาทเทียมในปี 2020 ของ OpenAI ที่สร้างเสียงดนตรีดิบ พร้อมด้วยเสียงร้อง เครื่องดนตรี และแม้แต่เนื้อเพลงในสไตล์ของศิลปินเฉพาะ เป็นข้อพิสูจน์ที่สำคัญว่า AI สามารถจำลองรูปคลื่นที่แท้จริงของเพลงที่มีความยาวได้ ไม่ใช่แค่โน้ตเท่านั้น
อะไรทำให้ Jukebox แตกต่างจากเพลงสัญลักษณ์ AI รุ่นก่อนๆ เช่น ระบบที่ส่งสัญญาณ MIDI
ตู้เพลงจำลองเสียงดนตรีจริงเป็นเสียงดิบ ดังนั้นจึงสามารถสร้างเสียงร้องและเสียงเครื่องดนตรีได้ ซึ่งแตกต่างจากระบบสัญลักษณ์ที่ส่งออกเฉพาะข้อมูลโน้ตเท่านั้น
ใครปล่อย Jukebox และประมาณเมื่อไร?
OpenAI เปิดตัว Jukebox ในเดือนเมษายน 2020 เพื่อเป็นโมเดลการวิจัยสำหรับการสร้างดนตรีด้วยเสียงร้อง
อะไรคือข้อจำกัดในทางปฏิบัติที่สำคัญของ Jukebox?
เนื่องจากมันถอดรหัสตัวอย่างเสียงดิบตามตัวอย่าง Jukebox จึงใช้เวลาเก้าชั่วโมงในการผลิตเพลงหนึ่งนาที ทำให้ไม่สามารถใช้งานได้แบบเรียลไทม์
Jukebox ใช้เทคนิคหลักใดในการทำให้ Transformers สามารถจัดการเสียง Raw แบบยาวได้
Jukebox ใช้ตัวเข้ารหัสอัตโนมัติ VQ-VAE เพื่อบีบอัดรูปคลื่นให้เป็นโทเค็นแยกกัน ซึ่ง Transformers จะสร้างแบบจำลองแบบถดถอยอัตโนมัติก่อนที่จะอัปแซมเพิลกลับไปเป็นเสียง
คุณสามารถกำหนดเงื่อนไขเอาต์พุตของ Jukebox ให้กับอะไรได้บ้าง
Jukebox ยอมรับแนวเพลง ศิลปินที่จะเลียนแบบ และเนื้อเพลง และจะพยายามร้องเพลงเหล่านั้นในสไตล์นั้น