แบบจำลองการแพร่กระจายสำหรับเสียง
โมเดลการแพร่กระจายจะสร้างเสียงโดยการเรียนรู้ที่จะย้อนกลับกระบวนการส่งเสียงรบกวนทีละขั้นตอน เปลี่ยนเสียงรบกวนแบบสุ่มให้เป็นคำพูด เพลง หรือเอฟเฟกต์เสียงที่สอดคล้องกัน
ภาพรวม
They power many of today's most realistic text-to-audio and music-generation systems.
เจาะลึก
โมเดลการแพร่กระจายของเสียงยืมแนวคิดหลักเดียวกันกับที่ปฏิวัติการสร้างภาพ ในระหว่างการฝึก เสียงที่สะอาดจะค่อยๆ เสียหายโดยการเพิ่มเสียงรบกวนแบบเกาส์เซียนในหลายขั้นตอนจนกระทั่งกลายเป็นเสียงคงที่ล้วนๆ โครงข่ายประสาทเทียมเรียนรู้ที่จะทำนายและกำจัดสัญญาณรบกวนนั้นในแต่ละขั้นตอน ในช่วงเวลาแห่งการสร้าง แบบจำลองจะเริ่มต้นจากสัญญาณรบกวนแบบสุ่มและปฏิเสธซ้ำๆ ซึ่งมักได้รับคำแนะนำจากข้อความเพื่อสร้างสัญญาณที่ชัดเจน หลายระบบไม่ได้ทำงานบนรูปคลื่นดิบ แต่ทำงานบนการแสดงค่าแฝงหรือสเปกโตรแกรมที่ถูกบีบอัด ซึ่งทำให้การสร้างเร็วขึ้นและดำเนินการได้ง่ายขึ้น ตัวอย่างที่โดดเด่น ได้แก่ AudioLDM, Stable Audio และ Riffusion ผลลัพธ์ที่ได้คือการสังเคราะห์เสียงที่มีความแม่นยำสูงและควบคุมได้สำหรับเสียงพูด เพลง และเสียงรอบข้าง
ข้อมูลเชิงลึกทางเทคนิค
แทนที่จะสร้างรูปคลื่นดิบที่ยาวโดยตรง โมเดลการแพร่กระจายเสียงส่วนใหญ่ทำงานในพื้นที่แฝงที่เรียนรู้ซึ่งผลิตโดยตัวเข้ารหัสอัตโนมัติแบบแปรผัน หรือบนเมลสเปกโตรแกรมที่แปลงเป็นเสียงในภายหลังโดยโวโคเดอร์เช่น HiFi-GAN การปรับสภาพข้อความถูกแทรกผ่านความสนใจข้ามสาย โดยมักใช้การฝัง CLAP ที่จัดแนวเสียงและภาษา ความเร็วในการสุ่มตัวอย่างได้รับการปรับปรุงด้วยเทคนิคต่างๆ เช่น DDIM และการกลั่น ซึ่งลดขั้นตอนการลดสัญญาณรบกวนนับร้อยให้เหลือเพียงหยิบมือเดียว
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของโมเดลการแพร่กระจายสำหรับเสียง
คาดหวังการสุ่มตัวอย่างที่รวดเร็วยิ่งขึ้นผ่านแบบจำลองที่สอดคล้องกันและการกลั่น ซึ่งผลักดันไปสู่การสร้างแบบเรียลไทม์และสตรีมมิ่ง การเรียบเรียงดนตรีที่มีโครงสร้างและยาวขึ้นพร้อมการประสานท่อนร้องและท่อนคอรัสกำลังเกิดขึ้น ควบคู่ไปกับการควบคุมที่ละเอียดยิ่งขึ้นผ่านการวาดภาพ ก้าน และเสียงอ้างอิง ระบบต่อเนื่องหลายรูปแบบที่ร่วมกันสร้างวิดีโอและเพลงประกอบที่ซิงโครไนซ์กำลังก้าวหน้าอย่างรวดเร็ว เมื่อคุณภาพเพิ่มขึ้น เครื่องมือลายน้ำและแหล่งที่มาจะกลายเป็นสิ่งสำคัญในการจัดการกับการปลอมแปลงเสียง การโคลนเสียง และข้อกังวลเรื่องลิขสิทธิ์เพลง
การใช้งานจริงในโลกแห่งความเป็นจริง
เสียงที่เสถียรสร้างเพลงพื้นหลังและเอฟเฟกต์เสียงที่ไม่มีค่าลิขสิทธิ์จากข้อความแจ้งสำหรับผู้สร้างวิดีโอ
AudioLDM สร้างเสียงสิ่งแวดล้อมที่สมจริง เช่น ฝน เสียงฝีเท้า หรือสุนัขเห่าสำหรับเกมและภาพยนตร์
Riffusion สร้างคลิปเพลงสั้น ๆ โดยการลดนอยส์ภาพสเปกโตรแกรมที่มีเงื่อนไขตามประเภทและการแจ้งเตือนของเครื่องดนตรี
ระบบแปลงข้อความเป็นคำพูดแบบกระจายเสียงสังเคราะห์คำบรรยายที่เป็นธรรมชาติและแสดงออกสำหรับหนังสือเสียงและผู้ช่วยเสียง
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Models for Audio quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
โมเดลเสียง Bark Generative
คำถามที่พบบ่อย
What is Diffusion Models for Audio?
โมเดลการแพร่กระจายจะสร้างเสียงโดยการเรียนรู้ที่จะย้อนกลับกระบวนการส่งเสียงรบกวนทีละขั้นตอน เปลี่ยนเสียงรบกวนแบบสุ่มให้เป็นคำพูด เพลง หรือเอฟเฟกต์เสียงที่สอดคล้องกัน สิ่งเหล่านี้ขับเคลื่อนระบบการแปลงข้อความเป็นเสียงและเพลงที่สมจริงที่สุดในปัจจุบัน
กระบวนการหลักที่โมเดลการแพร่กระจายเรียนรู้ระหว่างการฝึกอบรมคืออะไร
โมเดลการแพร่กระจายได้รับการฝึกฝนให้คาดการณ์และลบเสียงรบกวนแบบเกาส์เซียนที่เพิ่มเข้ามาในแต่ละขั้นตอน ดังนั้นจึงสามารถเปลี่ยนเสียงรบกวนบริสุทธิ์ให้เป็นเสียงที่สะอาดได้ในภายหลัง
เหตุใดโมเดลการกระจายเสียงจำนวนมากจึงทำงานโดยใช้ค่าแฝงหรือสเปกโตรแกรม แทนที่จะเป็นรูปคลื่นดิบ
การทำงานในพื้นที่แฝงที่ถูกบีบอัดหรือบนสเปกโตรแกรมจะช่วยลดมิติมิติลงอย่างมาก ทำให้การฝึกอบรมและการสุ่มตัวอย่างมีประสิทธิภาพมากกว่าการสร้างแบบจำลองรูปคลื่นดิบขนาดยาวโดยตรง
โดยทั่วไปแล้วข้อความแจ้งใช้เพื่อควบคุมการสร้างเสียงในรุ่นเหล่านี้อย่างไร
โดยทั่วไปการปรับสภาพข้อความจะถูกป้อนเข้าสู่เครือข่าย denoising ผ่านการให้ความสนใจข้ามสาย โดยมักใช้การฝัง CLAP ที่จัดแนวภาษาและเสียง
เมื่อมีการสร้างสเปกโตรแกรม โดยปกติแล้วจะเปลี่ยนกลับเป็นเสียงได้อย่างไร
โวโคเดอร์อย่าง HiFi-GAN จะแปลงเมลสเปกโตรแกรมที่สร้างขึ้นให้เป็นรูปแบบคลื่นเสียง
เทคนิคใดที่ช่วยเร่งการสร้างโดยลดจำนวนขั้นตอนการ denoising?
แบบจำลองการกลั่นและความสม่ำเสมอจะบีบอัดขั้นตอนการลดสัญญาณรบกวนนับร้อยขั้นตอนให้เหลือเพียงไม่กี่ขั้นตอน ทำให้สามารถสุ่มตัวอย่างแบบเรียลไทม์ได้เร็วขึ้นมาก