คู่มือเสียง AI

DiffWave การแพร่กระจาย Vocoder

DiffWave เป็นโวโคเดอร์แบบกระจายที่สังเคราะห์เสียงโดยการลดสัญญาณรบกวนแบบสุ่มซ้ำๆ ให้กลายเป็นรูปคลื่น โดยมีเงื่อนไขบนเมลสเปกโตรแกรม

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

มันนําโมเดลการแพร่กระจายไปสู่เสียงพูดที่มีความละเอียดสูง แข่งขันกับ GAN และ WaveNet โดยไม่ต้องฝึกแบบคู่แข่ง

เจาะลึก

DiffWave แนะนำโดย Kong และคณะ ในปี 2020 จะใช้เฟรมเวิร์กโมเดลความน่าจะเป็นแบบ denoising diffusion กับเสียงดิบ ในระหว่างการฝึก มันจะค่อยๆ เพิ่มสัญญาณรบกวนแบบเกาส์เซียนให้กับรูปคลื่นที่สะอาดในหลายขั้นตอน จากนั้นเรียนรู้เครือข่ายเพื่อคาดการณ์และกำจัดสัญญาณรบกวนนั้นในแต่ละขั้นตอน ในช่วงเวลาแห่งการสร้าง เสียงจะเริ่มต้นจากเสียงบริสุทธิ์และดำเนินกระบวนการย้อนกลับ ซึ่งมีเงื่อนไขบนเมลสเปกโตรแกรม เพื่อฟื้นเสียงพูดที่สะอาด แบ็คโบนเป็นเครือข่ายแบบบิดขยายที่ไม่ถอยอัตโนมัติ มีลักษณะคล้ายกับ WaveNet แต่ทำนายสัญญาณรบกวนมากกว่าตัวอย่าง DiffWave จับคู่เสียงพากย์ที่แข็งแกร่งในด้านคุณภาพและทนทานเป็นพิเศษ แม้จะผลิตเสียงพูดที่ไม่มีเงื่อนไขที่สมเหตุสมผลและผลลัพธ์ที่สม่ำเสมอจากผู้พูดทุกคน ข้อเสียเปรียบหลักคือความเร็ว: การสุ่มตัวอย่างแบบไร้เดียงสาต้องใช้ขั้นตอนหลายสิบถึงหลายพันขั้นตอน แม้ว่ากำหนดการที่รวดเร็วจะลดขั้นตอนนี้ให้เหลือเพียงหกขั้นตอนก็ตาม

ข้อมูลเชิงลึกทางเทคนิค

DiffWave เรียนรู้การไล่ระดับของการกระจายข้อมูลโดยปริยายโดยการฝึกเครือข่ายเพื่อคาดการณ์สัญญาณรบกวนที่เพิ่มขึ้นในขั้นตอนการแพร่แบบสุ่ม โดยใช้วัตถุประสงค์ L2 แบบถ่วงน้ำหนักอย่างง่าย การสุ่มตัวอย่างจะกลับรายการตารางเวลาเสียงคงที่ และจำนวนขั้นตอนจะแลกคุณภาพกับความเร็ว นักวิจัยพบว่าตารางเวลาสั้นๆ ที่เลือกสรรมาอย่างดีซึ่งมีประมาณหกขั้นตอนจะรักษาความเที่ยงตรงได้มากที่สุด โดยเปลี่ยนกระบวนการนับพันขั้นตอนให้กลายเป็นสิ่งที่ใกล้เคียงกับการปฏิบัติจริงมากขึ้น

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ DiffWave Diffusion Vocoder

DiffWave ได้เริ่มต้นการแพร่กระจายของโวโคเดอร์และผู้สืบทอดที่เร็วขึ้นอย่าง PriorGrad และ FastDiff ที่ลดขั้นตอนลง สาขาวิชานี้มาบรรจบกันที่เทคนิคการกลั่นและแบบจำลองความสม่ำเสมอซึ่งมีจุดมุ่งหมายเพื่อการสุ่มตัวอย่างแบบแพร่กระจายในขั้นตอนเดียว ปิดช่องว่างความเร็วด้วยตัวแสดงเสียง GAN ขณะเดียวกันก็รักษาการฝึกฝนและความทนทานของการแพร่กระจายอย่างมั่นคง คาดว่าแนวคิดในการแพร่กระจายจะแพร่กระจายไปสู่ดนตรี ตัวแปลงสัญญาณประสาท และการสร้างเสียงสากลที่ความครอบคลุมของโหมดมีความสำคัญ

การใช้งานจริงในโลกแห่งความเป็นจริง

ส่วนหลังของการอ่านออกเสียงข้อความแบบนิวรัลที่มีความแม่นยำสูง เพื่อหลีกเลี่ยงการฝึก GAN ที่ไม่เสถียร

การสร้างคำพูดแบบไม่มีเงื่อนไขสำหรับการเพิ่มข้อมูลและการวิจัยด้านเสียง

การสังเคราะห์เสียงที่มีประสิทธิภาพของลำโพง โดยที่รุ่นหนึ่งสามารถจัดการกับเสียงหลายเสียงได้อย่างสม่ำเสมอ

การทดสอบสำหรับการวิจัยการแพร่กระจายของการสุ่มตัวอย่างอย่างรวดเร็ว โดยใช้กำหนดเวลาเสียงรบกวนที่สั้นกับเสียงแบบเรียลไทม์

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DiffWave Diffusion Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การกระจายเสียงแฝงที่เสถียร

คำถามที่พบบ่อย

โวโคเดอร์ DiffWave Diffusion คืออะไร?

DiffWave เป็นโวโคเดอร์แบบกระจายที่สังเคราะห์เสียงโดยการลดสัญญาณรบกวนแบบสุ่มซ้ำๆ ให้กลายเป็นรูปคลื่น โดยมีเงื่อนไขบนเมลสเปกโตรแกรม โดยนำโมเดลการแพร่กระจายมาสู่คำพูดที่มีความเที่ยงตรงสูง แข่งขันกับ GAN และ WaveNet โดยไม่ต้องผ่านการฝึกอบรมจากฝ่ายตรงข้าม

DiffWave สร้างเสียงในเวลาอนุมานได้อย่างไร

DiffWave เริ่มต้นจากสัญญาณรบกวนแบบเกาส์เซียนและดำเนินกระบวนการแพร่กระจายแบบย้อนกลับ โดยจะลดสัญญาณรบกวนซ้ำๆ ขณะปรับสภาพบนเมลสเปกโตรแกรม เพื่อสร้างรูปคลื่น

จริงๆ แล้วเครือข่าย DiffWave เรียนรู้ที่จะทำนายอะไรระหว่างการฝึก?

DiffWave ฝึกเครือข่ายเพื่อทำนายสัญญาณรบกวนแบบเกาส์เซียนที่เพิ่มในขั้นตอนการแพร่ที่เลือกแบบสุ่ม โดยใช้การสูญเสีย L2 แบบถ่วงน้ำหนัก

ข้อเสียเปรียบหลักในทางปฏิบัติของ DiffWave คืออะไรเมื่อเปรียบเทียบกับโวโคเดอร์ GAN

การสุ่มตัวอย่างการแพร่กระจายแบบไร้เดียงสาจำเป็นต้องมีขั้นตอนย้อนกลับหลายขั้นตอน แม้ว่ากำหนดการที่รวดเร็วจะช่วยได้ แต่กระบวนการวนซ้ำก็เป็นต้นทุนความเร็วหลัก

DiffWave มีข้อได้เปรียบเหนือโวโคเดอร์ GAN ในการฝึกอบรมอย่างไร

แบบจำลองการแพร่กระจายได้รับการฝึกฝนโดยมีวัตถุประสงค์ในรูปแบบการถดถอยที่มั่นคง โดยหลีกเลี่ยงความไม่เสถียรที่การฝึกอบรม GAN ของฝ่ายตรงข้ามอาจประสบได้

เครือข่ายการทำนายสัญญาณรบกวนของ DiffWave มีลักษณะสถาปัตยกรรมใด

DiffWave ใช้แกนหลักที่ไม่ถอยอัตโนมัติของการบิดแบบขยายที่คล้ายกับ WaveNet แต่จะคาดการณ์สัญญาณรบกวนมากกว่าตัวอย่างเสียง