คู่มือเสียง AI

ตัวเข้ารหัส WaveGAN แบบขนาน

Parallel WaveGAN เป็นตัวแปลงเสียงแบบนิวรอลที่รวดเร็ว ซึ่งเปลี่ยนเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบโดยใช้ GAN ขนาดเล็ก เพื่อสร้างตัวอย่างทั้งหมดในคราวเดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because it gives near-real-time, high-quality speech with a compact model.

เจาะลึก

โวโคเดอร์เป็นขั้นตอนสุดท้ายของไปป์ไลน์ TTS โดยจะแปลงแผนผังคุณสมบัติเสียง (โดยปกติจะเป็นเมล-สเปกโตรแกรม) ให้เป็นคลื่นเสียงจริงที่คุณได้ยิน Parallel WaveGAN ซึ่งเสนอโดย Yamamoto, Song และ Kim ในปี 2019 ดำเนินการนี้ด้วยเครื่องกำเนิดไฟฟ้าสไตล์ WaveNet ที่ไม่ถอยอัตโนมัติ ซึ่งได้รับการฝึกฝนให้เป็นเครือข่ายปฏิปักษ์เชิงกำเนิด แทนที่จะคาดเดาตัวอย่างเสียงครั้งละหนึ่งตัวอย่างเหมือนกับ WaveNet ดั้งเดิม ระบบจะสร้างรูปคลื่นทั้งหมดแบบขนาน ทำให้เร็วขึ้นอย่างมาก สูตรหลักของมันผสมผสานการสูญเสียฝ่ายตรงข้ามเข้ากับการสูญเสียการแปลงฟูเรียร์ระยะสั้น (STFT) แบบหลายความละเอียด ดังนั้นแบบจำลองจึงจับคู่สัญญาณจริงในช่วงเวลาและความถี่ต่างๆ ผลลัพธ์ที่ได้คือตัวสร้างขนาดเล็ก (ประมาณ 1.4 ล้านพารามิเตอร์) ที่ทำงานเร็วกว่าเรียลไทม์บน GPU หลายเท่า

ข้อมูลเชิงลึกทางเทคนิค

เครื่องกำเนิดไฟฟ้าเป็นเครือข่าย Convolution แบบขยายซึ่งมีเงื่อนไขบนเมลสเปกโตรแกรมและอินพุตสัญญาณรบกวน สัญญาณรบกวนบนแผนที่ รวมถึงคุณสมบัติโดยตรงกับตัวอย่าง การฝึกอบรมร่วมกันลดการสูญเสีย STFT แบบหลายความละเอียดให้เหลือน้อยที่สุด โดยคำนวณโดยการเปรียบเทียบสเปกโตรแกรมขนาด FFT หลายขนาดและความยาวฮอป และการสูญเสียฝ่ายตรงข้ามจากผู้เลือกปฏิบัติที่ตัดสินความเป็นจริง คำศัพท์ STFT ช่วยให้การฝึกฝ่ายตรงข้ามคงที่และเร็วขึ้น โดยจับทั้งรายละเอียดเล็กๆ น้อยๆ และรูปร่างสเปกตรัมกว้างโดยไม่ต้องกลั่น

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ Vocoder WaveGAN แบบขนาน

Parallel WaveGAN ช่วยสร้างโวโคเดอร์ GAN เป็นค่าเริ่มต้นในทางปฏิบัติ และตอนนี้การสูญเสีย STFT แบบหลายความละเอียดก็ปรากฏขึ้นในกลุ่มผู้สืบทอดเช่น HiFi-GAN และระบบสตรีมมิ่งจำนวนมาก วิถีโคจรชี้ไปที่ตัวแปลงเสียงที่มีขนาดเล็กลงและมีความหน่วงต่ำลงสำหรับผู้ช่วยในอุปกรณ์ เครื่องช่วยฟัง และการแปลงเสียงสด รวมถึงตัวแปลงเสียงแบบสากลที่พูดถึงผู้พูดที่มองไม่เห็น คาดหวังการผสานรวมที่เข้มงวดมากขึ้นกับ TTS แบบ end-to-end และการปรับใช้อย่างมีประสิทธิภาพบนมือถือและชิปแบบฝัง

การใช้งานจริงในโลกแห่งความเป็นจริง

เอาต์พุตเสียงพูดแบบเรียลไทม์ในผู้ช่วยเสียงเคลื่อนที่โดยคำนึงถึงเวลาแฝงและขนาดโมเดล

ทำหน้าที่เป็นเครื่องกำเนิดรูปคลื่นที่จับคู่กับโมเดลอะคูสติก เช่น Tacotron 2 หรือ FastSpeech

การอ่านออกเสียงข้อความบนอุปกรณ์สำหรับเครื่องมือช่วยการเข้าถึงที่ไม่สามารถพึ่งพาระบบคลาวด์ได้

ระบบการแปลงเสียงที่สังเคราะห์สเปกโตรแกรมที่แปลงแล้วใหม่ให้เป็นเสียงที่เป็นธรรมชาติ

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Parallel WaveGAN Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำถามที่พบบ่อย

What is Parallel WaveGAN Vocoder?

Parallel WaveGAN เป็นตัวแปลงเสียงแบบนิวรอลที่รวดเร็ว ซึ่งเปลี่ยนเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบโดยใช้ GAN ขนาดเล็ก เพื่อสร้างตัวอย่างทั้งหมดในคราวเดียว สิ่งสำคัญคือให้เสียงพูดคุณภาพสูงที่เกือบจะเรียลไทม์ในรุ่นกะทัดรัด

งานของนักร้องอย่าง Parallel WaveGAN คืออะไร?

โวโคเดอร์คือขั้นตอน TTS สุดท้ายที่สังเคราะห์คลื่นเสียงจริงจากคุณสมบัติทางเสียง เช่น เมล-สเปกโตรแกรม

Parallel WaveGAN สร้างตัวอย่างเสียงอย่างไรเมื่อเปรียบเทียบกับ WaveNet ดั้งเดิม

Parallel WaveGAN ไม่ใช่การถดถอยอัตโนมัติ โดยจะสร้างรูปคลื่นทั้งหมดพร้อมกัน แทนที่จะสุ่มตัวอย่างต่อตัวอย่าง ซึ่งทำให้เร็วขึ้นมาก

การสูญเสียใดที่เป็นศูนย์กลางของ Parallel WaveGAN นอกเหนือจากการสูญเสียของฝ่ายตรงข้าม?

เป็นการรวมการสูญเสียฝ่ายตรงข้ามเข้ากับการสูญเสีย STFT หลายความละเอียดที่เปรียบเทียบขนาดของสเปกโตรแกรมในหลายระดับ

ตัวสร้าง Parallel WaveGAN ใช้สถาปัตยกรรมแบบใด

เครื่องกำเนิดไฟฟ้าเป็นเครือข่ายที่คล้ายกับ WaveNet ที่สร้างขึ้นจากการบิดแบบขยาย โดยมีเงื่อนไขบนเมลสเปกโตรแกรมและสัญญาณรบกวน

เหตุใด Parallel WaveGAN จึงน่าดึงดูดสำหรับการปรับใช้

ด้วยพารามิเตอร์ประมาณ 1.4 ล้านพารามิเตอร์ จึงมีขนาดเล็กและทำงานเร็วกว่าเรียลไทม์หลายเท่า เหมาะสำหรับการใช้งานบนอุปกรณ์