คู่มือเสียง AI

MelGAN กำเนิด Vocoder

MelGAN เป็นโวโคเดอร์ที่ใช้ GAN แบบ Convolutional เต็มรูปแบบ ซึ่งจะแปลงเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบในการส่งต่ออย่างรวดเร็วเพียงครั้งเดียว

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It mattered because it proved high-quality, non-autoregressive speech synthesis could run hundreds of times faster than real time on a GPU.

เจาะลึก

MelGAN แนะนำโดย Kumar และคณะ ในปี 2019 สร้างเสียงโดยไม่มีการวนซ้ำตัวอย่างต่อตัวอย่างที่ช้าซึ่งใช้โดย WaveNet เครื่องกำเนิดของมันคือสแต็คของการโน้มน้าวใจแบบขนย้ายที่เพิ่มตัวอย่างเมลสเปกโตรแกรม (โดยทั่วไปคือ 80 ย่านความถี่) จนถึงอัตราตัวอย่างเสียง โดยมีบล็อกที่เหลือโดยใช้การโน้มน้าวใจแบบขยายเพื่อขยายสนามรับสัญญาณ นวัตกรรมที่สำคัญคือการฝึกอบรมกับผู้แยกแยะหลายคนที่ทำงานในระดับเสียงที่แตกต่างกัน (รูปคลื่นดั้งเดิมบวกกับเวอร์ชันที่สุ่มตัวอย่าง) แต่ละตัวมองไปที่หน้าต่างที่ทับซ้อนกัน การสูญเสียการจับคู่ฟีเจอร์จะเปรียบเทียบการเปิดใช้งานการแบ่งแยกระหว่างเสียงจริงและเสียงปลอม ซึ่งทำให้การฝึกอบรม GAN มีความเสถียร โมเดลนี้มีขนาดเล็กตามมาตรฐานเสียงประสาท และทำงานเร็วกว่าเรียลไทม์แม้แต่บน CPU ทำให้ใช้งานได้จริงสำหรับการอ่านออกเสียงข้อความแบบฝังและบนอุปกรณ์

ข้อมูลเชิงลึกทางเทคนิค

เครื่องมือแยกแยะหลายระดับของ MelGAN ใช้เครือข่ายสามเครือข่ายที่เหมือนกันในการรับชมเสียงที่ความละเอียดเต็ม ครึ่ง และสี่ส่วน โดยแต่ละโครงสร้างการจับภาพในช่วงความถี่ที่แตกต่างกัน สิ่งสำคัญที่สุดคือ MelGAN อาศัยการสูญเสียการจับคู่คุณลักษณะ (ระยะห่าง L1 ระหว่างแผนที่คุณลักษณะตัวแบ่งแยกระหว่างเสียงจริงกับเสียงที่สร้างขึ้น) แทนที่จะสูญเสียการสร้างสเปกโตรแกรมใหม่อย่างชัดเจน ซึ่งสนับสนุนให้เครื่องกำเนิดจับคู่สถิติของเสียงจริงทีละชั้น

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ MelGAN Generative Vocoder

MelGAN ก่อตั้งกลุ่มนักร้องเสียง GAN ผู้สืบทอดอย่าง HiFi-GAN และ UnivNet ยังคงใช้แนวทางที่ไม่ถดถอยอย่างรวดเร็ว แต่ได้เพิ่มตัวแยกแยะหลายช่วงเวลาและหลายความละเอียดเพื่อให้ความถี่สูงที่สะอาดยิ่งขึ้น สถาปัตยกรรมยังคงอยู่ในอุปกรณ์และการสตรีม TTS โดยที่เวลาแฝงและขนาดโมเดลมีความสำคัญ และแนวคิดในการเลือกปฏิบัติยังคงมีอิทธิพลต่อตัวแปลงสัญญาณประสาทและระบบสร้างเพลง ซึ่งการฝึกอบรมฝ่ายตรงข้ามช่วยปรับปรุงคุณภาพการรับรู้

การใช้งานจริงในโลกแห่งความเป็นจริง

การอ่านออกเสียงข้อความบนอุปกรณ์ในผู้ช่วยมือถือที่ผู้พูดเสียงขนาดเล็กและรวดเร็วหลีกเลี่ยงการเดินทางไปกลับบนคลาวด์

ไปป์ไลน์การแปลงเสียงแบบเรียลไทม์ที่แปลงเมลสเปกโตรแกรมของผู้พูดให้เป็นเสียงเป้าหมาย

เครื่องมือเกมและแอนิเมชั่นที่สังเคราะห์บทสนทนาของตัวละครจากสเปกโตรแกรมที่สร้างขึ้นโดยมีความหน่วงต่ำ

พื้นฐานการวิจัยสำหรับ GAN เสียง โดยที่การสูญเสียการจับคู่คุณสมบัติของ MelGAN ถูกนำมาใช้ซ้ำสำหรับการสร้างเพลงและเอฟเฟกต์เสียง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the MelGAN Generative Vocoder quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

DiffWave การแพร่กระจาย Vocoder

คำถามที่พบบ่อย

What is MelGAN Generative Vocoder?

MelGAN เป็นโวโคเดอร์ที่ใช้ GAN แบบ Convolutional เต็มรูปแบบ ซึ่งจะแปลงเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบในการส่งต่ออย่างรวดเร็วเพียงครั้งเดียว มันสำคัญเพราะมันได้รับการพิสูจน์แล้วว่าการสังเคราะห์เสียงพูดคุณภาพสูงและไม่ถดถอยอัตโนมัติสามารถทำงานได้เร็วกว่าแบบเรียลไทม์บน GPU หลายร้อยเท่า

MelGAN อินพุตใดแปลงเป็นรูปแบบคลื่นเสียงดิบ

MelGAN เป็นโวโคเดอร์: ใช้การนำเสนอคุณลักษณะทางเสียง เมล-สเปกโตรแกรม และสังเคราะห์รูปคลื่นที่สอดคล้องกัน

เหตุใด MelGAN จึงเร็วกว่า WaveNet มากในการอนุมาน

WaveNet สร้างตัวอย่างทีละตัวอย่างแบบถดถอยอัตโนมัติ เครื่องกำเนิดแบบหมุนวนของ MelGAN จะสร้างรูปคลื่นทั้งหมดในการส่งต่อแบบขนานเพียงชุดเดียว

MelGAN แนะนำการออกแบบการแบ่งแยกที่โดดเด่นแบบใด

MelGAN ใช้ตัวแยกแยะที่เหมือนกันหลายตัวเพื่อตรวจสอบรูปคลื่นดั้งเดิมและเวอร์ชันที่ลดขนาดลงเพื่อบันทึกโครงสร้างในระดับต่างๆ

การสูญเสียใดที่ช่วยรักษาเสถียรภาพการฝึกอบรมฝ่ายตรงข้ามของ MelGAN

การสูญเสียการจับคู่คุณลักษณะจะช่วยลดระยะห่าง L1 ระหว่างแผนผังคุณลักษณะการแบ่งแยกสำหรับเสียงจริงและเสียงที่สร้างขึ้น นำทางเครื่องกำเนิดและการฝึกอบรมที่มีเสถียรภาพ

เครื่องกำเนิดของ MelGAN เพิ่มเขตข้อมูลที่เปิดกว้างได้อย่างไร

บล็อกที่เหลือที่มีการบิดแบบขยายจะขยายสนามรับอย่างมีประสิทธิภาพ ทำให้เครื่องกำเนิดไฟฟ้าจำลองโครงสร้างชั่วคราวในระยะไกล