คู่มือเสียง AI

โวโคเดอร์ HiFi-GAN และ GAN

HiFi-GAN เป็นตัวแปลงเสียงแบบกำเนิดปฏิปักษ์ที่เปลี่ยนเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบแทบจะในทันที ทำให้เสียงพูดคุณภาพระดับสตูดิโอเร็วกว่าเรียลไทม์มาก

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It became the standard final stage of modern text-to-speech because it is fast, lightweight, and hard to distinguish from real recordings.

เจาะลึก

โวโคเดอร์เป็นขั้นตอนสุดท้ายในไปป์ไลน์ TTS ส่วนใหญ่ แบบจำลองอย่าง Tacotron หรือ FastSpeech จะทำนายเมล-สเปกโตรแกรม (ภาพขนาดย่อของความถี่ในช่วงเวลาหนึ่ง) และโวโคเดอร์จะเติมลงในตัวอย่างรูปคลื่นจริง vocoders ประสาทในยุคแรก ๆ เช่น WaveNet ฟังดูดี แต่สร้างตัวอย่างเสียงทีละตัวอย่าง ทำให้พวกเขาช้าอย่างเจ็บปวด HiFi-GAN ซึ่งออกโดย Kong, Kim และ Bae ในปี 2020 ได้แทนที่ลูปแบบ autoregressive ด้วยเครื่องกำเนิดฟีดฟอร์เวิร์ดตัวเดียวที่ได้รับการฝึกแบบตรงกันข้าม เคล็ดลับสำคัญคือการใช้ตัวแบ่งแยกหลายตัวเพื่อตัดสินเสียงในสเกลที่ต่างกันและตามรูปแบบคาบเวลาที่แตกต่างกัน บังคับให้เครื่องกำเนิดเพื่อให้ได้ทั้งเนื้อสัมผัสที่ละเอียดและระยะพิทช์ที่ถูกต้อง ผลลัพธ์ที่ได้คือเสียงพูด 22 kHz สังเคราะห์ได้เร็วกว่าเรียลไทม์บน GPU หลายร้อยเท่า โดยมีคุณภาพทัดเทียมเสียงจากพื้นดินจริง

ข้อมูลเชิงลึกทางเทคนิค

เครื่องกำเนิดของ HiFi-GAN จะอัปแซมเพิลเมลสเปกโตรแกรมผ่านการโน้มน้าวใจแบบทรานสโพส โดยมีบล็อก Multi-Receptive Field แบบเรียงซ้อนที่ผสมขนาดเคอร์เนลและการขยายที่แตกต่างกันเพื่อจับรูปแบบคลื่นที่หลากหลาย กลุ่มผู้เลือกปฏิบัติสองกลุ่มทำหน้าที่ตรวจตรา: กลุ่มแบ่งช่วงหลายช่วงจะปรับรูปร่างสัญญาณ 1D ให้เป็นตาราง 2 มิติที่ช่วงไพรม์ เช่น 2, 3, 5, 7, 11 เพื่อจับระยะของระยะพิตช์ และกลุ่มแบ่งช่วงหลายระดับจะตรวจสอบรูปคลื่นที่ความละเอียดที่ลดขนาดลงหลายระดับ การสูญเสียเมลสเปกโตรแกรมและการจับคู่คุณสมบัติทำให้การฝึกซ้อมมีความเสถียร

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของโวโคเดอร์ HiFi-GAN และ GAN

โวโคเดอร์ GAN มีขนาดเล็กลงและเร็วขึ้นเรื่อยๆ: ผู้สืบทอดเช่น BigVGAN เพิ่มการเปิดใช้งานแบบต่อต้านนามแฝงเพื่อพูดคุยทั่วไปกับนักร้อง เครื่องดนตรี และภาษาที่มองไม่เห็น ในขณะที่ UnivNet และ Vocos มุ่งสู่การสังเคราะห์แบบสากลและทุกแบนด์ เวอร์ชันสตรีมมิ่งและบนอุปกรณ์ตอนนี้เรียกใช้การเข้ารหัสเสียงภายในโทรศัพท์และเอียร์บัดสำหรับผู้ช่วยที่มีความหน่วงต่ำ โมเดลเสียงการแพร่กระจายและการจับคู่โฟลว์เพิ่มมากขึ้นเรื่อยๆ ได้รับการกลั่นให้เป็นเครื่องกำเนิดไฟฟ้าแบบ single-pass สไตล์ GAN ซึ่งผสมผสานความเที่ยงตรงของการแพร่กระจายเข้ากับความเร็ว GAN คาดหวังว่าตัวเข้ารหัสจะจางหายไปเป็นตัวแปลงสัญญาณเสียงแบบระบบประสาทที่ใช้งานทั่วไปซึ่งขับเคลื่อนทั้งเสียงพูดและเสียงเพลง

การใช้งานจริงในโลกแห่งความเป็นจริง

สร้างเอาต์พุตเสียงพูดของผู้ช่วยเสมือนและแอปนำทางที่ต้องการการตอบสนองโดยไม่มีความล่าช้าในการได้ยิน

ขับเคลื่อนเครื่องมือการโคลนเสียงและการพากย์เสียงแบบเรียลไทม์ โดยที่เมลสเปกโตรแกรมที่โคลนไว้จะถูกแปลงเป็นเสียงที่เป็นธรรมชาติ

ขับเคลื่อนแพลตฟอร์มการบรรยายหนังสือเสียงและพอดแคสต์ที่สังเคราะห์ชั่วโมงการพูดได้อย่างรวดเร็วและประหยัด

ทำหน้าที่เป็นเวทีรูปคลื่นภายในเครื่องสังเคราะห์เสียงร้องและการสาธิตดนตรีผ่านตัวแปลงเสียงสากลสไตล์ BigVGAN

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HiFi-GAN and GAN Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

ตัวเข้ารหัส WaveGAN แบบขนาน

คำถามที่พบบ่อย

What is HiFi-GAN and GAN Vocoders?

HiFi-GAN เป็นตัวแปลงเสียงแบบกำเนิดปฏิปักษ์ที่เปลี่ยนเมลสเปกโตรแกรมให้กลายเป็นรูปคลื่นเสียงดิบแทบจะในทันที ทำให้เสียงพูดคุณภาพระดับสตูดิโอเร็วกว่าเรียลไทม์มาก กลายเป็นขั้นตอนสุดท้ายมาตรฐานของการอ่านออกเสียงข้อความสมัยใหม่ เนื่องจากมีความรวดเร็ว ใช้งานง่าย และแยกแยะได้ยากจากการบันทึกจริง

งานหลักของนักร้องเช่น HiFi-GAN ในไปป์ไลน์การแปลงข้อความเป็นคำพูดคืออะไร?

โวโคเดอร์เป็นขั้นตอนสุดท้ายที่จะสังเคราะห์ตัวอย่างรูปคลื่นที่เกิดขึ้นจริงจากเมล-สเปกโตรแกรมที่สร้างโดยแบบจำลองทางเสียง

เหตุใด HiFi-GAN จึงเร็วกว่า vocoder WaveNet รุ่นก่อนมาก

WaveNet สร้างตัวอย่างเสียงต่อตัวอย่าง (ถอยอัตโนมัติ) ในขณะที่ตัวสร้างฟีดฟอร์เวิร์ดของ HiFi-GAN ส่งสัญญาณเอาท์พุตรูปคลื่นในช็อตเดียว ทำให้ได้ความเร็วที่เร็วกว่าเรียลไทม์อย่างมาก

Multi-Period Discriminator ของ HiFi-GAN ช่วยจับภาพอะไรเป็นพิเศษ

Multi-Period Discriminator ปรับรูปคลื่น 1D ให้เป็น 2D โดยใช้คาบที่เป็นเลขเฉพาะเพื่อตรวจจับโครงสร้างคาบที่เชื่อมโยงกับระดับเสียง

ผู้ร้อง GAN ได้รับการฝึกฝน 'ฝ่ายตรงข้าม' นั่นหมายความว่าอะไรที่นี่?

ในการตั้งค่า GAN เครื่องกำเนิดจะเรียนรู้ที่จะสร้างรูปคลื่นที่สมจริงพอที่จะหลอกเครือข่ายผู้แยกแยะที่ได้รับการฝึกฝนให้บอกเล่าของจริงจากเสียงสังเคราะห์

โวโคเดอร์ตัวใดในเวลาต่อมาที่ขยาย HiFi-GAN เพื่อสรุปเสียง การร้อง และเครื่องดนตรีที่มองไม่เห็นได้ดีกว่า

BigVGAN ขยายขนาด HiFi-GAN และเพิ่มการเปิดใช้งาน anti-aliased เป็นระยะ ปรับปรุงลักษณะทั่วไปของเสียงที่ไม่กระจาย เช่น การร้องเพลงและเครื่องดนตรี