คู่มือเสียง AI

โวโคเดอร์ประสาท

โวโคเดอร์แบบนิวรอลคือโมเดลที่เปลี่ยนการแสดงเสียงอะคูสติกขนาดกะทัดรัด ซึ่งโดยปกติจะเป็นเมลสเปกโตรแกรม ให้เป็นรูปแบบคลื่นเสียงที่ได้ยินจริง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the final stage that gives modern text-to-speech and voice cloning their natural, human sound.

เจาะลึก

การสังเคราะห์เสียงพูดแบบดั้งเดิมใช้ตัวประมวลผลสัญญาณที่มักฟังดูพึมพำหรือเป็นหุ่นยนต์ ตัวแปลงเสียงแบบนิวรอลเรียนรู้การสร้างตัวอย่างเสียงดิบขึ้นมาใหม่จากสเปกโตรแกรมโดยการฝึกบันทึกเสียงจริงหลายชั่วโมง WaveNet (DeepMind, 2016) เป็นความก้าวหน้าโดยคาดการณ์ตัวอย่างเสียงครั้งละ 16,000 ตัวอย่างต่อวินาที ซึ่งให้เสียงพูดที่เป็นธรรมชาติอย่างน่าทึ่งแต่ช้ามาก รุ่นต่อมาแลกว่าปัญหาคอขวดแบบถอยหลังอัตโนมัติเพื่อความเร็ว: WaveGlow ใช้การสร้างแบบไหลตาม, Parallel WaveGAN และ MelGAN ใช้เครือข่ายที่สร้างความขัดแย้ง และ HiFi-GAN กลายเป็นมาตรฐานยอดนิยมโดยการสร้างเสียง 22kHz ความเที่ยงตรงสูงที่เร็วกว่าเรียลไทม์อย่างมาก ในปัจจุบัน โวโคเดอร์มักจะเป็นครึ่งหลังของไปป์ไลน์แบบสองขั้นตอน จับคู่กับโมเดลอะคูสติกอย่าง Tacotron 2 หรือ FastSpeech ที่สร้างเมลสเปกโตรแกรม

ข้อมูลเชิงลึกทางเทคนิค

เมลสเปกโตรแกรมจะละทิ้งข้อมูลเฟสของเสียง โดยจะคงเฉพาะพลังงานที่กระจายไปตามคลื่นความถี่ในช่วงเวลาหนึ่งเท่านั้น งานหนักของผู้พากย์เสียงคือการประดิษฐ์รูปคลื่นที่สอดคล้องกันและเป็นไปได้ซึ่งมีสเปกตรัมขนาดตรงกับอินพุตนั้น โวโคเดอร์ที่ใช้ GAN เช่น HiFi-GAN ใช้ตัวแยกแยะหลายตัวที่จะตรวจสอบสัญญาณในระดับและช่วงเวลาที่แตกต่างกัน โดยผลักดันเครื่องกำเนิดเพื่อสร้างรายละเอียดที่ละเอียดสมจริง เช่น ฮาร์โมนิคและทรานเชียนต์ที่คมชัดของพยัญชนะ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ Vocoder ประสาท

โวโคเดอร์มีขนาดเล็กลงและเร็วขึ้น จึงสามารถทำงานบนโทรศัพท์และอุปกรณ์ฝังตัวได้โดยไม่ต้องเชื่อมต่อระบบคลาวด์ นอกจากนี้ยังมีการผลักดันไปสู่ผู้ออกเสียงที่เป็นสากลซึ่งพูดคุยทั่วไปกับผู้พูด ภาษา การร้องเพลง หรือแม้แต่เสียงที่ไม่ใช่คำพูดโดยไม่ต้องมีการฝึกอบรมใหม่ แนวโน้มแบบขนานจะพับ vocoder เข้าสู่ระบบ end-to-end และตัวแปลงสัญญาณประสาทโดยตรง ทำให้เส้นแบ่งระหว่างขั้นตอนอะคูสติกและรูปคลื่นแยกจากกัน และลดสิ่งแปลกปลอมที่เกิดจากการส่งผ่านสเปกโตรแกรมระดับกลาง

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างเสียงพูดในขั้นสุดท้ายในตัวช่วยแปลงข้อความเป็นคำพูด เช่น โปรแกรมอ่านหน้าจอและแอปการนำทาง

สร้างเสียงโคลนที่เป็นธรรมชาติในเครื่องมือพากย์และคำบรรยายในหนังสือเสียง

สร้างเสียงร้องใหม่ในเพลง AI และซอฟต์แวร์นักร้องเสมือน

การเปิดเอาต์พุตเสียงบนอุปกรณ์สำหรับลำโพงอัจฉริยะและอุปกรณ์ช่วยการเข้าถึงโดยไม่ต้องส่งเซิร์ฟเวอร์ไปกลับ

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Neural Vocoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

โวโคเดอร์ HiFi-GAN และ GAN

คำถามที่พบบ่อย

What is Neural Vocoders?

โวโคเดอร์แบบนิวรอลคือโมเดลที่เปลี่ยนการแสดงเสียงอะคูสติกขนาดกะทัดรัด ซึ่งโดยปกติจะเป็นเมลสเปกโตรแกรม ให้เป็นรูปแบบคลื่นเสียงที่ได้ยินจริง เป็นขั้นตอนสุดท้ายที่ให้การโคลนการอ่านออกเสียงข้อความและเสียงสมัยใหม่ที่เป็นธรรมชาติและเป็นธรรมชาติ

งานหลักของ vocoder ประสาทคืออะไร?

ตัวแปลงเสียงแบบนิวรอลใช้คุณสมบัติเสียงขนาดกะทัดรัด ซึ่งโดยทั่วไปจะเป็นเมลสเปกโตรแกรม และสังเคราะห์รูปคลื่นเสียงดิบตามจริงที่คุณได้ยิน

รุ่นปี 2016 รุ่นใดที่เป็นความก้าวหน้าที่ทำให้ผู้แสดงเสียงระบบประสาทฟังดูเป็นธรรมชาติ

WaveNet จาก DeepMind ในปี 2559 ได้สร้างตัวอย่างเสียงทีละตัวอย่าง และสร้างเสียงพูดที่เป็นธรรมชาติอย่างน่าทึ่ง โดยเป็นการเริ่มต้นยุคของตัวแปลงเสียงแบบระบบประสาท

เหตุใด WaveNet ดั้งเดิมจึงสร้างเสียงช้า

WaveNet เป็นแบบอัตโนมัติ: แต่ละตัวอย่างเสียงขึ้นอยู่กับตัวอย่างก่อนหน้า ดังนั้นการสร้างตัวอย่างนับหมื่นต่อวินาทีจึงมีราคาแพงในการคำนวณ

เมลสเปกโตรแกรมทิ้งข้อมูลอะไรไปเป็นพิเศษ ทำให้งานของผู้พูดยากขึ้น

เมล-สเปกโตรแกรมจะรักษาขนาด (พลังงานต่อย่านความถี่) ไว้แต่มีเฟสลดลง ดังนั้น โวโคเดอร์จะต้องสร้างรูปคลื่นที่สอดคล้องกันขึ้นมาใหม่ซึ่งมีเฟสที่เป็นไปได้

vocoders ที่ใช้ GAN เช่น HiFi-GAN ปรับปรุงความสมจริงได้อย่างไร

HiFi-GAN ใช้ตัวแบ่งแยกหลายตัวในการตรวจสอบมาตราส่วนเวลาและช่วงเวลาที่แตกต่างกัน โดยผลักดันให้เครื่องกำเนิดสร้างฮาร์โมนิคและภาวะชั่วคราวที่สมจริง