คู่มือเสียง AI

เวฟเน็ต

WaveNet ซึ่งเปิดตัวโดย DeepMind ในปี 2559 เป็นโครงข่ายประสาทเทียมที่ก้าวล้ำซึ่งสร้างเสียงดิบครั้งละหนึ่งตัวอย่าง ทำให้เกิดเสียงพูดและเสียงที่เป็นธรรมชาติอย่างน่าทึ่ง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It set the modern standard for high-fidelity text-to-speech.

เจาะลึก

WaveNet เป็นโมเดลกำเนิดสัญญาณอัตโนมัติ: โดยคาดการณ์ตัวอย่างเสียงแต่ละตัวอย่างที่มีเงื่อนไขกับตัวอย่างทั้งหมดที่อยู่ก่อนหน้า โดยทั่วไปจะอยู่ที่ 16,000 หรือ 24,000 ตัวอย่างต่อวินาที นวัตกรรมหลักของมันคือการโน้มน้าวใจเชิงสาเหตุแบบซ้อน สาเหตุหมายถึงแบบจำลองดูย้อนหลังเท่านั้น โดยรักษาลำดับการสร้าง การขยายหมายถึงแต่ละเลเยอร์จะข้ามจำนวนตัวอย่างที่เพิ่มขึ้นแบบทวีคูณ ดังนั้นสแต็กขนาดเล็กจึงครอบคลุมตัวอย่างหลายพันตัวอย่าง (ช่องรับสัญญาณที่กว้าง) โดยไม่มีค่าใช้จ่ายจำนวนมาก ด้วยคุณสมบัติทางภาษาหรือเมลสเปกโตรแกรม WaveNet จึงสร้างเสียงพูดที่เป็นธรรมชาติมากกว่าตัวแปลงเสียงแบบต่อกันและแบบพาราเมตริกที่อยู่ก่อนหน้า ซึ่งปิดช่องว่างอย่างมากจากการบันทึกของมนุษย์และขับเคลื่อน Google Assistant เวอร์ชันแรกๆ

ข้อมูลเชิงลึกทางเทคนิค

การบิดแบบขยายเป็นเคล็ดลับสำคัญ: ด้วยอัตราการขยายที่ 1, 2, 4, 8 และอื่น ๆ เครือข่ายที่มีความลึกเพียงสิบชั้นเท่านั้นที่สามารถจัดการกับตัวอย่างที่ผ่านมาหลายพันตัวอย่าง โดยจับทั้งรายละเอียดรูปคลื่นที่ละเอียดและโครงสร้างฉันทลักษณ์ที่ยาวขึ้น เอาต์พุตจำลองค่าของแต่ละตัวอย่างเป็นการแจกแจงตามหมวดหมู่ (แต่เดิม 256 ระดับผ่านการรวม mu-law) และหน่วยการเปิดใช้งานแบบมีรั้วรอบขอบชิดบวกกับการเชื่อมต่อที่เหลือและแบบข้ามทำให้การฝึกสแต็คที่ลึกมากนี้มีเสถียรภาพ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของ WaveNet

WaveNet ดั้งเดิมทำงานช้าเนื่องจากการสุ่มตัวอย่างเป็นไปตามลำดับ ผู้สืบทอดได้แก้ไขปัญหานี้: Parallel WaveNet และ WaveRNN เปิดใช้งานการสังเคราะห์แบบเรียลไทม์ และตัวแสดงเสียงที่ใช้ Flow และ GAN ในภายหลัง เช่น WaveGlow และ HiFi-GAN รวมถึงตัวแสดงเสียงแบบแพร่กระจาย ช่วยผลักดันคุณภาพและความเร็วให้ดียิ่งขึ้น แนวคิดการถอยกลับอัตโนมัติและการหมุนวนแบบขยายของ WaveNet ยังคงอยู่ในระบบเหล่านี้ และมีอิทธิพลต่อสถาปัตยกรรมนอกเหนือจากเสียง โดยผนึกมรดกในการสร้างแบบจำลองเชิงกำเนิด

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างเสียงที่เป็นธรรมชาติสำหรับ Google Assistant และ Google Cloud Text-to-Speech

ทำหน้าที่เป็นตัวแสดงประสาทที่เปลี่ยนเมลสเปกโตรแกรมให้เป็นรูปคลื่นในไปป์ไลน์ TTS เช่น Tacotron 2

การสังเคราะห์เปียโนและดนตรีบรรเลงที่สมจริงจากเสียงดิบ

การสังเคราะห์เสียงสำหรับเครื่องมือช่วยการเข้าถึงและการบรรยายหนังสือเสียง

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WaveNet quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การตรวจจับเสียง Deepfake

คำถามที่พบบ่อย

What is WaveNet?

WaveNet ซึ่งเปิดตัวโดย DeepMind ในปี 2559 เป็นโครงข่ายประสาทเทียมที่ก้าวล้ำซึ่งสร้างเสียงดิบครั้งละหนึ่งตัวอย่าง ทำให้เกิดเสียงพูดและเสียงที่เป็นธรรมชาติอย่างน่าทึ่ง โดยกำหนดมาตรฐานสมัยใหม่สำหรับการอ่านออกเสียงข้อความที่มีความเที่ยงตรงสูง

WaveNet สร้างเสียงได้อย่างไร

WaveNet เป็นแบบถดถอยอัตโนมัติ: โดยคาดการณ์ตัวอย่างเสียงแต่ละตัวอย่างตามตัวอย่างที่อยู่ก่อนหน้า

นวัตกรรม Convolutional ที่สำคัญใน WaveNet คืออะไร?

การบิดเบี้ยวเชิงสาเหตุแบบขยายช่วยให้เครือข่ายครอบคลุมตัวอย่างในอดีตหลายพันตัวอย่างได้อย่างมีประสิทธิภาพในขณะที่มองย้อนกลับไปในเวลาเท่านั้น

เหตุใดการขยายจึงช่วย WaveNet

อัตราการขยายตัวที่เพิ่มขึ้นแบบทวีคูณทำให้มีเขตข้อมูลการรับสัญญาณที่กว้างสำหรับตัวอย่างหลายพันตัวอย่างที่มีชั้นค่อนข้างน้อย

อะไรคือข้อเสียเปรียบในทางปฏิบัติที่สำคัญของ WaveNet ดั้งเดิม?

เนื่องจากแต่ละตัวอย่างขึ้นอยู่กับตัวอย่างก่อนหน้านี้ การสร้างจึงเป็นไปตามลำดับจึงช้า จึงเป็นแรงจูงใจให้กับ Parallel WaveNet และผู้สืบทอดรายอื่นๆ

ในไปป์ไลน์การแปลงข้อความเป็นคำพูด WaveNet มักทำหน้าที่เป็นอะไร

WaveNet สามารถใช้เมล-สเปกโตรแกรม (เช่น จาก Tacotron 2) และสร้างรูปคลื่นสุดท้ายที่ทำให้เกิดเสียงเป็นธรรมชาติ