Vocoder ที่ใช้ WaveGlow Flow
WaveGlow คือเครื่องแปลงเสียงแบบนิวรัลแบบโฟลว์จาก NVIDIA ที่สังเคราะห์รูปคลื่นคำพูดจากเมลสเปกโตรแกรมในการส่งผ่านครั้งเดียวโดยไม่มีการถดถอยอัตโนมัติ
ภาพรวม
มันสําคัญเพราะมันให้เสียงคุณภาพสูงได้เร็วกว่าเวลาจริงโดยใช้เพียงการสูญเสียความน่าจะเป็นอย่างง่าย
เจาะลึก
WaveGlow เปิดตัวโดย Prenger, Valle และ Catanzaro ที่ NVIDIA ในปี 2018 ผสมผสานแนวคิดจาก Glow และ WaveNet เพื่อสร้าง vocoder ที่ทั้งรวดเร็วและง่ายต่อการฝึกฝน ต่างจากโวโคเดอร์ GAN ตรงที่เป็นโฟลว์การทำให้เป็นมาตรฐาน โดยเรียนรู้การแมปแบบกลับด้านได้ระหว่างการแจกแจงแบบเกาส์เซียนอย่างง่ายและรูปคลื่นเสียง ซึ่งมีเงื่อนไขบนเมลสเปกโตรแกรม การฝึกอบรมช่วยเพิ่มโอกาสบันทึกที่แน่นอนของข้อมูลได้สูงสุด ดังนั้นจึงไม่จำเป็นต้องมีตัวแบ่งแยก ไม่มีการถดถอยอัตโนมัติ และไม่มีการกลั่นกรองครู-นักเรียนแบบสองเครือข่ายที่ต้องใช้แนวทาง WaveNet แบบขนานก่อนหน้านี้ ในการสร้างเสียง คุณจะต้องสุ่มตัวอย่างเสียงเกาส์เซียนและเรียกใช้เครือข่ายแบบย้อนกลับได้ WaveGlow สร้างเสียงพูดที่มีคุณภาพเทียบเท่ากับ WaveNet ในขณะที่สังเคราะห์ได้เร็วกว่าเรียลไทม์บน GPU สมัยใหม่มาก
ข้อมูลเชิงลึกทางเทคนิค
WaveGlow ซ้อนขั้นตอนการไหลแบบผันกลับได้ โดยแต่ละขั้นตอนจะรวมเลเยอร์คัปปลิ้งแบบแอฟฟินเข้ากับการหมุนเวียนแบบย้อนกลับขนาด 1x1 ที่ยืมมาจาก Glow ตัวอย่างเสียงจะถูกจัดกลุ่มเป็นเวกเตอร์ผ่านการบีบเพื่อให้เลเยอร์ที่เชื่อมต่อจึงสามารถแปลงได้อย่างมีประสิทธิภาพ เนื่องจากทุกขั้นตอนสามารถย้อนกลับได้ ทิศทางไปข้างหน้าจะคำนวณโอกาสในการฝึก และทิศทางย้อนกลับจะจับคู่เสียงเป็นเสียงเพื่อการอนุมาน เครือข่ายเดียวและวัตถุประสงค์บันทึกแนวโน้มเชิงลบหนึ่งรายการทำให้การฝึกอบรมมีความเสถียรและเรียบง่ายอย่างเห็นได้ชัด
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ Vocoder ที่ใช้ WaveGlow Flow
WaveGlow แสดงให้เห็นว่าตัวสร้างเสียงแบบ Pure Flow สามารถแข่งขันกับคุณภาพเสียงแบบ autoregressive ได้ โดยส่งผลต่อโมเดลเสียงที่ไหลลื่นและจับคู่การไหลในภายหลัง ความเรียบง่ายแบบสูญเสียครั้งเดียวยังคงน่าดึงดูด แม้ว่าโวโคเดอร์ GAN เช่น HiFi-GAN มักจะชนะในเรื่องขนาดและความเร็ว เมื่อมองไปข้างหน้า แนวคิดที่อิงตามโฟลว์และการจับคู่โฟลว์กำลังฟื้นคืนชีพขึ้นมาใน TTS แบบกระจายที่อยู่ติดกันสมัยใหม่ และการออกแบบแบบกลับด้านได้สไตล์ WaveGlow ยังคงให้ข้อมูลการวิจัยเกี่ยวกับความน่าจะเป็นที่แน่นอน ควบคุมได้ และมีประสิทธิภาพในการสร้างรูปคลื่น
การใช้งานจริงในโลกแห่งความเป็นจริง
จับคู่กับ Tacotron 2 ในไปป์ไลน์ TTS อ้างอิงของ NVIDIA เพื่อสร้างเสียงพูดคุณภาพระดับสตูดิโอที่เป็นธรรมชาติ
การสังเคราะห์เสียงพูดของ GPU ที่รวดเร็วสำหรับการบรรยาย การพากย์ และเวิร์กโฟลว์การสร้างเนื้อหา
การสร้างเสียงการฝึกอบรมและการสาธิตในการวิจัยที่ต้องการการฝึกอบรมแบบสูญเสียครั้งเดียวที่มีความเสถียร
เอาต์พุตเสียงแบบเรียลไทม์ในระบบโต้ตอบที่ทำงานบนฮาร์ดแวร์ NVIDIA
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the WaveGlow Flow-Based Vocoder quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสร้างคำพูดที่จับคู่การไหลของกล่องเสียง
คำถามที่พบบ่อย
โวโคเดอร์ที่ใช้โวโคเดอร์แบบ FlowGlow คืออะไร?
WaveGlow คือเครื่องแปลงเสียงแบบนิวรัลแบบโฟลว์จาก NVIDIA ที่สังเคราะห์รูปคลื่นคำพูดจากเมลสเปกโตรแกรมในการส่งผ่านครั้งเดียวโดยไม่มีการถดถอยอัตโนมัติ สิ่งสำคัญคือให้เสียงคุณภาพสูงได้เร็วกว่าเรียลไทม์โดยสูญเสียโอกาสเพียงเล็กน้อยเท่านั้น
WaveGlow ผสมผสานแนวคิดทางสถาปัตยกรรมจาก 2 รุ่นใดบ้าง
WaveGlow หลอมรวมโครงสร้างการไหลแบบย้อนกลับของ Glow เข้ากับการออกแบบการสร้างแบบจำลองเสียงของ WaveNet
WaveGlow เป็นรุ่นอะไรคะ?
WaveGlow คือโฟลว์การทำให้เป็นมาตรฐานที่เรียนรู้การแมปแบบย้อนกลับได้ระหว่างเสียงแบบเกาส์เซียนและเสียง
WaveGlow สร้างรูปคลื่นในเวลาอนุมานได้อย่างไร
เนื่องจากเครือข่ายสามารถย้อนกลับได้ คุณจึงวาดสัญญาณรบกวนแบบเกาส์เซียนและไหลย้อนกลับ โดยมีเงื่อนไขบนเมลสเปกโตรแกรม
WaveGlow ปรับวัตถุประสงค์ใดระหว่างการฝึก?
ในระหว่างการไหล WaveGlow จะเพิ่มความเป็นไปได้ของบันทึกที่แน่นอนสูงสุด โดยไม่ต้องมีการเลือกปฏิบัติหรือการกลั่น
องค์ประกอบสองข้อใดที่ประกอบเป็นแต่ละขั้นตอนแบบย้อนกลับได้ใน WaveGlow
ขั้นตอนการไหลแต่ละขั้นตอนจะจับคู่เลเยอร์คัปปลิ้งแบบแอฟฟินกับการบิดแบบกลับด้านได้ 1x1 ที่รับมาจาก Glow