Vocoding ตัวกรองแหล่งที่มาและ WORLD
โวโคเดอร์เป็นเครื่องมือที่แยกคำพูดออกเป็นองค์ประกอบหลักแล้วสร้างใหม่
ภาพรวม
The source-filter model and the WORLD vocoder are classic methods that power text-to-speech and voice conversion by separating what your vocal cords do from what your mouth shapes.
เจาะลึก
โมเดลตัวกรองแหล่งที่มาอธิบายคำพูดเป็นสองส่วนทำงานร่วมกัน: แหล่งที่มา (เสียงกระหึ่มจากเส้นเสียงที่สั่นสำหรับเสียงที่เปล่งออกมา หรืออากาศที่มีเสียงดังสำหรับเสียงกระซิบและพยัญชนะ) ผ่านตัวกรอง (รูปร่างที่ก้องกังวานของลำคอ ปาก และจมูก) ตัวแปลงเสียงจะวิเคราะห์เสียงที่บันทึกไว้เพื่อประมาณค่าชิ้นส่วนเหล่านี้ จากนั้นจึงสังเคราะห์เสียงใหม่จากเสียงเหล่านั้น WORLD ซึ่งเปิดตัวโดย Masanori Morise ประมาณปี 2016 เป็นโวโคเดอร์คุณภาพสูงที่แยกพารามิเตอร์ 3 ตัว ได้แก่ F0 (รูปร่างของระดับเสียงของแหล่งกำเนิด) เปลือกสเปกตรัม (ตัวกรอง ผ่านอัลกอริธึม CheapTrick) และค่าความสม่ำเสมอ (ปริมาณนอยส์เทียบกับโทนเสียง ผ่านทาง PLATINUM/D4C) สตรีมทั้งสามนี้สามารถปรับเปลี่ยนได้อย่างอิสระแล้วจึงสังเคราะห์ใหม่ ทำให้ WORLD เป็นเหมือนเครื่องมือสำหรับ Parametric TTS และระบบเสียงร้องเพลง
ข้อมูลเชิงลึกทางเทคนิค
พลังของโลกมาจากการแบ่งแยกที่สะอาด CheapTrick ประมาณการขอบเขตสเปกตรัมที่ราบรื่นซึ่งทนทานต่อข้อผิดพลาด F0 เล็กน้อย ในขณะที่ระยะพิทช์ของแทร็ก DIO/Harvest และ D4C จะวัดค่าความไม่สม่ำเสมอของแถบความถี่ เนื่องจากระดับเสียงสูงต่ำ ต่ำ และเสียงนอยส์อยู่ในสตรีมพารามิเตอร์ที่แยกจากกัน คุณสามารถเลื่อน F0 ขึ้นหนึ่งอ็อกเทฟได้โดยไม่ต้องเปลี่ยนลักษณะของเสียง หรือขยายระยะเวลาโดยไม่ต้องเปลี่ยนระดับเสียงสูงต่ำ ตัวเข้ารหัสประสาทอย่าง WaveNet ได้สร้างแบบจำลองรูปแบบของคลื่นโดยตรงในภายหลัง แต่ WORLD ยังคงรวดเร็ว ตีความได้ และไม่มีใบอนุญาต
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของ Vocoding ของตัวกรองแหล่งที่มาและ WORLD
โวโคเดอร์ที่ประมวลผลสัญญาณบริสุทธิ์ส่วนใหญ่ถูกครอบงำโดยโวโคเดอร์แบบนิวรัล (HiFi-GAN, WaveRNN) เพื่อความเป็นธรรมชาติระดับบนสุด แต่ WORLD ก็ไม่ได้หายไป มันยังคงอยู่ได้ในฐานะส่วนหน้าที่รวดเร็วและเป็นมิตรกับ CPU ภายในไปป์ไลน์การแปลงเสียง เครื่องสังเคราะห์เสียงร้องเพลง และพื้นฐานการวิจัย และฟีเจอร์ F0-plus-spectral-envelope ยังคงป้อนโมเดลประสาทจำนวนมาก คาดหวังระบบไฮบริดที่พารามิเตอร์ที่ตีความได้สไตล์ WORLD นำทางตัวถอดรหัสประสาท ทำให้ผู้สร้างสามารถควบคุมระดับเสียงและจังหวะได้อย่างแม่นยำโดยไม่สูญเสียความสมจริง
การใช้งานจริงในโลกแห่งความเป็นจริง
เครื่องมือแปลงเสียงที่เปลี่ยนระดับเสียงและน้ำเสียงของผู้พูดโดยยังคงรักษาคำพูดให้เข้าใจได้
เครื่องสังเคราะห์เสียงร้องเพลง (เช่น ระบบนิเวศ UTAU/NNSVS) ที่สังเคราะห์โน้ตอีกครั้งในระดับเสียงสูงต่ำใหม่
ระบบแปลงข้อความเป็นคำพูดแบบพาราเมตริกที่สร้างสตรีม F0, สเปกตรัม และช่วงระยะเวลาก่อนการเข้ารหัส
พื้นฐานการวิจัยคำพูดสำหรับการเปลี่ยนระดับเสียง การยืดเวลา และการแก้ไขฉันทลักษณ์โดยไม่ต้องฝึกอบรมซ้ำ
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Source-Filter Vocoding and WORLD quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การแยกแหล่งที่มาของเพลง Demucs
คำถามที่พบบ่อย
What is Source-Filter Vocoding and WORLD?
โวโคเดอร์เป็นเครื่องมือที่แยกคำพูดออกเป็นองค์ประกอบหลักแล้วสร้างใหม่ โมเดลตัวกรองแหล่งที่มาและตัวแปลงเสียง WORLD เป็นวิธีการแบบคลาสสิกที่ขับเคลื่อนการแปลงข้อความเป็นคำพูดและเสียงโดยแยกสิ่งที่สายเสียงของคุณทำออกจากรูปร่างปากของคุณ
ในรูปแบบคำพูดของตัวกรองแหล่งที่มา 'ตัวกรอง' หมายถึงอะไร
ตัวกรองคือการสั่นพ้องของระบบเสียง เช่น รูปร่างของลำคอ ปาก และจมูกที่สร้างสีสันให้กับเสียง แหล่งที่มาคือเสียงกระหึ่มของสายเสียงหรือกระแสลมที่มีเสียงดัง
พารามิเตอร์สามตัวใดที่ WORLD vocoder แยกออกมาจากคำพูด
WORLD แบ่งย่อยคำพูดเป็นความถี่พื้นฐาน (F0) กรอบสเปกตรัม (เสียง/ตัวกรอง) และความไม่แน่นอน (ความสมดุลของเสียงกับโทนเสียง)
อัลกอริธึมของโลกสำหรับการประมาณค่าเปลือกสเปกตรัมชื่ออะไร
CheapTrick ประมาณการขอบเขตสเปกตรัมที่ราบรื่นซึ่งทนทานจนถึงข้อผิดพลาดเล็กน้อยในการประมาณระยะพิทช์
เหตุใดการแยกระดับเสียงออกจากซองสเปกตรัมจึงมีประโยชน์
เนื่องจากระดับเสียงสูงต่ำ (F0) และเสียงต่ำ (ขอบเขตสเปกตรัม) เป็นกระแสที่เป็นอิสระ คุณจึงสามารถเพิ่มหรือลดระดับเสียงสูงต่ำได้ในขณะที่ยังคงรักษาเอกลักษณ์ของผู้พูดเอาไว้
WORLD เปรียบเทียบกับตัวแปลงสัญญาณประสาทอย่าง HiFi-GAN ได้อย่างไร
WORLD เป็นตัวประมวลผลสัญญาณ: รวดเร็ว ตีความได้ และเป็นมิตรกับ CPU โดยทั่วไปแล้ว vocoder ของระบบประสาทจะได้ความเป็นธรรมชาติสูงกว่าแต่จะหนักกว่า