การสังเคราะห์คำพูดจากต้นทางถึงปลายทางของ VITS
VITS เป็นโมเดลการอ่านออกเสียงข้อความที่เปลี่ยนข้อความให้เป็นรูปแบบคลื่นเสียงโดยตรงในระบบที่ผ่านการฝึกอบรมระบบเดียว โดยข้ามไปป์ไลน์แบบสองขั้นตอนตามปกติ
ภาพรวม
By combining variational inference with adversarial training, it produces remarkably natural, expressive speech.
เจาะลึก
VITS (การอนุมานแบบแปรผันพร้อมการเรียนรู้แบบตรงข้ามสำหรับการอ่านออกเสียงข้อความจากต้นทางถึงปลายทาง) ซึ่งเปิดตัวโดย Kim, Kong และ Son ในปี 2021 ได้หลอมรวมแนวคิดสามประการที่ระบบเก่าเก็บแยกจากกัน ตัวเข้ารหัสอัตโนมัติแบบแปรผันแบบมีเงื่อนไข (VAE) เรียนรู้การแสดงเสียงพูดที่แฝงอยู่ โฟลว์ไลซ์ไลซ์ให้เป็นมาตรฐานทำให้การกระจายเสียงที่แฝงนั้นมีความยืดหยุ่นเพียงพอที่จะจับรายละเอียดเสียงอะคูสติกอย่างละเอียด และเครื่องแยกแยะสไตล์ GAN จะดันรูปคลื่นที่สร้างขึ้นไปสู่ความสมจริง สิ่งสำคัญอย่างยิ่งคือ VITS จะฝึกโมเดลอะคูสติกและโวโคเดอร์ร่วมกันแทนที่จะเป็นสองสเตจ เพื่อขจัดความไม่ตรงกันซึ่งจะลดคุณภาพลงเมื่อโมดูลได้รับการฝึกฝนแยกกัน นอกจากนี้ยังแนะนำตัวทำนายระยะเวลาสุ่ม เพื่อให้สามารถพูดประโยคเดียวกันโดยมีจังหวะที่แตกต่างกันและฟังดูเป็นธรรมชาติในแต่ละครั้ง
ข้อมูลเชิงลึกทางเทคนิค
VITS แก้ปัญหาการจัดตำแหน่งด้วย Monotonic Alignment Search (MAS) ซึ่งค้นหาการจับคู่ที่ดีที่สุดระหว่างโทเค็นข้อความและเฟรมเสียงระหว่างการฝึกโดยไม่ต้องใช้เครื่องมือจัดตำแหน่งภายนอก ส่วนหลังของ VAE นั้นคำนวณจากเสียงจริง ในขณะที่ข้อความที่มีเงื่อนไขก่อนหน้านี้จะถูกปรับรูปร่างใหม่โดยการปรับโฟลว์ให้เป็นมาตรฐานเพื่อให้ตรงกัน ในการอนุมาน คุณจะสุ่มตัวอย่างจากข้อความก่อนหน้าและถอดรหัสโดยตรงเป็นรูปคลื่น ดังนั้นจึงไม่จำเป็นต้องแยกเมลสเปกโตรแกรมและไม่จำเป็นต้องแยกโวโคเดอร์
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการสังเคราะห์คำพูดจากต้นทางถึงปลายทางของ VITS
VITS สร้างตระกูลผู้สืบทอดที่ครอง TTS แบบโอเพ่นซอร์ส VITS2 ทำให้สถาปัตยกรรมง่ายขึ้นและปรับปรุงความเป็นธรรมชาติ ในขณะที่ YourTTS และ Coqui XTTS ที่ใช้กันอย่างแพร่หลายได้ขยายแนวทางในการโคลนเสียงแบบ Zero-shot และหลายภาษา คาดหวังการทำงานอย่างต่อเนื่องกับเวอร์ชันบนอุปกรณ์ที่เบากว่าแบบเรียลไทม์ ความครอบคลุมหลายภาษาที่ดีขึ้นสำหรับภาษาที่มีทรัพยากรต่ำ และการควบคุมอารมณ์และรูปแบบการพูดที่เข้มงวดยิ่งขึ้น เนื่องจากการออกแบบตั้งแต่ต้นจนจบเป็นรากฐานที่น่าดึงดูดและเป็นที่เข้าใจกันดีในการต่อยอด
การใช้งานจริงในโลกแห่งความเป็นจริง
Coqui TTS จัดส่งโมเดลที่ใช้ VITS ซึ่งนักพัฒนาปรับแต่งอย่างละเอียดเพื่อโคลนเสียงของผู้บรรยายเฉพาะสำหรับหนังสือเสียง
ตัวช่วยเสียงแบบโอเพนซอร์สบนฮาร์ดแวร์คลาส Raspberry Pi ใช้รุ่น VITS ขนาดกะทัดรัดสำหรับเอาต์พุตเสียงพูดแบบออฟไลน์โดยสมบูรณ์
แอพการเรียนรู้ภาษาสร้างตัวอย่างการออกเสียงที่เป็นธรรมชาติโดยใช้ตัวแปร VITS หลายภาษา เช่น YourTTS
สตูดิโอเกมอินดี้สังเคราะห์บทสนทนาของ NPC ที่หลากหลาย โดยอาศัยตัวทำนายระยะเวลาสุ่มสำหรับจังหวะที่ไม่ใช่หุ่นยนต์
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the VITS End-to-End Speech Synthesis quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การสังเคราะห์คำพูดทางอารมณ์
คำถามที่พบบ่อย
What is VITS End-to-End Speech Synthesis?
VITS เป็นโมเดลการอ่านออกเสียงข้อความที่เปลี่ยนข้อความให้เป็นรูปแบบคลื่นเสียงโดยตรงในระบบที่ผ่านการฝึกอบรมระบบเดียว โดยข้ามไปป์ไลน์แบบสองขั้นตอนตามปกติ ด้วยการรวมการอนุมานแบบแปรผันเข้ากับการฝึกอบรมฝ่ายตรงข้าม ทำให้เกิดคำพูดที่เป็นธรรมชาติและแสดงออกอย่างน่าทึ่ง
VITS ย่อมาจากอะไร?
VITS ย่อมาจาก Variational Inference พร้อมการเรียนรู้แบบตรงข้ามสำหรับการอ่านออกเสียงข้อความจากต้นทางถึงปลายทาง ซึ่งสะท้อนถึงองค์ประกอบหลักสามประการของ VITS
อะไรคือความแตกต่างทางสถาปัตยกรรมที่สำคัญระหว่าง VITS และไปป์ไลน์ TTS แบบดั้งเดิม?
VITS เป็นแบบ end-to-end: เรียนรู้รูปแบบข้อความเป็นคลื่นในโมเดลเดียว หลีกเลี่ยงความไม่ตรงกันของโมเดลอะคูสติกและโวโคเดอร์ที่แยกจากกัน
VITS เรียนรู้การจัดตำแหน่งระหว่างกรอบข้อความและเสียงได้อย่างไร
VITS ใช้ Monotonic Alignment Search เพื่อค้นหาการจัดตำแหน่งข้อความเป็นเฟรมที่ดีที่สุดภายใน โดยไม่ต้องใช้ตัวจัดตำแหน่งภายนอก
เหตุใด VITS จึงรวมตัวทำนายระยะเวลาสุ่มไว้ด้วย
ตัวทำนายระยะเวลาสุ่มช่วยให้พูดประโยคเดียวกันด้วยจังหวะธรรมชาติที่แตกต่างกัน หลีกเลี่ยงจังหวะหุ่นยนต์ที่ราบเรียบ
ส่วนประกอบใดที่ผลักดันเอาต์พุต VITS ไปสู่เสียงที่ฟังดูสมจริง
VITS ใช้การฝึกอบรมฝ่ายตรงข้าม (GAN) โดยผู้เลือกปฏิบัติจะตัดสินว่ารูปคลื่นฟังดูสมจริงหรือไม่ ซึ่งจะช่วยปรับปรุงคุณภาพการรับรู้