StyleTTS 2 การกระจายสไตล์
StyleTTS 2 เป็นโมเดลการแปลงข้อความเป็นคำพูดที่ถือว่า 'สไตล์' ของเสียง — ฉันทลักษณ์ อารมณ์ และเสียงของผู้พูด — เป็นตัวแปรสุ่มสุ่มตัวอย่างด้วยโมเดลการแพร่กระจาย จากนั้นสังเคราะห์เสียงด้วยการฝึกอบรมฝ่ายตรงข้ามกับโมเดลภาษาพูดขนาดใหญ่
ภาพรวม
It matters because it reached human-level naturalness on single-speaker benchmarks without needing a reference clip at inference time.
เจาะลึก
StyleTTS 2 ซึ่งเปิดตัวในปี 2023 โดยนักวิจัยจากมหาวิทยาลัยโคลัมเบีย สร้างคำพูดโดยการสุ่มตัวอย่าง 'สไตล์เวกเตอร์' ที่แฝงอยู่เป็นครั้งแรก โดยใช้กระบวนการแพร่กระจายที่มีเงื่อนไขเฉพาะในข้อความอินพุต จากนั้นถอดรหัสสไตล์นั้นบวกกับหน่วยเสียงให้กลายเป็นรูปคลื่น เวกเตอร์ลักษณะจะควบคุมทุกสิ่งที่ไม่ได้เขียนไว้ในข้อความ: อัตราการพูด เส้นขอบน้ำเสียง การหยุดชั่วคราว และการระบายสีตามอารมณ์ สิ่งสำคัญที่สุดคือเพิ่มการฝึกอบรมฝ่ายตรงข้ามด้วยโมเดลภาษาคำพูดที่ได้รับการฝึกอบรมล่วงหน้าขนาดใหญ่ (WavLM) เป็นตัวแยกแยะ โดยผลักดันเอาต์พุตไปสู่เสียงที่ฟังดูเหมือนมนุษย์อย่างแท้จริง ในเกณฑ์มาตรฐาน LJSpeech นั้นเหนือกว่าการบันทึกของมนุษย์ในการให้คะแนนผู้ฟัง และใน LibriTTS ที่มีลำโพงหลายตัวก็ตั้งค่าให้ตรงกับความจริงภาคพื้นดิน ซึ่งเป็นหลักชัยสำคัญสำหรับคุณภาพ TTS ประสาทตั้งแต่ต้นทางถึงปลายทาง
ข้อมูลเชิงลึกทางเทคนิค
เคล็ดลับสำคัญคือการกระจายรูปแบบ: แทนที่จะทำนายฉันทลักษณ์คงที่ รูปแบบ StyleTTS 2 เป็นการแจกแจงความน่าจะเป็นและสุ่มตัวอย่างจากแบบจำลองผ่านแบบจำลองการแพร่กระจายที่ทำงานในพื้นที่แฝงในมิติต่ำ ดังนั้นประโยคเดียวกันจึงสามารถพูดได้ด้วยวิธีธรรมชาติมากมาย จากต้นทางถึงปลายทาง ตัวทำนายระยะเวลา ตัวเข้ารหัสรูปแบบ ตัวถอดรหัส และตัวแยกแยะฝ่ายตรงข้ามที่ใช้ WavLM ได้รับการฝึกอบรมร่วมกัน เพื่อให้การไล่ระดับสีไหลจากคุณภาพของรูปคลื่นกลับมาตลอดทั้งไปป์ไลน์
ผลกระทบเชิงกลยุทธ์
เข้าถึงและเข้าถึง
ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง
ต้นทุนและงบประมาณ
ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง
ความเร็วและขนาด
ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น
อนาคตของการกระจายสไตล์ StyleTTS 2
คาดว่าการกระจายสไตล์จะผสานเข้ากับการโคลนเสียงแบบ Zero-shot ดังนั้นเสียงอ้างอิงเพียงไม่กี่วินาทีจะนำทางสไตล์ตัวอย่าง และมีที่จับที่ควบคุมได้ซึ่งช่วยให้ผู้สร้างกำหนดอารมณ์ การเน้น หรือจังหวะได้อย่างชัดเจน เวอร์ชันกลั่นที่เบากว่ามุ่งหวังที่จะตัดการสุ่มตัวอย่างแบบแพร่หลายขั้นตอนสำหรับการใช้งานแบบเรียลไทม์บนอุปกรณ์ เมื่อโมเดลเหล่านี้เข้าถึงคุณภาพการออกอากาศ การตรวจสอบลายน้ำและความยินยอมจะกลายเป็นมาตรฐานเพื่อจัดการกับข้อกังวลเรื่องการปลอมแปลงเสียงและการใช้งานในทางที่ผิด
การใช้งานจริงในโลกแห่งความเป็นจริง
การสร้างคำบรรยายในหนังสือเสียงโดยที่ผู้พูดคนเดียวกันเปลี่ยนฉันทลักษณ์ตามบทต่างๆ แทนที่จะเป็นเสียงเดียว
สร้างเสียงตัวละครที่แสดงออกสำหรับเกมอินดี้และแอนิเมชั่นโดยไม่ต้องจ้างนักพากย์หลายคน
ขับเคลื่อนโปรแกรมอ่านหน้าจอการเข้าถึงที่ฟังดูเป็นมนุษย์เพียงพอสำหรับการฟังแบบยาว
การสร้างเสียงพากย์อีเลิร์นนิงที่แปลเป็นภาษาท้องถิ่นโดยเน้นและเว้นจังหวะอย่างเป็นธรรมชาติจากข้อความสคริปต์ธรรมดา
ความเสี่ยงและรั้ว
การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม
ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง
เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน
แผนงานการดำเนินงาน
ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ
ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย
กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์
ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the StyleTTS 2 Style Diffusion quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
การกระจายสเปกตรัมแบบกระจาย
คำถามที่พบบ่อย
What is StyleTTS 2 Style Diffusion?
StyleTTS 2 เป็นโมเดลการแปลงข้อความเป็นคำพูดที่ถือว่า 'สไตล์' ของเสียง — ฉันทลักษณ์ อารมณ์ และเสียงของผู้พูด — เป็นตัวแปรสุ่มสุ่มตัวอย่างด้วยโมเดลการแพร่กระจาย จากนั้นสังเคราะห์เสียงด้วยการฝึกอบรมฝ่ายตรงข้ามกับโมเดลภาษาพูดขนาดใหญ่ เป็นเรื่องสำคัญเนื่องจากสามารถบรรลุความเป็นธรรมชาติในระดับมนุษย์ในการวัดประสิทธิภาพด้วยลำโพงเดี่ยวโดยไม่จำเป็นต้องใช้คลิปอ้างอิงในเวลาอนุมาน
StyleTTS 2 เป็นโมเดลอะไรที่ใช้กระบวนการแพร่กระจาย
StyleTTS 2 สุ่มตัวอย่างเวกเตอร์สไตล์มิติต่ำด้วยโมเดลการแพร่กระจาย โดยจับฉันทลักษณ์ อารมณ์ และคุณลักษณะของผู้พูดที่ไม่ได้ระบุไว้ในข้อความ
โมเดลคำพูดที่ได้รับการฝึกล่วงหน้าใดที่ใช้เป็นตัวแบ่งแยกฝ่ายตรงข้ามใน StyleTTS 2
StyleTTS 2 ใช้โมเดลภาษาพูดขนาดใหญ่ เช่น WavLM เป็นตัวแบ่งแยกในการฝึกอบรมฝ่ายตรงข้ามเพื่อส่งเอาต์พุตไปยังเสียงที่ฟังดูคล้ายมนุษย์
เหตุใด StyleTTS 2 จึงพูดประโยคเดียวกันได้ด้วยวิธีธรรมชาติหลายประการ
เนื่องจากสไตล์ถือเป็นตัวแปรสุ่มและสุ่มตัวอย่างโดยการแพร่กระจาย แต่ละรุ่นจึงสามารถสร้างฉันทลักษณ์ที่แตกต่างกันแต่เป็นธรรมชาติสำหรับข้อความที่เหมือนกัน
ตามเกณฑ์มาตรฐานลำโพงเดี่ยวใดที่ StyleTTS 2 รายงานว่าเหนือกว่าการบันทึกของมนุษย์ในการให้คะแนนผู้ฟัง
ในเกณฑ์มาตรฐาน LJSpeech นั้น StyleTTS 2 ได้รับการจัดอันดับความเป็นธรรมชาติของผู้ฟัง ซึ่งสูงกว่าการบันทึกความจริงจากพื้นดินของมนุษย์
การฝึกอบรม 'จากต้นทางถึงปลายทาง' ให้อะไรแก่ StyleTTS 2
การฝึกอบรมแบบ end-to-end ร่วมกันช่วยให้การสูญเสียคุณภาพเสียงขั้นสุดท้ายสามารถอัปเดตตัวทำนายระยะเวลา ตัวเข้ารหัสรูปแบบ และตัวถอดรหัสร่วมกัน แทนที่จะอยู่ในขั้นตอนที่แยกจากกัน