คู่มือเสียง AI

การแปลงเสียง

การแปลงเสียงจะแปลงคำพูดที่บันทึกไว้ของบุคคลหนึ่งเพื่อให้ดูเหมือนเป็นคำพูดของบุคคลอื่น โดยยังคงรักษาคำและเวลาดั้งเดิมไว้

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It is the audio equivalent of a face swap, changing who you hear without changing what is said.

เจาะลึก

การแปลงเสียง (VC) จะนำเสียงต้นฉบับมาเรนเดอร์ใหม่ด้วยเสียงของผู้พูดเป้าหมาย โดยคงเนื้อหาทางภาษาและมักจะเป็นจังหวะ แนวคิดหลักคือการแยกสิ่งที่พูด (เนื้อหา) ออกจากผู้พูด (เอกลักษณ์ของผู้พูด โดยบันทึกในลักษณะเสียงต่ำและระดับเสียง) จากนั้นจึงรวมเนื้อหาของแหล่งข้อมูลเข้ากับเอกลักษณ์ของเป้าหมายอีกครั้ง ระบบคลาสสิกจำเป็นต้องมีการบันทึกแบบคู่ขนานของผู้พูดทั้งสองที่พูดประโยคเดียวกัน แต่วิธีการสมัยใหม่นั้นไม่ขนานกันและมักจะไม่มีการบันทึกเลย โดยจะเลียนแบบเสียงใหม่จากเสียงอ้างอิงเพียงไม่กี่วินาที การออกแบบทั่วไปใช้ตัวเข้ารหัสอัตโนมัติที่มีปัญหาคอขวดของข้อมูล (เช่น AutoVC) คุณสมบัติเนื้อหาที่มีการควบคุมดูแลด้วยตนเอง หรือเครือข่ายที่สร้างความขัดแย้งอย่าง CycleGAN-VC จากนั้น vocoder ของระบบประสาทจะเปลี่ยนคุณสมบัติที่แปลงแล้วกลับเป็นรูปคลื่น

ข้อมูลเชิงลึกทางเทคนิค

หัวใจของ VC คือการแยกส่วน: การแยกเนื้อหาที่ไม่ขึ้นอยู่กับผู้พูดออกจากการฝังผู้พูด AutoVC บังคับใช้สิ่งนี้ด้วยคอขวดที่มีขนาดอย่างระมัดระวังซึ่งจะบีบข้อมูลประจำตัวออก เหลือเพียงเนื้อหา จากนั้นจึงถอดรหัสเงื่อนไขบนเวกเตอร์ลำโพงเป้าหมาย วิธีอื่นแยกเนื้อหาจากแบบจำลองที่มีการดูแลตนเอง (เช่น หน่วย HuBERT) หรือใช้สัทศาสตร์โปสเตอร์ CycleGAN-VC จะเรียนรู้การแมประหว่างสองเสียงโดยไม่มีข้อมูลคู่ขนานแทน โดยใช้ความสม่ำเสมอของวงจร ดังนั้นการเดินทางไปกลับจึงส่งกลับค่าเดิม

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการแปลงเสียง

การแปลงเสียงมีแนวโน้มไปสู่การโคลนแบบ Zero-shot ทันทีที่มีความแม่นยำสูงจากเสียงไม่กี่วินาที การสตรีมแบบเรียลไทม์สำหรับการโทรสดและการเล่นเกม และการแยกสำเนียง อารมณ์ และเอกลักษณ์ได้ละเอียดยิ่งขึ้น เพื่อให้สามารถแก้ไขแต่ละรายการได้อย่างอิสระ โดยสัญญาว่าจะคืนเสียงให้กับผู้ที่สูญเสียคำพูดและการพากย์ข้ามภาษาต่างๆ อย่างราบรื่น เนื่องจากเทคโนโลยีเดียวกันนี้ทำให้เกิดการฉ้อโกงและการแอบอ้างบุคคลอื่น จึงคาดหวังการเติบโตควบคู่กันไปในลายน้ำเสียง การตรวจจับ Deepfake และการออกใบอนุญาตเสียงตามความยินยอม

การใช้งานจริงในโลกแห่งความเป็นจริง

คืนเสียงที่เป็นธรรมชาติให้กับผู้ที่สูญเสียจากการเจ็บป่วยโดยใช้บันทึกเก่าเป็นเป้าหมาย

การพากย์ภาพยนตร์เพื่อให้ตัวละครรักษาเอกลักษณ์เสียงที่สอดคล้องกันในหลายภาษา

ไม่ระบุชื่อผู้พูดในการบันทึกที่ละเอียดอ่อนโดยการสลับเสียงของพวกเขาโดยยังคงรักษาคำนั้นไว้

ให้เกมเมอร์และสตรีมเมอร์พูดสดด้วยเสียงของตัวละครที่เลือกแบบเรียลไทม์

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voice Conversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การตรวจจับกิจกรรมด้วยเสียง

คำถามที่พบบ่อย

What is Voice Conversion?

การแปลงเสียงจะแปลงคำพูดที่บันทึกไว้ของบุคคลหนึ่งเพื่อให้ดูเหมือนเป็นคำพูดของบุคคลอื่น โดยยังคงรักษาคำและเวลาดั้งเดิมไว้ เทียบเท่ากับเสียงของการสลับหน้า โดยเปลี่ยนคนที่คุณได้ยินโดยไม่เปลี่ยนสิ่งที่พูด

การแปลงเสียงเปลี่ยนแปลงไปอย่างไรเกี่ยวกับการบันทึก

การแปลงเสียงจะเปลี่ยนเอกลักษณ์ของผู้พูด (เสียงต่ำและลักษณะเสียง) ในขณะที่ยังคงรักษาคำดั้งเดิมและจังหวะเวลาเอาไว้

ความสามารถหลักใดที่ทำให้ระบบสลับเสียงในขณะที่รักษาคำนั้นไว้?

VC แยกสิ่งที่พูด (เนื้อหา) ออกจากผู้ที่พูด (ตัวตนของผู้พูด) จากนั้นจึงรวมเนื้อหาต้นฉบับเข้ากับตัวตนของเป้าหมายอีกครั้ง

AutoVC สนับสนุนให้โมเดลตัดเอกลักษณ์ของผู้พูดออกจากเนื้อหาอย่างไร

AutoVC ใช้คอขวดที่มีขนาดแน่นหนาซึ่งจะบังคับข้อมูลระบุตัวตนของผู้พูดออกไป โดยเหลือเนื้อหาไว้เป็นส่วนใหญ่ จากนั้นจึงกำหนดเงื่อนไขในการถอดรหัสในการฝังลำโพงเป้าหมายที่แยกต่างหาก

อะไรที่ทำให้ชุดข้อมูลการแปลงเสียงแบบ 'ขนาน' แตกต่างจากชุดข้อมูล 'ไม่ขนาน'

Parallel VC ต้องการการบันทึกคำพูดเดียวกันจากผู้พูดทั้งสองอย่างสอดคล้องกัน ในขณะที่วิธีการที่ไม่ขนานกันสามารถเรียนรู้จากคำพูดที่ไม่ตรงกัน ซึ่งรวบรวมได้สะดวกกว่ามาก

การแปลงเสียงแบบ 'zero-shot' หมายความว่าอย่างไร

Zero-shot VC ใช้กับลำโพงรุ่นใหม่โดยใช้คลิปอ้างอิงสั้นๆ โดยไม่จำเป็นต้องฝึกโมเดลด้วยเสียงนั้นใหม่