คู่มือเสียง AI

การสร้างคำพูดที่จับคู่การไหลของกล่องเสียง

Voicebox คือโมเดลการสร้างเสียงพูดแบบข้อความแนะนำของ Meta ซึ่งได้รับการฝึกฝนโดยมีวัตถุประสงค์ในการจับคู่โฟลว์เพื่อ 'เติม' เสียงที่สวมหน้ากาก โดยปล่อยให้โมเดลหนึ่งทำการโคลนเสียงแบบ Zero-shot กำจัดเสียงรบกวน ตัดต่อเนื้อหา และสังเคราะห์หลายภาษา

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because, like a language model for speech, it generalizes across many tasks it was never explicitly trained for.

เจาะลึก

กล่องเสียงซึ่งประกาศโดย Meta AI ในปี 2023 ได้รับการฝึกฝนในงานเดียว โดยคาดเดาบริบทของเสียงโดยรอบและข้อความที่เกี่ยวข้อง เพื่อคาดเดาส่วนที่ปิดบังของคำพูด สูตร 'ในบริบท' หรือการเติมนี้ ซึ่งยืมแนวคิดมาจากแบบจำลองภาษาขนาดใหญ่ หมายความว่าแบบจำลองเดียวกันจะจัดการกับงานที่หลากหลายในการอนุมานโดยการเลือกว่าจะปกปิดอะไร ลบคำที่พูดผิด จากนั้น Voicebox จะสร้างคำนั้นขึ้นมาใหม่เป็นเสียงเดียวกัน ให้คำพูดของใครบางคนเป็นเวลาสองวินาทีเป็นบริบทและสังเคราะห์ประโยคใหม่ที่เลียนแบบเสียงและลีลาของพวกเขา มาส์กส่วนที่มีเสียงดังและสร้างชิ้นส่วนทดแทนที่สะอาด ผลลัพธ์ที่รายงานแสดงให้เห็นคุณภาพการอ่านออกเสียงข้อความแบบ Zero-shot ที่ยอดเยี่ยม และการสร้างข้อมูลที่รวดเร็วกว่าระบบการถดถอยอัตโนมัติแบบกระจายที่เทียบเคียงได้ ในขณะที่รองรับหลายภาษาจากรุ่นเดียว

ข้อมูลเชิงลึกทางเทคนิค

กล่องเสียงใช้การจับคู่การไหลแบบมีเงื่อนไข ฝึกฝนโมเดลเวลาต่อเนื่องเพื่อเรียนรู้สนามความเร็วที่ราบรื่นซึ่งส่งเสียงรบกวนแบบสุ่มไปยังคุณสมบัติคำพูดจริง โดยมีเงื่อนไขกับข้อความและเสียงที่ไม่ได้ปิดบัง เมื่อเปรียบเทียบกับการแพร่กระจาย การจับคู่การไหลสามารถแก้ไขได้ด้วยตัวแก้สมการเชิงอนุพันธ์ธรรมดาในไม่กี่ขั้นตอน ซึ่งช่วยลดต้นทุนการอนุมาน ด้วยการวางกรอบความสามารถทุกอย่างเป็น 'คาดเดาบริบทของเสียงที่ถูกมาสก์' เครือข่ายเดียวที่ไม่ถอยอัตโนมัติจะเรียนรู้การแก้ไข การโคลน และการลดสัญญาณรบกวนโดยไม่ต้องมีหัวหน้างานเฉพาะหรือการดำเนินการฝึกอบรมแยกกัน

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของการสร้างคำพูดที่จับคู่โฟลว์บ็อกซ์

การสร้างคำพูดที่จับคู่กันลื่นไหลนั้นพร้อมที่จะสนับสนุนโมเดลคำพูดสากลที่แก้ไข แปล และจัดรูปแบบเสียงใหม่ได้อย่างลื่นไหลเหมือนกับที่โปรแกรมแก้ไขข้อความจัดการคำศัพท์ พบกับตัวแทนการสนทนาแบบเรียลไทม์ การเก็บรักษาเสียงข้ามภาษาในการแปล และการกู้คืนการบันทึกที่เสียหายด้วยความเที่ยงตรงสูง เนื่องจากเทคโนโลยีเดียวกันนี้ทำให้เกิดการโคลนเสียงที่น่าเชื่อถือ Meta จึงระงับโมเดลนี้ตั้งแต่แรกและผลักดันการวิจัยเกี่ยวกับการตรวจจับคำพูดสังเคราะห์ และลายน้ำแหล่งที่มา เฟรมเวิร์กการยินยอม และเครื่องมือการตรวจจับจะเป็นศูนย์กลางของการปรับใช้อย่างมีความรับผิดชอบ

การใช้งานจริงในโลกแห่งความเป็นจริง

การแก้ไขพอดแคสต์โดยการพิมพ์คำที่แก้ไขแล้วให้พูดใหม่ด้วยเสียงของผู้พูดต้นฉบับ

การโคลนเสียงแบบ Zero-shot จากเสียงอ้างอิงเพียงไม่กี่วินาที

การกำจัดเสียงรบกวนชั่วคราวโดยการปิดบังและสร้างส่วนคำพูดที่สะอาดขึ้นมาใหม่

การสังเคราะห์เสียงของผู้พูดคนเดียวกันในหลายภาษาจากโมเดลเดียว

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Voicebox Flow-Matching Speech Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การจับคู่การไหล

คำถามที่พบบ่อย

What is Voicebox Flow-Matching Speech Generation?

Voicebox คือโมเดลการสร้างเสียงพูดแบบข้อความแนะนำของ Meta ซึ่งได้รับการฝึกฝนโดยมีวัตถุประสงค์ในการจับคู่โฟลว์เพื่อ 'เติม' เสียงที่สวมหน้ากาก โดยปล่อยให้โมเดลหนึ่งทำการโคลนเสียงแบบ Zero-shot กำจัดเสียงรบกวน ตัดต่อเนื้อหา และสังเคราะห์หลายภาษา สิ่งสำคัญคือ เช่นเดียวกับโมเดลภาษาสำหรับการพูด จะต้องสรุปงานต่างๆ ที่ไม่เคยได้รับการฝึกฝนมาอย่างชัดเจน

Voicebox ได้รับการปรับให้เหมาะกับงานการฝึกอบรมใด

Voicebox ได้รับการฝึกฝนให้เติมส่วนของคำพูดที่ปกปิดไว้โดยใช้เสียงและข้อความโดยรอบ ซึ่งเป็นการกำหนดในบริบทที่ได้รับแรงบันดาลใจจากโมเดลภาษา

Voicebox ใช้เทคนิคการกำเนิดใดแทนการแพร่กระจาย

กล่องเสียงใช้การจับคู่การไหลแบบมีเงื่อนไข โดยการเรียนรู้สนามความเร็วที่ส่งผ่านเสียงรบกวนไปยังคุณสมบัติคำพูด และสามารถแก้ไขได้อย่างมีประสิทธิภาพด้วยตัวแก้ปัญหา ODE

Voicebox ทำการโคลนเสียงแบบ Zero-shot อย่างไร

เนื่องจากคลิปอ้างอิงสั้นๆ เป็นบริบทที่ไม่ปกปิด Voicebox จึงสังเคราะห์ประโยคใหม่ที่ตรงกับน้ำเสียงและสไตล์ของผู้พูดโดยไม่ต้องฝึกซ้ำ

เหตุใด Meta จึงระงับรุ่น Voicebox แบบเต็มตั้งแต่แรก

เนื่องจากโมเดลสามารถโคลนเสียงได้อย่างน่าเชื่อถือ Meta จึงยับยั้งไว้และเน้นการวิจัยในการตรวจจับคำพูดสังเคราะห์

โมเดลหนึ่งจะจัดการกับการแก้ไข การโคลน และการลดนอยซ์ในกล่องเสียงอย่างไร

ความสามารถทั้งหมดลดลงเหลือวัตถุประสงค์การเติมเดียวกัน การเปลี่ยนแปลงสิ่งที่ถูกปกปิดในการอนุมานทำให้เกิดการแก้ไข การโคลนนิ่ง หรือการลบจุดรบกวนออกจากโมเดลหนึ่ง