คู่มือเสียง AI

สุนทรพจน์ควบคุมตนเองของ HuBERT

HuBERT (BERT ยูนิตที่ซ่อนอยู่) คือ Meta โมเดลคำพูดแบบควบคุมตนเองของ AI ที่เรียนรู้โดยการทำนายหน่วยเสียงที่คลัสเตอร์สำหรับเซ็กเมนต์ที่ปิดบัง สไตล์ BERT

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because its clustering-based targets often outperform earlier contrastive methods on recognition and downstream speech tasks.

เจาะลึก

HuBERT เปิดตัวโดย Meta AI ในปี 2021 โดยปรับแนวคิดการทำนายแบบสวมหน้ากากเบื้องหลัง BERT ให้เป็นคำพูดแบบดิบๆ นวัตกรรมที่สำคัญคือวิธีการสร้างเป้าหมายการฝึกอบรม: แทนที่จะเปรียบเทียบกับสิ่งรบกวนเช่น Wav2Vec 2.0 HuBERT ดำเนินการขั้นตอนการจัดกลุ่มแบบออฟไลน์ (k-means) บนคุณสมบัติเสียงเพื่อกำหนดป้ายกำกับ 'หน่วยที่ซ่อนอยู่' แยกจากกันในแต่ละเฟรมที่สั้น จากนั้นโมเดลจะปกปิดส่วนของเสียงและเรียนรู้ที่จะคาดเดาป้ายกำกับคลัสเตอร์เหล่านี้สำหรับเฟรมที่ซ่อนอยู่ โดยปฏิบัติต่อคำพูดเหมือนกับลำดับของหน่วยเสียงหลอก สิ่งสำคัญที่สุดคือ HuBERT ย้ำ: จัดกลุ่มใหม่โดยใช้การนำเสนอและฝึกสอนที่ได้รับการปรับปรุงของโมเดลเอง ซึ่งจะทำให้หน่วยเป้าหมายมีความคมชัดขึ้นเรื่อยๆ วงจรการปรับแต่งนี้ให้คุณสมบัติที่โดดเด่นซึ่งเหนือกว่าเกณฑ์มาตรฐาน ASR ผู้พูด และอารมณ์ เช่น SUPERB

ข้อมูลเชิงลึกทางเทคนิค

ความสง่างามของ HuBERT อยู่ที่การแยกการสร้างเป้าหมายออกจากการคาดการณ์ การวนซ้ำในช่วงต้นของคลัสเตอร์คุณสมบัติ MFCC แบบง่าย ๆ ลงในคลาส k-mean; การวนซ้ำในภายหลังจะจัดกลุ่มเวกเตอร์แฝงจากเลเยอร์ Transformer ระดับกลาง ซึ่งเข้ารหัสข้อมูลการออกเสียงที่สมบูรณ์ยิ่งขึ้น เนื่องจากโมเดลจำเป็นต้องคาดการณ์ ID คลัสเตอร์ในตำแหน่งที่ปิดบังเท่านั้น เป้าหมายจึงมีความสม่ำเสมอแม้ว่าการจัดกลุ่มจะไม่สมบูรณ์ ทำให้เครือข่ายเรียนรู้โครงสร้างทางเสียงและภาษาที่มีความหมายโดยไม่ต้องถอดเสียงใดๆ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของสุนทรพจน์ควบคุมตนเองของ HuBERT

HuBERT กลายเป็นรากฐานสำหรับ NLP ที่ไม่มีข้อความ รวมถึงแบบจำลองภาษาพูดที่สร้างคำพูดโดยตรงจากหน่วยการเรียนรู้ที่แยกจากกันโดยไม่มีข้อความกลาง หน่วยที่ซ่อนอยู่จะป้อนการสังเคราะห์คำพูด การแปลงเสียง และไปป์ไลน์การแปลคำพูดเป็นคำพูด คาดว่าโทเค็นแยกสไตล์ HuBERT จะสนับสนุนคลาสของโมเดลภาษาเสียงที่กำลังเติบโต ซึ่งปฏิบัติต่อคำพูดในลักษณะเดียวกับที่ LLM ปฏิบัติต่อข้อความ บวกกับการผสมเกสรข้ามอย่างต่อเนื่องด้วยโมเดลพื้นฐานหลายภาษาและหลายรูปแบบ

การใช้งานจริงในโลกแห่งความเป็นจริง

การสร้างโทเค็นคำพูดแยกสำหรับโมเดลการสร้างภาษาพูดแบบไม่มีข้อความ

การฝึกแยกฟีเจอร์ที่แข็งแกร่งล่วงหน้าที่ได้รับการปรับแต่งอย่างละเอียดสำหรับ ASR ที่มีทรัพยากรต่ำ

ขับเคลื่อนการแปลงเสียงและการแปลคำพูดเป็นคำพูดผ่านหน่วยการเรียนรู้

ทำหน้าที่เป็นแกนหลักที่ได้รับการเปรียบเทียบในชุดงานคำพูดที่ยอดเยี่ยม

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the HuBERT Self-Supervised Speech quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การเรียนรู้ด้วยตนเอง

คำถามที่พบบ่อย

What is HuBERT Self-Supervised Speech?

HuBERT (BERT ยูนิตที่ซ่อนอยู่) คือ Meta โมเดลคำพูดแบบควบคุมตนเองของ AI ที่เรียนรู้โดยการทำนายหน่วยเสียงที่คลัสเตอร์สำหรับเซ็กเมนต์ที่ปิดบัง สไตล์ BERT เป็นเรื่องสำคัญเนื่องจากเป้าหมายที่ยึดตามการจัดกลุ่มมักจะมีประสิทธิภาพเหนือกว่าวิธีการเปรียบเทียบก่อนหน้านี้ในการจดจำและงานคำพูดแบบดาวน์สตรีม

HuBERT สร้างเป้าหมายที่พยายามคาดการณ์ระหว่างการฝึกอย่างไร

HuBERT จัดกลุ่มคุณสมบัติเฟรมเสียง (ผ่าน k-mean) ลงในหน่วยที่ซ่อนอยู่แบบไม่ต่อเนื่อง และคาดการณ์ป้ายกำกับคลัสเตอร์เหล่านั้นสำหรับเฟรมที่ถูกมาสก์

โมเดลข้อความที่รู้จักกันดีข้อใดเป็นแรงบันดาลใจให้กับแผนการฝึกอบรมการทำนายแบบสวมหน้ากากของ HuBERT

HuBERT (Hidden-Unit BERT) ยืมวัตถุประสงค์การทำนายแบบสวมหน้ากากของ BERT โดยนำไปใช้กับหน่วยคำพูดแยกกันแทนโทเค็นข้อความ

HuBERT ปรับปรุงฉลากเป้าหมายผ่านการฝึกอบรมซ้ำอย่างต่อเนื่องอย่างไร

HuBERT ทำซ้ำ: รอบต่อมาจะรวมกลุ่มคุณสมบัติแฝงที่สมบูรณ์ยิ่งขึ้นจากเลเยอร์ของโมเดลเอง ซึ่งจะทำให้เป้าหมายหน่วยเสียงหลอกคมชัดขึ้น

โดยทั่วไปฟีเจอร์ใดบ้างที่จัดกลุ่มในการทำซ้ำครั้งแรกของ HuBERT

การวนซ้ำครั้งแรกจะรวมคุณสมบัติ MFCC พื้นฐานไว้ การวนซ้ำในภายหลังใช้การนำเสนอเลเยอร์ Transformer ที่สมบูรณ์ยิ่งขึ้น

เหตุใด HuBERT จึงสามารถเรียนรู้โครงสร้างที่เป็นประโยชน์ได้แม้ว่าการจัดกลุ่มจะไม่สมบูรณ์ก็ตาม

เนื่องจากวัตถุประสงค์เป็นเพียงการคาดการณ์ ID คลัสเตอร์ที่กำหนดสำหรับเฟรมที่ถูกมาสก์ งานจึงยังคงสามารถเรียนรู้ได้และสม่ำเสมอแม้จะมีคลัสเตอร์ที่มีสัญญาณรบกวนก็ตาม