คู่มือเสียง AI

ชุดเครื่องมือรู้จำเสียง Kaldi

Kaldi เป็นชุดเครื่องมือโอเพ่นซอร์สฟรีที่กลายเป็นแพลตฟอร์มการวิจัยที่โดดเด่นสำหรับการสร้างระบบการรู้จำเสียง

อ่าน 2 นาทีอัปเดตล่าสุด

ภาพรวม

It matters because for nearly a decade it was the go-to foundation for academic and industrial ASR work.

เจาะลึก

Kaldi เปิดตัวในปี 2011 และนำโดย Daniel Povey เขียนด้วยภาษา C++ พร้อมด้วยสูตรอาหารที่ติดกาวเข้าด้วยกันด้วยสคริปต์ bash และ Perl มันสร้างขึ้นบนไปป์ไลน์ ASR แบบคลาสสิก: แยกคุณสมบัติทางเสียง (MFCC หรือ filterbanks) สร้างแบบจำลองเสียงฟอนิมด้วย Gaussian Mixture Models หรือในภายหลังคือเครือข่ายประสาทเทียมระดับลึก และรวมโมเดลอะคูสติก พจนานุกรมการออกเสียง และโมเดลภาษาไว้ในกราฟเดียวที่ค้นหาได้ ตัวเลือกทางเทคนิคที่กำหนดคือการใช้ทรานสดิวเซอร์ไฟไนต์สเตตแบบถ่วงน้ำหนัก (WFST) จากไลบรารี OpenFST เพื่อรวบรวมแหล่งความรู้ทั้งหมดเป็นกราฟถอดรหัสเดียว Kaldi จัดส่ง 'สูตรอาหาร' สำหรับชุดข้อมูลมาตรฐาน เช่น Switchboard, Librispeech และ Wall Street Journal เพื่อให้นักวิจัยสามารถทำซ้ำผลลัพธ์ที่ล้ำสมัยได้ มันกลายเป็นการดำเนินการอ้างอิงเทียบกับระบบใหม่ที่ถูกเปรียบเทียบ

ข้อมูลเชิงลึกทางเทคนิค

เคล็ดลับหลักของ Kaldi คือการเขียน WFST สี่รายการเป็นกราฟเดียวที่เรียกว่า HCLG: H แมปสถานะ neural-net หรือ GMM ไปยังโทรศัพท์ที่ขึ้นอยู่กับบริบท C จัดการบริบทการออกเสียง (triphones) L คือพจนานุกรมการออกเสียงที่จับคู่โทรศัพท์กับคำ และ G คือโมเดลภาษา การคูณทรานสดิวเซอร์เหล่านี้และการปรับผลลัพธ์ให้เหมาะสมจะสร้างกราฟเดี่ยวที่ตัวถอดรหัสค้นหาด้วยอัลกอริธึม Viterbi ที่ตัดแต่งด้วยลำแสง ซึ่งเปลี่ยนเฟรมเสียงให้เป็นลำดับคำที่เป็นไปได้มากที่สุดอย่างมีประสิทธิภาพ

ผลกระทบเชิงกลยุทธ์

เข้าถึงและเข้าถึง

ปรับปรุงการเข้าถึงผ่านการถอดเสียง คำบรรยาย และอินเทอร์เฟซเสียง

ต้นทุนและงบประมาณ

ทีมสื่อสามารถจัดส่งเสียงที่สวยงามได้รวดเร็วยิ่งขึ้นด้วยงบประมาณที่น้อยลง

ความเร็วและขนาด

ระบบที่ติดต่อกับลูกค้าสามารถประมวลผลการโต้ตอบด้วยเสียงในขนาดที่ใหญ่ขึ้น

อนาคตของชุดเครื่องมือรู้จำเสียง Kaldi

วิธีการ HMM-DNN แบบไฮบริดของ Kaldi ส่วนใหญ่ถูกแทนที่ด้วยโมเดลประสาทจากต้นทางถึงปลายทางที่แมปเสียงกับข้อความโดยตรง โปรเจ็กต์ที่สืบทอดต่อจาก Daniel Povey, k2 (พร้อมระบบนิเวศ Icefall และ Lhotse) นำเสนอแนวคิด WFST ของ Kaldi ใน PyTorch ใหม่ด้วยออโตมาตาสถานะจำกัดที่สามารถสร้างความแตกต่างได้ คาดหวังว่า Kaldi จะยังคงเป็นแหล่งอ้างอิงทางประวัติศาสตร์และเป็นเครื่องมือในการสอน ในขณะที่ผู้สืบทอดแนวความคิดจะผสานการถอดรหัสที่มีโครงสร้างแบบคลาสสิกเข้ากับโมเดลอะคูสติกที่ใช้หม้อแปลงไฟฟ้าสมัยใหม่และแบบควบคุมตนเอง

การใช้งานจริงในโลกแห่งความเป็นจริง

ห้องปฏิบัติการทางวิชาการที่สร้างมาตรฐาน Librispeech และ Switchboard ขึ้นมาใหม่เพื่อตรวจสอบการวิจัยการสร้างแบบจำลองทางเสียงใหม่

การสร้างระบบคำสั่งเสียงแบบกำหนดเองสำหรับภาษาที่มีทรัพยากรต่ำหรือภาษากลุ่มน้อยโดยใช้สูตรอาหาร Kaldi

บังคับจัดแนวเสียงกับการถอดเสียงสำหรับภาษาศาสตร์ การสร้างชุดข้อมูล และการกำหนดเวลาคำบรรยาย

ขับเคลื่อนแบ็กเอนด์การค้นหาด้วยเสียงและการเขียนตามคำบอกในยุคแรกๆ ในอุตสาหกรรมก่อนที่โมเดลแบบ end-to-end จะครบกำหนด

ความเสี่ยงและรั้ว

การใช้เสียงในทางที่ผิดและการแอบอ้างบุคคลอื่นมีความเสี่ยงเพิ่มขึ้นเมื่อขาดความยินยอม

ความแม่นยำอาจลดลงตามสำเนียง ภาษาถิ่น หรือสภาพแวดล้อมที่มีเสียงดัง

เสียงสังเคราะห์อาจถูกเข้าใจผิดว่าเป็นเสียงพูดที่แท้จริงโดยไม่มีการกำกับที่ชัดเจน

แผนงานการดำเนินงาน

1

ได้รับความยินยอมอย่างชัดแจ้งสำหรับการจับเสียง การโคลน และการใช้ซ้ำ

2

ทดสอบคุณภาพกับลำโพงและสภาพพื้นหลังที่หลากหลาย

3

กำหนดเวลาที่มนุษย์จะต้องตรวจสอบหรืออนุมัติผลลัพธ์

4

ติดป้ายกำกับเสียงสังเคราะห์และเก็บบันทึกที่มาเพื่อความรับผิดชอบ

สำรวจต่อไป

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kaldi Speech Recognition Toolkit quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

เริ่มแบบทดสอบ

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

คำแนะนำต่อไป

การรู้จำเสียงกระซิบ

คำถามที่พบบ่อย

What is Kaldi Speech Recognition Toolkit?

Kaldi เป็นชุดเครื่องมือโอเพ่นซอร์สฟรีที่กลายเป็นแพลตฟอร์มการวิจัยที่โดดเด่นสำหรับการสร้างระบบการรู้จำเสียง เป็นเรื่องสำคัญเพราะเป็นเวลาเกือบหนึ่งทศวรรษที่มูลนิธิแห่งนี้เป็นรากฐานสำหรับงาน ASR เชิงวิชาการและอุตสาหกรรม

แกนหลักของ Kaldi เขียนด้วยภาษาโปรแกรมใด

แกนหลักของ Kaldi เขียนด้วยภาษา C++ เพื่อประสิทธิภาพ โดยมีสคริปต์ bash และ Perl ที่จัดเตรียมสูตรการฝึกอบรมและถอดรหัส

Kaldi ใช้โครงสร้างทางคณิตศาสตร์ใดในการรวมโมเดลอะคูสติก พจนานุกรม และโมเดลภาษาเข้าด้วยกันเป็นกราฟถอดรหัสเดียว

Kaldi เขียน WFST จากไลบรารี OpenFST ลงในกราฟ HCLG เดียวที่ตัวถอดรหัสค้นหา

ใครคือผู้สร้างหลักและผู้นำโครงการ Kaldi

Daniel Povey เป็นผู้นำการพัฒนา Kaldi ซึ่งเปิดตัวครั้งแรกในปี 2011 และต่อมาได้เริ่มโครงการที่สืบทอดต่อจาก k2

ในไปป์ไลน์แบบคลาสสิกของ Kaldi GMM (Gaussian Mixture Models) เดิมใช้การสร้างแบบจำลองอะไร

GMM จำลองความน่าจะเป็นทางเสียงของสถานะหน่วยเสียงก่อนที่โครงข่ายประสาทเทียมระดับลึกจะเข้ามาแทนที่สถานะเหล่านี้ในระบบไฮบริด

ชื่อของระบบนิเวศผู้สืบทอดที่ใช้ PyTorch ที่ทันสมัยของ Kaldi คืออะไร?

k2 พร้อมด้วย Icefall และ Lhotse ได้นำแนวคิดที่มีขอบเขตจำกัดของ Kaldi มาใช้ใหม่ในรูปแบบที่แตกต่างและเป็นมิตรกับ PyTorch