دليل الصوت AI

مجموعة أدوات كالدي للتعرف على الكلام

Kaldi عبارة عن مجموعة أدوات مجانية مفتوحة المصدر أصبحت منصة البحث المهيمنة لبناء أنظمة التعرف على الكلام.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It matters because for nearly a decade it was the go-to foundation for academic and industrial ASR work.

الغوص العميق

تم إصدار Kaldi في عام 2011 بقيادة دانييل بوفي، وهو مكتوب بلغة C++ مع وصفات تم لصقها معًا بواسطة نصوص bash وPerl. لقد تم بناؤه على خط أنابيب ASR الكلاسيكي: استخراج الميزات الصوتية (MFCCs أو Filterbanks)، ونماذج الأصوات الصوتية باستخدام Gaussian Mixture Models، أو لاحقًا، الشبكات العصبية العميقة، والجمع بين النموذج الصوتي ومعجم النطق ونموذج اللغة في رسم بياني واحد قابل للبحث. كان خيارها الفني المحدد هو استخدام محولات الطاقة ذات الحالة المحدودة الموزونة (WFSTs) من مكتبة OpenFST لتكوين جميع مصادر المعرفة في رسم بياني واحد لفك التشفير. قام كالدي بشحن "وصفات" لمجموعات البيانات القياسية مثل Switchboard، وLibrispeech، وWall Street Journal، مما سمح للباحثين بإعادة إنتاج أحدث النتائج. لقد أصبح التنفيذ المرجعي الذي تم من خلاله قياس الأنظمة الجديدة.

البصيرة الفنية

تتمثل خدعة Kaldi الأساسية في تكوين أربعة WFSTs في رسم بياني واحد يسمى HCLG: يقوم H بتعيين حالات الشبكة العصبية أو GMM للهواتف المعتمدة على السياق، ويتعامل C مع السياق الصوتي (triphones)، وL هو معجم النطق الذي يربط الهواتف بالكلمات، وG هو نموذج اللغة. يؤدي مضاعفة محولات الطاقة هذه وتحسين النتيجة إلى إنتاج رسم بياني واحد يبحث فيه جهاز فك التشفير باستخدام خوارزمية Viterbi المشذبة، مما يحول الإطارات الصوتية إلى تسلسل الكلمات الأكثر احتمالية بكفاءة.

التأثير الاستراتيجي

الوصول والوصول

يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.

التكلفة والميزانية

يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.

السرعة والحجم

يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.

مستقبل أدوات التعرف على الكلام كالدي

لقد تم استبدال نهج Kaldi الهجين HMM-DNN إلى حد كبير بنماذج عصبية شاملة تقوم بتعيين الصوت مباشرة إلى النص. المشروع اللاحق لدانيال بوفي، k2 (مع النظام البيئي Icefall وLhotse)، يعيد تصور أفكار Kaldi WFST في PyTorch باستخدام أتمتة الحالة المحدودة القابلة للتمييز. نتوقع أن يظل كالدي نفسه مرجعًا تاريخيًا وأداة تعليمية، في حين يدمج أحفاده المفاهيميون فك التشفير المنظم الكلاسيكي مع النماذج الصوتية الحديثة القائمة على المحولات والإشراف الذاتي.

التنفيذ في العالم الحقيقي

تعمل المعامل الأكاديمية على إعادة إنتاج معايير Librispeech وSwitchboard للتحقق من صحة أبحاث النمذجة الصوتية الجديدة

بناء أنظمة أوامر صوتية مخصصة للغات منخفضة الموارد أو لغات الأقليات باستخدام وصفات كالدي

المحاذاة القسرية للصوت مع النصوص اللغوية وإنشاء مجموعة البيانات وتوقيت الترجمة

تعزيز البحث الصوتي المبكر والإملاء الخلفي في الصناعة قبل نضوج النماذج الشاملة

المخاطر والدرابزين

تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.

يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.

يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.

خارطة طريق التنفيذ

1

الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.

2

اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.

3

تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.

4

قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Kaldi Speech Recognition Toolkit quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التعرف على الكلام الهمس

الأسئلة المتداولة

What is Kaldi Speech Recognition Toolkit?

Kaldi عبارة عن مجموعة أدوات مجانية مفتوحة المصدر أصبحت منصة البحث المهيمنة لبناء أنظمة التعرف على الكلام. إنه أمر مهم لأنه كان على مدى عقد من الزمن تقريبًا هو الأساس للعمل الأكاديمي والصناعي في ASR.

ما هي لغة البرمجة التي تمت كتابة جوهر Kaldi بها؟

تمت كتابة جوهر Kaldi بلغة C++ للأداء، مع نصوص bash وPerl التي تنظم وصفات التدريب وفك التشفير.

ما البنية الرياضية التي يستخدمها كالدي لدمج نموذجه الصوتي والمعجم ونموذج اللغة في رسم بياني واحد لفك التشفير؟

يقوم Kaldi بتكوين WFSTs من مكتبة OpenFST في رسم بياني HCLG واحد يبحث عنه جهاز فك التشفير.

من هو المبدع الرئيسي وقائد مشروع كالدي؟

قاد دانييل بوفي تطوير Kaldi، الذي تم إصداره لأول مرة في عام 2011، ثم بدأ لاحقًا مشروع k2 اللاحق.

في خط إنتاج كالدي الكلاسيكي، ما هي نماذج GMMs (نماذج الخليط الغاوسي) التي تم استخدامها في الأصل لتصميم النماذج؟

صممت نماذج GMMs الاحتمالية الصوتية لحالات الصوت قبل أن تحل الشبكات العصبية العميقة محلها في الأنظمة الهجينة.

ما هو اسم النظام البيئي الحديث القائم على PyTorch والخلف لـ Kaldi؟

يعيد k2، جنبًا إلى جنب مع Icefall وLhotse، تنفيذ أفكار الحالة المحدودة لـ Kaldi في شكل قابل للتمييز وصديق لـ PyTorch.