معاملات ميل التردد Cepstral
معاملات الميل الترددي Cepstral (MFCCs) هي مجموعة مدمجة من الأرقام التي تلخص شكل طيف تردد الصوت بالطريقة التي تدركها الأذن البشرية.
نظرة عامة
For decades they were the workhorse feature for speech recognition, speaker identification, and music analysis.
الغوص العميق
تقوم MFCCs بتحويل شريحة قصيرة من الصوت إلى ما يقرب من 13 رقمًا تلتقط جرسها. يأخذ خط الأنابيب الشكل الموجي، ويقسمه إلى إطارات تبلغ 25 مللي ثانية تقريبًا، ويحسب طيف الطاقة عبر تحويل فورييه، ثم يلوي محور التردد على مقياس ميل، الذي يباعد النطاقات بالطريقة التي تعمل بها القوقعة: بدقة أقل من 1 كيلو هرتز وأكثر بشكل خشن. يتم ضغط طاقات الميل بشكل لوغاريتمي (تقليد إدراك جهارة الصوت) ويتم تمريرها أخيرًا من خلال تحويل جيب التمام المنفصل، مما يؤدي إلى إلغاء ارتباطها وتركيز المعلومات في المعاملات القليلة الأولى. والنتيجة قوية بالنسبة للضوضاء ونبرات مكبر الصوت، وهذا هو السبب وراء اعتماد أنظمة الكلام الكلاسيكية لنموذج ماركوف المخفي ونموذج الخليط الغوسي على MFCCs عالميًا تقريبًا قبل التعلم العميق.
البصيرة الفنية
مقياس ميل يقارب إدراك درجة الصوت مع ميل = 2595 log10(1 + f/700)، لذا فإن خطوات ميل متساوية تبدو متباعدة بشكل متساوٍ. تحويل جيب التمام المنفصل النهائي (DCT) هو الخطوة "الرأسية": فهو يتعامل مع طيف اللوغاريتم ميل كإشارة ويفصل شكل القناة الصوتية المتغير ببطء (المعاملات الرأسية المنخفضة، الجزء الذي نحتفظ به) عن توافقيات طبقة الصوت السريعة (المعاملات العالية، عادة ما يتم التخلص منها)، مما يعزل الهوية الصوتية بدقة عن طبقة صوت المتحدث.
التأثير الاستراتيجي
الوصول والوصول
يعمل على تحسين إمكانية الوصول من خلال واجهات النسخ والسرد والصوت.
التكلفة والميزانية
يمكن للفرق الإعلامية شحن الصوت المصقول بشكل أسرع بميزانيات أصغر.
السرعة والحجم
يمكن للأنظمة التي تواجه العملاء معالجة التفاعلات المنطوقة على نطاق أوسع.
مستقبل المعاملات Cepstral ميل التردد
تتعلم الشبكات العميقة الشاملة بشكل متزايد الميزات مباشرة من الأشكال الموجية الأولية أو المخططات الطيفية اللوغاريتمية، متخطية DCT، لذلك تتلاشى MFCCs النقية من ASR الحديث. ومع ذلك، فهي لا تزال شائعة في المهام خفيفة الوزن، والتي تتم على الجهاز، والتي تتطلب بيانات منخفضة: اكتشاف الكلمات الرئيسية، واكتشاف النشاط الصوتي، وبصمات الأصابع الصوتية، والصوتيات الحيوية. نتوقع أن تستمر مراكز MFCC كخط أساس فعال وقابل للتفسير حتى عندما تهيمن الواجهات الأمامية المستفادة على النماذج الكبيرة.
التنفيذ في العالم الحقيقي
الميزات الصوتية لأجهزة التعرف على الكلام الكلاسيكية HMM-GMM مثل أنظمة Sphinx وHTK المبكرة
التحقق من المتحدث وتدوينه، وتمييز من يتحدث في المكالمة
تصنيف نوع الموسيقى وبصمة الأغنية (مطابقة جرس نمط Shazam)
اكتشاف أخطاء الآلة أو مكالمات الحيوانات من الصوت في المراقبة الصناعية والصوتية الحيوية
المخاطر والدرابزين
تزداد مخاطر إساءة استخدام الصوت وانتحال الشخصية عند فقدان الموافقة.
يمكن أن تنخفض الدقة عبر اللهجات أو اللهجات أو البيئات الصاخبة.
يمكن الخلط بين الصوت الاصطناعي والكلام الأصيل دون تصنيف واضح.
خارطة طريق التنفيذ
الحصول على موافقة صريحة لالتقاط الصوت واستنساخه وإعادة استخدامه.
اختبار الجودة عبر مكبرات الصوت المتنوعة وظروف الخلفية.
تحديد متى يجب على الإنسان مراجعة المخرجات أو الموافقة عليها.
قم بتسمية الصوت الاصطناعي واحتفظ بسجلات المصدر للمساءلة.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mel-Frequency Cepstral Coefficients quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
ميل الطيفي
الأسئلة المتداولة
What is Mel-Frequency Cepstral Coefficients?
معاملات الميل الترددي Cepstral (MFCCs) هي مجموعة مدمجة من الأرقام التي تلخص شكل طيف تردد الصوت بالطريقة التي تدركها الأذن البشرية. لعقود من الزمن كانت هذه الميزة هي العمود الفقري للتعرف على الكلام، وتحديد المتحدث، وتحليل الموسيقى.
ما الذي يشير إليه "mel" في MFCC؟
يقوم مقياس ميل بتشويه التردد بحيث تبدو الخطوات المتساوية متباعدة بشكل متساوٍ بالنسبة للبشر، وتكون متباعدة بشكل دقيق عند الترددات المنخفضة وبصورة خشنة عند الترددات العالية.
ما التحويل الذي تم تطبيقه أخيرًا لإنتاج المعاملات الرأسية؟
بعد حساب طاقات السجل، يقوم تحويل جيب التمام المنفصل بإلغاء ربطها وتعبئة المعلومات في المعاملات القليلة الأولى.
لماذا تعد MFCCs قوية نسبيًا بالنسبة لنبرة المتحدث؟
تلتقط المعاملات الرأسية المنخفضة غلاف السبيل الصوتي (المحتوى الصوتي) بينما تلتقط المعاملات المرتفعة طبقة الصوت، لذا فإن الحفاظ على المعاملات المنخفضة يقلل من حدة الصوت.
ما هو عدد معاملات MFCC تقريبًا التي يتم الاحتفاظ بها لكل إطار؟
الاختيار الشائع هو حوالي 13 معاملًا، يتم تعزيزها أحيانًا بدلتاها، والتي تلخص الجرس بشكل مضغوط.
لماذا يتم تطبيق السجل على طاقات نطاق الميل؟
إن إدراك الإنسان لجهارة الصوت هو لوغاريتمي تقريبًا، لذا فإن ضغط السجل يجعل الميزات تتوافق بشكل أفضل مع الإدراك ويثبت النطاق الديناميكي.