Мел-честотни кепстрални коефициенти
Mel-Frequency Cepstral Coefficients (MFCC) са компактен набор от числа, които обобщават формата на честотния спектър на звука по начина, по който човешките уши го възприемат.
Преглед
For decades they were the workhorse feature for speech recognition, speaker identification, and music analysis.
Дълбоко гмуркане
MFCC преобразуват кратък фрагмент от аудио в приблизително 13 числа, които улавят неговия тембър. Тръбопроводът взема формата на вълната, разделя я на ~25ms рамки, изчислява спектър на мощност чрез трансформацията на Фурие, след което изкривява честотната ос върху мел скалата, която разпределя лентите по начина, по който го прави кохлеята: фино под 1kHz и грубо по-горе. Мел енергиите са логаритмично компресирани (имитирайки възприемането на силата на звука) и накрая преминават през дискретно косинусово преобразуване, което ги декорира и концентрира информацията в първите няколко коефициента. Резултатът е устойчив на шум и височина на високоговорителя, поради което класическите речеви системи за скрит модел на Марков и модел на смесване на Гаус разчитаха на MFCC почти навсякъде преди дълбокото обучение.
Техническа информация
Мел скалата приближава възприемането на височината с mel = 2595 log10(1 + f/700), така че еднаквите мел стъпки звучат еднакво раздалечени. Последното дискретно косинусово преобразуване (DCT) е „кепстралната“ стъпка: тя третира логаритмично-мел спектъра като сигнал и разделя бавно променящата се форма на вокалния тракт (ниски кепстрални коефициенти, частта, която запазваме) от бързите хармоници на тона (високи коефициенти, обикновено изхвърлени), изолирайки добре фонетичната идентичност от височината на говорещия.
Стратегическо въздействие
Access and reach
Той подобрява достъпността чрез интерфейси за транскрипция, дикторски текст и глас.
Cost and budget
Медийните екипи могат да доставят изпипано аудио по-бързо с по-малки бюджети.
Speed and scale
Системите, насочени към клиента, могат да обработват устни взаимодействия в по-голям мащаб.
Бъдещето на мел-честотните кепстрални коефициенти
Дълбоките мрежи от край до край все повече научават функции направо от необработени вълнови форми или log-mel спектрограми, пропускайки DCT, така че чистите MFCC избледняват от най-съвременния ASR. И все пак те остават популярни за леки задачи на устройството и с малко данни: откриване на ключови думи, откриване на гласова активност, аудио пръстови отпечатъци и биоакустика. Очаквайте MFCC да се запазят като ефективна, интерпретируема базова линия, дори когато научените интерфейси доминират в големите модели.
Внедряване в реалния свят
Акустични функции за класически разпознаватели на реч HMM-GMM като ранни системи Sphinx и HTK
Проверка на говорещия и дневник, разграничаване кой говори по време на разговор
Класификация на музикални жанрове и пръстови отпечатъци на песни (съвпадение на тембър в стил Shazam)
Откриване на неизправности на машината или викове на животни от аудио в промишлен и биоакустичен мониторинг
Рискове и предпазни огради
Рисковете от злоупотреба с глас и имитация се увеличават, когато липсва съгласие.
Точността може да спадне при акценти, диалекти или шумна среда.
Синтетичното аудио може да бъде сбъркано с автентична реч без ясно етикетиране.
Пътна карта за изпълнение
Получете изрично съгласие за улавяне на глас, клониране и повторно използване.
Тествайте качеството при различни високоговорители и фонови условия.
Определете кога човек трябва да прегледа или одобри резултатите.
Етикетирайте синтетичното аудио и поддържайте записи за произход за отчетност.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Mel-Frequency Cepstral Coefficients quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Мел спектрограми
Frequently asked questions
What is Mel-Frequency Cepstral Coefficients?
Mel-Frequency Cepstral Coefficients (MFCC) са компактен набор от числа, които обобщават формата на честотния спектър на звука по начина, по който човешките уши го възприемат. В продължение на десетилетия те бяха основната функция за разпознаване на реч, идентификация на високоговорители и анализ на музика.
Какво означава „mel“ в MFCC?
Мел скалата изкривява честотата, така че еднаквите стъпки да звучат еднакво отдалечени за хората, фино разположени при ниските честоти и грубо при високите.
Коя трансформация се прилага последна за получаване на кепстралните коефициенти?
След като енергиите log-mel са изчислени, дискретно косинусово преобразуване ги декорелира и пакетира информация в първите няколко коефициента.
Защо MFCC са сравнително здрави спрямо височината на говорителя?
Ниските кепстрални коефициенти улавят обвивката на гласовия тракт (фонетично съдържание), докато високите улавят височината, така че запазването на ниските намалява акцента върху височината.
Приблизително колко MFCC коефициента обикновено се съхраняват на кадър?
Често срещан избор е около 13 коефициента, понякога увеличени с техните делти, които компактно обобщават тембъра.
Защо дневникът се прилага към енергиите на мел лентата?
Човешкото възприемане на силата на звука е приблизително логаритмично, така че компресията на логаритмите прави функциите да съответстват по-добре на възприятието и стабилизира динамичния диапазон.