Audio AI ÚTMUTATÓ

Mel-frekvencia cepstral együtthatók

A Mel-Frequency Cepstral Coefficients (MFCC) olyan kompakt számkészlet, amely összefoglalja a hang frekvenciaspektrumának alakját, ahogyan azt az emberi fül érzékeli.

2 perc olvasásUtoljára frissítve

Áttekintés

For decades they were the workhorse feature for speech recognition, speaker identification, and music analysis.

Mély merülés

Az MFCC-k a hang egy rövid szeletét nagyjából 13 számmá alakítják, amelyek rögzítik annak hangszínét. A csővezeték felveszi a hullámformát, ~25 ms-os keretekre bontja, a Fourier-transzformáción keresztül kiszámol egy teljesítményspektrumot, majd a frekvencia tengelyét a mel-skálára vetemíti, amely úgy tereli el a sávokat, ahogyan a cochlea: finoman 1 kHz alatt és durván felette. A mel energiákat log-összenyomja (utánozza a hangosság érzékelését), végül egy diszkrét koszinusz transzformáción halad át, amely dekorrelálja őket, és az információt az első néhány együtthatóba koncentrálja. Az eredmény robusztus a zaj és a hangmagasság tekintetében, ezért a klasszikus Rejtett Markov-modell és a Gaussian Mixture Model beszédrendszerek szinte általánosan az MFCC-kre támaszkodtak a mély tanulás előtt.

Technikai betekintés

A mel skála a hangmagasság érzékelését mel = 2595 log10(1 + f/700) mellett közelíti meg, így az egyenlő mel lépések egyenlő távolságban szólalnak meg. A végső diszkrét koszinusz transzformáció (DCT) a „cepstralis” lépés: a log-mel spektrumot jelként kezeli, és elválasztja a lassan változó vokális traktus alakot (alacsony cepstralis együtthatók, az általunk megtartott rész) a gyors hangmagasságú harmonikusoktól (magas együtthatók, általában eldobva), szépen elkülönítve a fonetikai azonosságot a beszélő hangmagasságától.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A Mel-frekvencia cepstral együtthatók jövője

A végpontok közötti mélyhálózatok egyre inkább közvetlenül nyers hullámformákból vagy log-mel spektrogramokból tanulják meg a funkciókat, kihagyva a DCT-t, így a tiszta MFCC-k elhalványulnak a legmodernebb ASR-től. Ennek ellenére továbbra is népszerűek a könnyű, eszközön és alacsony adatforgalmat igénylő feladatoknál: kulcsszófelderítés, hangtevékenység-észlelés, audio-ujjlenyomat-vétel és bioakusztika. Arra számíthat, hogy az MFCC-k hatékony, értelmezhető alapvonalként maradnak meg, még akkor is, ha a tanult front-endek uralják a nagy modelleket.

Valós megvalósítás

Akusztikai jellemzők a klasszikus HMM-GMM beszédfelismerőkhöz, mint például a korai Sphinx és HTK rendszerek

A hangszóró ellenőrzése és naplózása, megkülönböztetve, hogy ki beszél hívás közben

Zenei műfaji besorolás és a dal ujjlenyomata (Shazam-stílusú hangszín egyeztetés)

Géphibák vagy állati hívások észlelése hangból az ipari és bioakusztikus monitorozásban

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mel-Frequency Cepstral Coefficients quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Mel-Frequency Cepstral Coefficients?

A Mel-Frequency Cepstral Coefficients (MFCC) olyan kompakt számkészlet, amely összefoglalja a hang frekvenciaspektrumának alakját, ahogyan azt az emberi fül érzékeli. Évtizedeken át a beszédfelismerés, a hangszóró azonosítás és a zeneelemzés igáslószerei voltak.

Mire utal a „mel” az MFCC-ben?

A mel skála elvetemíti a frekvenciát, így az egyenlő lépések egyenlő távolságban szólalnak meg egymástól, alacsony frekvenciákon finoman, magas frekvenciákon pedig durván.

Melyik transzformációt alkalmazzuk utoljára a cepstralis együtthatók előállításához?

A log-mel energiák kiszámítása után egy diszkrét koszinusz transzformáció díszíti őket, és az információkat az első néhány együtthatóba csomagolja.

Miért viszonylag robusztusak az MFCC-k a hangszórók hangmagasságához képest?

Az alacsony cepstralis együtthatók rögzítik a vokális traktus burkot (fonetikai tartalmat), míg a magasak a hangmagasságot, így az alacsonyak tartása csökkenti a hangmagasságot.

Körülbelül hány MFCC-együtthatót tartanak meg általában képkockánként?

Gyakori választás körülbelül 13 együttható, néha deltákkal kiegészítve, amelyek tömören összegzik a hangszínt.

Miért alkalmazzák a naplót a mel-sáv energiáira?

Az emberi hangerő érzékelése nagyjából logaritmikus, így a naplózási tömörítés révén a funkciók jobban illeszkednek az észleléshez, és stabilizálja a dinamikatartományt.