Audio AI ÚTMUTATÓ

SpecAugment a beszédfelismeréshez

A SpecAugment egy egyszerű, de hatékony adatkiegészítési módszer, amely maszkolja és torzítja a beszéd spektrogramját, hogy a felismerési modelleket robusztusabbá tegye.

2 perc olvasásUtoljára frissítve

Áttekintés

It boosted accuracy on benchmarks without any new audio or model changes.

Mély merülés

A Google Brain (Park et al.) által 2019-ben bevezetett SpecAugment a nyers hullámforma helyett közvetlenül a log-mel spektrogram szerkesztésével bővíti a beszédfelismerési képzést. Három műveletet alkalmaz: idővetemítés, amely kissé megnyújtja vagy tömöríti a hangot az időtengely mentén; frekvencia maszkolás, amely nullázza a frekvenciacsatornák sávjait; és időmaszkolás, amely kiüríti az időlépéseket. Azáltal, hogy a modellt arra kényszeríti, hogy felismerje a beszédet még akkor is, ha a spektrogram egyes részei rejtve vannak, a SpecAugment szabályosítóként működik, és megakadályozza a túlillesztést. Feltűnően olcsó és hatékony volt, és segített a LAS-stílusú modelleknek elérni a legmodernebb szóhibaarányt a LibriSpeech-en és a Switchboardon, és továbbra is a modern ASR oktatási folyamatok alapértelmezett összetevője marad.

Technikai betekintés

A SpecAugment úgy működik a 2D spektrogramon, mintha az egy kép lenne. A frekvencia maszkolás eltávolítja a mel-frekvenciás csatornák véletlenszerű blokkját; Az időmaszkolás eltávolítja a gyakori képkockák véletlenszerű blokkját; Az idővetemítés interpolációval eltolja a kiválasztott pontot az időtengely mentén. Egy mondatonként több maszk is alkalmazható. Mivel a maszkok minden korszakban változnak, a modell hatékonyan látja az egyes példák végtelen változatait, javítva az általánosítást anélkül, hogy új adatokat gyűjtene.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A SpecAugment jövője a beszédfelismeréshez

A SpecAugment szinte univerzális alapértelmezett beszédfelismeréssé vált, és más audiofeladatokra is terjed, mint például a hangszóró ellenőrzése és a hangosztályozás. A jövőbeni munka automatikusan hangolja a maszkolási irányelveket, vagy adaptálja azokat a képzés során, és kombinálja a spektrogrammaszkolást az önfelügyelt edzés előtti célokkal. A modellek növekedésével az olcsó kiegészítés, amely robusztusságot ad extra címkézett hang nélkül, továbbra is nagyon értékes marad, különösen az alacsony erőforrás-igényű nyelvek esetében, ahol kevés az adat.

Valós megvalósítás

A LibriSpeech szóhibaarányának javítása a spektrogramsávok edzés közbeni elfedésével

A végpontok közötti ASR modellek, például a LAS vagy a Conformer rendszerezése a túlillesztés csökkentése érdekében

Korlátozott adatkészletek bővítése alacsony erőforrás-igényű nyelvekhez új hang rögzítése nélkül

A maszkolási ötlet adaptálása a hangszóró ellenőrzésére és a hangesemények besorolására

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SpecAugment for Speech Recognition quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Kaldi beszédfelismerő eszköztár

Gyakran ismételt kérdések

What is SpecAugment for Speech Recognition?

A SpecAugment egy egyszerű, de hatékony adatkiegészítési módszer, amely maszkolja és torzítja a beszéd spektrogramját, hogy a felismerési modelleket robusztusabbá tegye. Növelte a benchmarkok pontosságát új hang- vagy modellmódosítás nélkül.

Mivel működik a SpecAugment?

A SpecAugment közvetlenül a spektrogramot (az idő-frekvencia reprezentációt) szerkeszti a nyers hullámforma helyett.

Ezek közül melyik az egyik a SpecAugment három művelete közül?

A három művelet az idővetemítés, a frekvencia-maszkolás és az időmaszkolás.

Mi a SpecAugment elsődleges célja?

A spektrogram egyes részei elrejtésével általánosításra kényszeríti a modellt, csökkentve a túlillesztést és a hibaarányt.

Mit csinál az „időmaszkolás”?

Az időmaszkolás nullázza az egymást követő képkockák véletlenszerű blokkját a spektrogram időtengelye mentén.

Miért segít a maszkok korszakonkénti cseréje?

A különböző véletlenszerű maszkok minden korszakban azt jelentik, hogy a modell végtelen változatokkal találkozik, javítva az általánosítást új adatok nélkül.