Audio AI ÚTMUTATÓ

Beszéd zajtalanítása RNNzajjal

Az RNNoise egy apró, gyors neurális hálózat, amely valós időben távolítja el a háttérzajt a beszédből.

2 perc olvasásUtoljára frissítve

Áttekintés

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Mély merülés

A 2017-ben megjelent RNNoise-t a hanghívások alacsony késleltetésű zajelnyomására tervezték. Ahelyett, hogy mindent végpontokig megtanulna, körülbelül 22 frekvenciasávra osztja fel a beszédet az emberi fül mintájára (egy Bark-szerű skála), és egy ismétlődő neurális hálózatot használ kapuzott ismétlődő egységekkel, hogy megbecsülje az egyes sávok erősítését (0-tól 1-ig) keretenként. Ezek az előnyök tompítják a zajos sávokat, miközben a beszéd által dominált sávokat érintetlenül tartják. Egy kiegészítő hangmagasságú szűrő megtisztítja a zöngés beszéd harmonikusai közötti maradék zajt. Az egész modell nagyjából 85 000 súlyú, gyorsabban fut, mint a valós időben egyetlen CPU-magon, és nyílt forráskódú BSD licenc alatt, ezért integrálták olyan projektekbe, mint az Opus kodek ökoszisztémája, a Mumble és az OBS Studio.

Technikai betekintés

A kulcsfontosságú tervezési választás az észlelési sáv erősítésén alapul, nem pedig a nyers spektrális sávokon. Azáltal, hogy képkockánként csak ~22 erősítési értéket jelez előre, a GRU hálózat kicsi marad, és elkerüli a régebbi spektrális kivonási módszerekben szokásos zenei zajokat. Kézzel készített funkciók (sávenergiák, hangmagasság-periódus, hangmagasság-korreláció) táplálják a hálózatot, ötvözve a DSP tudást a tanulással. Egy külön hangaktivitás-kimenet segíti a kapuerősítést a tiszta zajos kereteknél.

Stratégiai hatás

Hozzáférés és elérés

Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.

Költség és költségvetés

A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.

Sebesség és méretarány

Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.

A beszéd zajtalanításának jövője az RNNnoise segítségével

Az RNNoise a könnyű, valós idejű javítási munka hullámát ihlette; utódkutatása (PercepNet, DeepFilterNet) a minőséget magasabb szintre emeli, miközben alacsonyan tartja a CPU-költségvetést. Várható, hogy a hangtalanítók közvetlenül fejhallgatókba, hallókészülékekbe és konferenciachipekbe ágyazódnak, visszhang-kioltással és derverberációval kombinálva, valamint érzékelési, sőt generatív objektíveket használnak. A hibrid DSP-plus-small-network receptúra ​​mindenhol befolyásos marad, ahol az alacsony késleltetés, az alacsony fogyasztás és a nyílt forráskódú licenc fontosabb, mint a nyers modellméret.

Valós megvalósítás

Elnyomja a billentyűzet csörömpölését és a ventilátorzúgást videohívások közben az RNNnoise-t csomagoló alkalmazásokban.

A streamer mikrofonjának tisztítása az OBS Stúdióban a beépített RNNnoise zajszűrőn keresztül.

A hangcsevegés érthetőségének javítása játékokban és VoIP-eszközökben, mint például a Mumble alacsony fogyasztású hardveren.

A zajos térfelvételek előfeldolgozása, így a beszédfelismerés tisztább jelet kap.

Kockázatok és védőkorlátok

A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.

A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.

A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.

Végrehajtási ütemterv

1

Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.

2

Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.

3

Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.

4

Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

A beszéd szétválasztása és a koktélparti probléma

Gyakran ismételt kérdések

What is Speech Denoising with RNNoise?

Az RNNoise egy apró, gyors neurális hálózat, amely valós időben távolítja el a háttérzajt a beszédből. A Xiph.Org Jean-Marc Valin által megalkotott, a klasszikus jelfeldolgozást egy kis visszatérő hálózattal párosítja, így normál CPU-kon és még beágyazott eszközökön is fut.

Mit jósol az RNNnoise elsősorban az egyes rövid hangkockákra?

Az RNNoise sávonkénti nyereséget becsül, amely csillapítja a zaj által dominált sávokat, miközben megőrzi a beszéddomináltakat, ahelyett, hogy minden spektrális sávon dolgozna.

Milyen típusú neurális hálózat található az RNNnoise magjában?

Az RNNoise egy kompakt ismétlődő neurális hálózatot használ, amely kapuzott ismétlődő egységekkel épül fel, így időbeli memóriát biztosít, miközben kicsi marad.

Miért használ az RNNnoise észlelési frekvenciasávokat a nyers spektrális sávok helyett?

Ha csak ~22 sávos nyereséget jósolunk, a hálózat kicsi és gyors marad, és kevésbé lesz kitéve a binkénti módszereket sújtó zenei-zaj műtermékeknek.

Körülbelül mekkora az RNNoise modell?

Az RNNoise körülbelül 85 000 súlyú, elég kicsi ahhoz, hogy a valós időben gyorsabban működjön egyetlen CPU magon.

Mi a hangmagasságszűrő szerepe az RNNnoise-ban?

A fésű/hangmagasság szűrő kihasználja a hangos beszéd harmonikus szerkezetét, hogy elnyomja a felharmonikusok között ülő zajt, kiegészítve a sáverősítést.