Beszéd zajtalanítása RNNzajjal
Az RNNoise egy apró, gyors neurális hálózat, amely valós időben távolítja el a háttérzajt a beszédből.
Áttekintés
Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.
Mély merülés
A 2017-ben megjelent RNNoise-t a hanghívások alacsony késleltetésű zajelnyomására tervezték. Ahelyett, hogy mindent végpontokig megtanulna, körülbelül 22 frekvenciasávra osztja fel a beszédet az emberi fül mintájára (egy Bark-szerű skála), és egy ismétlődő neurális hálózatot használ kapuzott ismétlődő egységekkel, hogy megbecsülje az egyes sávok erősítését (0-tól 1-ig) keretenként. Ezek az előnyök tompítják a zajos sávokat, miközben a beszéd által dominált sávokat érintetlenül tartják. Egy kiegészítő hangmagasságú szűrő megtisztítja a zöngés beszéd harmonikusai közötti maradék zajt. Az egész modell nagyjából 85 000 súlyú, gyorsabban fut, mint a valós időben egyetlen CPU-magon, és nyílt forráskódú BSD licenc alatt, ezért integrálták olyan projektekbe, mint az Opus kodek ökoszisztémája, a Mumble és az OBS Studio.
Technikai betekintés
A kulcsfontosságú tervezési választás az észlelési sáv erősítésén alapul, nem pedig a nyers spektrális sávokon. Azáltal, hogy képkockánként csak ~22 erősítési értéket jelez előre, a GRU hálózat kicsi marad, és elkerüli a régebbi spektrális kivonási módszerekben szokásos zenei zajokat. Kézzel készített funkciók (sávenergiák, hangmagasság-periódus, hangmagasság-korreláció) táplálják a hálózatot, ötvözve a DSP tudást a tanulással. Egy külön hangaktivitás-kimenet segíti a kapuerősítést a tiszta zajos kereteknél.
Stratégiai hatás
Hozzáférés és elérés
Javítja a hozzáférhetőséget az átírás, a narráció és a hangfelületek révén.
Költség és költségvetés
A médiacsapatok kisebb költségvetéssel gyorsabban szállíthatják a csiszolt hanganyagot.
Sebesség és méretarány
Az ügyfélközpontú rendszerek nagyobb léptékben képesek feldolgozni a beszélt interakciókat.
A beszéd zajtalanításának jövője az RNNnoise segítségével
Az RNNoise a könnyű, valós idejű javítási munka hullámát ihlette; utódkutatása (PercepNet, DeepFilterNet) a minőséget magasabb szintre emeli, miközben alacsonyan tartja a CPU-költségvetést. Várható, hogy a hangtalanítók közvetlenül fejhallgatókba, hallókészülékekbe és konferenciachipekbe ágyazódnak, visszhang-kioltással és derverberációval kombinálva, valamint érzékelési, sőt generatív objektíveket használnak. A hibrid DSP-plus-small-network receptúra mindenhol befolyásos marad, ahol az alacsony késleltetés, az alacsony fogyasztás és a nyílt forráskódú licenc fontosabb, mint a nyers modellméret.
Valós megvalósítás
Elnyomja a billentyűzet csörömpölését és a ventilátorzúgást videohívások közben az RNNnoise-t csomagoló alkalmazásokban.
A streamer mikrofonjának tisztítása az OBS Stúdióban a beépített RNNnoise zajszűrőn keresztül.
A hangcsevegés érthetőségének javítása játékokban és VoIP-eszközökben, mint például a Mumble alacsony fogyasztású hardveren.
A zajos térfelvételek előfeldolgozása, így a beszédfelismerés tisztább jelet kap.
Kockázatok és védőkorlátok
A beleegyezés hiányában nő a hanggal való visszaélés és a megszemélyesítés kockázata.
A pontosság csökkenhet az akcentusok, dialektusok vagy zajos környezetben.
A szintetikus hang összetéveszthető a hiteles beszéddel egyértelmű címkézés nélkül.
Végrehajtási ütemterv
Kérjen kifejezett hozzájárulást a hangrögzítéshez, klónozáshoz és újrafelhasználáshoz.
Tesztelje a minőséget különféle hangszórókon és háttérviszonyok között.
Határozza meg, mikor kell egy embernek felülvizsgálnia vagy jóváhagynia a kimeneteket.
Címkézze fel a szintetikus hanganyagot, és vezessen származási nyilvántartást az elszámoltathatóság érdekében.
Folytassa a felfedezést
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speech Denoising with RNNoise quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Következő útmutató
A beszéd szétválasztása és a koktélparti probléma
Gyakran ismételt kérdések
What is Speech Denoising with RNNoise?
Az RNNoise egy apró, gyors neurális hálózat, amely valós időben távolítja el a háttérzajt a beszédből. A Xiph.Org Jean-Marc Valin által megalkotott, a klasszikus jelfeldolgozást egy kis visszatérő hálózattal párosítja, így normál CPU-kon és még beágyazott eszközökön is fut.
Mit jósol az RNNnoise elsősorban az egyes rövid hangkockákra?
Az RNNoise sávonkénti nyereséget becsül, amely csillapítja a zaj által dominált sávokat, miközben megőrzi a beszéddomináltakat, ahelyett, hogy minden spektrális sávon dolgozna.
Milyen típusú neurális hálózat található az RNNnoise magjában?
Az RNNoise egy kompakt ismétlődő neurális hálózatot használ, amely kapuzott ismétlődő egységekkel épül fel, így időbeli memóriát biztosít, miközben kicsi marad.
Miért használ az RNNnoise észlelési frekvenciasávokat a nyers spektrális sávok helyett?
Ha csak ~22 sávos nyereséget jósolunk, a hálózat kicsi és gyors marad, és kevésbé lesz kitéve a binkénti módszereket sújtó zenei-zaj műtermékeknek.
Körülbelül mekkora az RNNoise modell?
Az RNNoise körülbelül 85 000 súlyú, elég kicsi ahhoz, hogy a valós időben gyorsabban működjön egyetlen CPU magon.
Mi a hangmagasságszűrő szerepe az RNNnoise-ban?
A fésű/hangmagasság szűrő kihasználja a hangos beszéd harmonikus szerkezetét, hogy elnyomja a felharmonikusok között ülő zajt, kiegészítve a sáverősítést.