Audio AI GUIDE

Speech Deoising med RNNoise

RNNoise er et lite, raskt nevralt nettverk som fjerner bakgrunnsstøy fra tale i sanntid.

2 min lesingSist oppdatert

Oversikt

Created by Xiph.Org's Jean-Marc Valin, it pairs classic signal processing with a small recurrent network so it runs on ordinary CPUs and even embedded devices.

Dypdykk

RNNoise, utgitt i 2017, ble designet for støydemping med lav latens i taleanrop. I stedet for å lære alt ende-til-ende, deler den opp tale i omtrent 22 frekvensbånd modellert på det menneskelige øret (en Bark-lignende skala) og bruker et tilbakevendende nevralt nettverk med Gated Recurrent Units for å estimere en forsterkning (0 til 1) for hvert bånd per ramme. Disse gevinstene demper støyende bånd samtidig som de holder taledominerte bånd intakte. Et komplementært tonehøydefilter renser opp gjenværende støy mellom harmoniske av stemt tale. Hele modellen har omtrent 85 000 vekter, kjører raskere enn sanntid på en enkelt CPU-kjerne, og er åpen kildekode under en BSD-lisens, som er grunnen til at den ble integrert i prosjekter som Opus codec-økosystem, Mumble og OBS Studio.

Teknisk innsikt

Nøkkeldesignvalget er å operere på perseptuelle båndgevinster i stedet for rå spektralbeholdere. Ved å forutsi bare ~22 forsterkningsverdier per ramme, forblir GRU-nettverket lite og unngår artefakter med musikalsk støy som er vanlige i eldre spektral-subtraksjonsmetoder. Håndlagde funksjoner (bandenergier, tonehøydeperiode, tonehøydekorrelasjon) mater nettverket, og blander DSP-kunnskap med læring. En separat stemmeaktivitetsutgang hjelper portforsterkning under ren-støyrammer.

Strategisk innvirkning

Access and reach

Det forbedrer tilgjengeligheten gjennom transkripsjon, fortellerstemme og stemmegrensesnitt.

Cost and budget

Medieteam kan sende polert lyd raskere med mindre budsjetter.

Speed and scale

Kundevendte systemer kan behandle talte interaksjoner i større skala.

The Future of Speech Denoising med RNNoise

RNNoise inspirerte en bølge av lett, sanntids forbedringsarbeid; etterfølgeren forskning (PercepNet, DeepFilterNet) presser kvaliteten høyere samtidig som CPU-budsjettene holdes små. Forvent at denoisers vil bygge direkte inn i hodesett, høreapparater og konferansebrikker, for å kombinere med ekko-kansellering og dereverberation, og bruke perseptuelle og til og med generative mål. Den hybride DSP-pluss-liten-nettverksoppskriften forblir innflytelsesrik der lav latens, lav strøm og åpen kildekode-lisensiering betyr mer enn råmodellstørrelse.

Real-World Implementering

Undertrykker tastaturklatring og viftebrum under videosamtaler i apper som samler RNNoise.

Rydd opp i en streamers mikrofon i OBS Studio via det innebygde RNNoise-støydempende filteret.

Forbedring av forståelighet av talechat i spill og VoIP-verktøy som Mumble på lavstrøms maskinvare.

Forbehandler støyende feltopptak slik at nedstrøms talegjenkjenning får et renere signal.

Risikoer og rekkverk

Risikoen for stemmemisbruk og etterligning øker når samtykke mangler.

Nøyaktigheten kan falle på tvers av aksenter, dialekter eller støyende omgivelser.

Syntetisk lyd kan forveksles med autentisk tale uten tydelig merking.

Veikart for implementering

1

Innhent eksplisitt samtykke for stemmefangst, kloning og gjenbruk.

2

Test kvalitet på tvers av forskjellige høyttalere og bakgrunnsforhold.

3

Definer når et menneske må gjennomgå eller godkjenne utdata.

4

Merk syntetisk lyd og oppbevar herkomstregistreringer for ansvarlighet.

Fortsett å utforske

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speech Denoising with RNNoise quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Neste guide

Taleseparasjon og Cocktailparty-problemet

Ofte stilte spørsmål

What is Speech Denoising with RNNoise?

RNNoise er et lite, raskt nevralt nettverk som fjerner bakgrunnsstøy fra tale i sanntid. Laget av Xiph.Orgs Jean-Marc Valin, parer den klassisk signalbehandling med et lite tilbakevendende nettverk slik at den kjører på vanlige CPUer og til og med innebygde enheter.

Hva forutsier RNNoise primært for hvert kort bilde med lyd?

RNNoise estimerer forsterkninger per bånd som demper støydominerte bånd samtidig som de bevarer taledominerte, i stedet for å jobbe på hver spektral binge.

Hvilken type nevrale nettverk er kjernen i RNNoise?

RNNoise bruker et kompakt tilbakevendende nevralt nettverk bygget med Gated Recurrent Units, som gir det tidsmessig minne samtidig som det forblir lite.

Hvorfor bruker RNNoise perseptuelle frekvensbånd i stedet for råspektrale binger?

Å forutsi bare ~22 båndgevinster holder nettverket lite, raskt og mindre utsatt for artefaktene med musikalsk støy som plager metodene per boks.

Omtrent hvor stor er RNNoise-modellen?

RNNoise har i størrelsesorden 85 000 vekter, små nok til å kjøre raskere enn sanntid på en enkelt CPU-kjerne.

Hva er rollen til tonehøydefilteret i RNNoise?

Et kam/pitch-filter utnytter den harmoniske strukturen til stemt tale for å undertrykke støy som sitter mellom harmoniske, og komplementerer båndforsterkningen.