PRZEWODNIK AI audio

Odejmowanie widmowe i filtracja Wienera

Odejmowanie widmowe i filtrowanie Wienera to klasyczne, poprzedzające głębokie uczenie się, podstawowe narzędzia redukcji szumów.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

They clean audio by estimating the noise spectrum and mathematically subtracting or attenuating it, and they still underpin many modern systems.

Głębokie nurkowanie

Obie metody działają w dziedzinie częstotliwości po krótkotrwałej transformacji Fouriera. Odejmowanie widmowe szacuje średnią moc szumu, zwykle podczas cichych przerw, i odejmuje ją od widma wielkości każdej klatki; wszystko, co pozostaje, jest traktowane jako mowa. Jest prosty i tani, ale ma tendencję do tworzenia „szumu muzycznego”, ulotnych przypadkowych tonów spowodowanych niedoskonałym odejmowaniem, pozostawiającym izolowane szczyty widma. Filtrowanie Wienera jest bardziej oparte na zasadach: wyznacza statystycznie optymalne wzmocnienie dla każdego przedziału częstotliwości, aby zminimalizować błąd średniokwadratowy, ważąc przedziały według ich szacowanego stosunku sygnału do szumu. Przechodzą kosze zdominowane przez mowę; kosze zdominowane przez hałas są silnie wytłumione. W obu przypadkach zakłada się, że hałas jest stosunkowo stacjonarny, co ogranicza je przed nagłymi, zmieniającymi się dźwiękami.

Wgląd techniczny

Wzmocnienie Wienera w odbiorniku wynosi w przybliżeniu SNR/(SNR + 1), więc odbiorniki o wysokim SNR zatrzymują większość swojej energii, podczas gdy odbiorniki o niskim SNR są tłumione. Zamiast tego odejmowanie widmowe oblicza wielkość minus szacowana wielkość szumu, a następnie obniża wartości ujemne do zera. Obydwa wykorzystują ponownie pierwotną zaszumioną fazę podczas rekonstrukcji kształtu fali, ponieważ ludzki słuch jest stosunkowo niewrażliwy na błędy fazowe w krótkich klatkach.

Wpływ strategiczny

Dostęp i zasięg

Poprawia dostępność poprzez transkrypcję, narrację i interfejsy głosowe.

Koszt i budżet

Zespoły medialne mogą szybciej dostarczać dopracowany dźwięk przy mniejszych budżetach.

Szybkość i skala

Systemy skierowane do klienta mogą przetwarzać interakcje mówione na większą skalę.

Przyszłość odejmowania widmowego i filtrowania Wienera

Metody te nie zanikają; są wchłaniane. Głębokie sieci uczą się teraz masek wygenerowanych analitycznie przez filtrowanie Wienera, a koncepcja wzmocnienia oparta na współczynniku SNR bezpośrednio zainspirowała maskowanie czasowo-częstotliwościowe stosowane do wzmacniania mowy neuronowej. Można się spodziewać dalszego wykorzystania jako lekkich front-endów na ograniczonym sprzęcie, jako priorytetów stabilizujących wyuczone modele oraz jako możliwych do zinterpretowania punktów bazowych, z którymi badacze porównują nowe systemy.

Implementacja w świecie rzeczywistym

Wstępne ustawienia redukcji szumów w edytorach audio, takich jak Audacity (usuwanie szumów widmowych)

Czyszczenie głosu w starszych systemach telefonicznych i VoIP

Odszumianie frontonu przed rozpoznawaniem mowy na wbudowanych chipach o małej mocy

Zwiększanie zrozumiałości we wczesnych aparatach słuchowych i systemach dyktowania

Zagrożenia i poręcze

W przypadku braku zgody zwiększa się ryzyko niewłaściwego użycia głosu i podszywania się pod inne osoby.

Dokładność może spaść w przypadku akcentów, dialektów lub hałaśliwego otoczenia.

Bez wyraźnego oznakowania dźwięk syntetyczny można pomylić z autentyczną mową.

Plan wdrożenia

1

Uzyskaj wyraźną zgodę na przechwytywanie, klonowanie i ponowne wykorzystanie głosu.

2

Testuj jakość na różnych głośnikach i w różnych warunkach otoczenia.

3

Zdefiniuj, kiedy człowiek musi przejrzeć lub zatwierdzić wyniki.

4

Oznacz dźwięk syntetyczny i prowadź dokumentację pochodzenia w celu zapewnienia odpowiedzialności.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Spectral Subtraction and Wiener Filtering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Spektrogram dyfuzyjny Dyfuzja

Często zadawane pytania

What is Spectral Subtraction and Wiener Filtering?

Odejmowanie widmowe i filtrowanie Wienera to klasyczne, poprzedzające głębokie uczenie się, podstawowe narzędzia redukcji szumów. Oczyszczają dźwięk, szacując widmo szumu i matematycznie odejmując je lub tłumiąc, i nadal stanowią podstawę wielu nowoczesnych systemów.

Jaki irytujący artefakt jest powszechnie kojarzony z odejmowaniem widma?

Niedoskonałe odejmowanie pozostawia izolowane szczyty widma, które brzmią jak losowe, świergoczące tony, zwane szumem muzycznym.

W jakiej dziedzinie działa głównie odejmowanie widmowe i filtrowanie Wienera?

Obydwa przekształcają dźwięk w dziedzinę częstotliwości poprzez krótkotrwałą transformatę Fouriera przed przetwarzaniem.

Co filtr Wienera próbuje zminimalizować?

Filtrowanie Wienera oblicza wzmocnienie, które minimalizuje błąd średniokwadratowy, dając statystycznie optymalne oszacowanie.

W jaki sposób odejmowanie widmowe zwykle szacuje widmo szumu?

Mierzy średnią moc szumu podczas przerw lub przerw innych niż mowa, a następnie odejmuje tę wartość szacunkową od każdej klatki.

Za pomocą jakiego wyrażenia można w przybliżeniu określić wzmocnienie Wienera w koszu?

Wzmocnienie wynosi w przybliżeniu SNR/(SNR+1), zatem wartości binarne o wysokim SNR są w większości zachowywane, a wartości o niskim SNR są tłumione.