Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Separacja łodyg Spleetera

Spleeter to narzędzie typu open source firmy Deezer, które dzieli gotowy utwór na osobne ścieżki (wokal, perkusja, bas i inne) przy użyciu głębokiego uczenia.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Oszacowanie paku CREPE

CREPE to model głębokiego uczenia się, który szacuje częstotliwość podstawową (wysokość) monofonicznego sygnału audio bezpośrednio na podstawie jego surowego kształtu fali.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wskaźniki jakości mowy PESQ i STOI

PESQ i STOI to standardowe obiektywne wskaźniki, które oceniają, jak dobrze brzmi przetworzona mowa i jak bardzo jest ona zrozumiała, bez konieczności stosowania ludzkich słuchaczy.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Vokodowanie z filtrem źródłowym i ŚWIAT

Wokoder to narzędzie, które rozkłada mowę na elementy składowe i rekonstruuje ją.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Średnia ocena punktowa opinii

Średni wynik opinii (MOS) to średnia ocena od 1 do 5 wystawiana przez słuchaczy, która mierzy, jak dobrze brzmi syntetyzowany lub transmitowany dźwięk.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Transformacja Constant-Q dla dźwięku

Transformacja Constant-Q (CQT) to analiza częstotliwości, która wykorzystuje logarytmicznie rozmieszczone przedziały dopasowane do wysokości dźwięku, zamiast równomiernie rozmieszczonych przedziałów…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Funkcje banku filtrów i PLP

Funkcje banku filtrów i percepcyjnego przewidywania liniowego (PLP) to sposoby podsumowywania sygnału mowy w zwarte, percepcyjnie znaczące liczby, które maszyny…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Styl Dyfuzja stylu TTS 2

StyleTTS 2 to model zamiany tekstu na mowę, który traktuje „styl” głosu – prozodię, emocje i barwę głośnika – jako zmienną losową próbkowaną za pomocą modelu dyfuzji…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

TTS ze sterowaniem FastPitch Pitch

FastPitch to szybki, nieautoregresywny model zamiany tekstu na mowę, który wyraźnie przewiduje wysokość (częstotliwość podstawową) każdego tokena wejściowego, umożliwiając…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Generowanie mowy dopasowane do przepływu głosowego

Voicebox to model generowania mowy sterowany tekstem firmy Meta, przeszkolony pod kątem dopasowania przepływu, aby „wypełnić” zamaskowany dźwięk, umożliwiając jednemu modelowi wykonywanie głosu zero-shot…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wyzwanie tłumienia głębokiego hałasu

Wyzwanie Deep Noise Suppression (DNS) to konkurs organizowany przez Microsoft, który motywuje badaczy do budowania sieci neuronowych usuwających szum tła…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Odejmowanie widmowe i filtracja Wienera

Odejmowanie widmowe i filtrowanie Wienera to klasyczne, poprzedzające głębokie uczenie się, podstawowe narzędzia redukcji szumów.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.