Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Kształtowanie wiązki i układy mikrofonów

Technologia Beamforming wykorzystuje wiele mikrofonów do nasłuchu w wybranym kierunku, wzmacniając dźwięk dochodzący z celu, jednocześnie tłumiąc wszystko inne.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Spektrogram dyfuzyjny Dyfuzja

Riffusion to sprytny trik, który generuje muzykę, traktując dźwięk jak obraz: dostraja model obrazu Stable Diffusion, aby malować spektrogramy, a następnie…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

MusicLM: Hierarchiczne tokeny semantyczne i akustyczne

Dowiedz się, jak Google MusicLM wykorzystuje hierarchiczne tokeny semantyczne i akustyczne, SoundStream i MuLan, aby przekształcać podpowiedzi tekstowe w spójną muzykę.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wzmocnienie mowy Noise2Noise

Noise2Noise to sztuczka szkoleniowa, która pozwala modelowi nauczyć się usuwać szum bez zobaczenia czystego odniesienia, poprzez uczenie się od par różnie zaszumionych…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Separacja domeny czasu Conv-TasNet

Conv-TasNet to sieć neuronowa, która oddziela zmieszany dźwięk (jak dwie osoby rozmawiające jednocześnie), pracując bezpośrednio na surowym przebiegu dźwiękowym…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Separacja RNN z podwójną ścieżką

Dual-Path RNN (DPRNN) to architektura separacji dźwięku, która dzieli bardzo długą sekwencję funkcji audio na krótkie, nakładające się fragmenty i przetwarza je…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Separacja muzyki typu open-unmix

Open-Unmix (UMX) to system głębokiego uczenia się typu open source, który dzieli utwór na części: wokal, perkusję, bas i inne instrumenty.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wyrównanie słów ze znacznikiem czasu szeptanym

Wyrównanie słów szeptanych przypina każde transkrybowane słowo do dokładnego czasu rozpoczęcia i zakończenia w dźwięku.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Tagowanie muzyki za pomocą Transformers

Tagowanie muzyki wykorzystuje modele transformatorów do słuchania utworu i przewidywania opisowych etykiet, takich jak gatunek, nastrój, instrumenty i tempo.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wykrywanie początku w dźwięku

Wykrywanie początku znajduje dokładne momenty, w których rozpoczynają się nuty, uderzenia lub dźwięki w sygnale audio.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wokoder generatywny MelGAN

MelGAN to wokoder w pełni splotowy oparty na GAN, który zamienia spektrogramy mel w surowe przebiegi audio w jednym szybkim przebiegu do przodu.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wokoder UnivNet o wielu rozdzielczościach

UnivNet to wokoder GAN, który ocenia wygenerowany dźwięk na podstawie wielu spektrogramów obliczonych w różnych rozdzielczościach STFT, wyostrzając szczegóły wysokich częstotliwości.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.