Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Napisy dźwiękowe

Napisy dźwiękowe generują zdanie w języku naturalnym opisujące zawartość klipu audio, na przykład „trąbi klakson pociągu przejeżdżającego przez przejazd kolejowy”.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Rozpoznawanie mowy szeptanej

Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który zamienia dźwięk na tekst w ponad 90 językach.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wav2Vec 2.0

Wav2Vec 2.0 to Meta samonadzorowany model mowy sztucznej inteligencji, który uczy się potężnych reprezentacji audio z surowych, nieoznaczonych nagrań.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Mowa samonadzorowana HuBERTA

HuBERT (ukryta jednostka BERT) to Meta samonadzorowany model mowy sztucznej inteligencji, który uczy się poprzez przewidywanie klastrowych jednostek audio dla zamaskowanych segmentów, w stylu BERT.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wokodery neuronowe

Wokoder neuronowy to model, który przekształca zwartą reprezentację akustyczną, zwykle spektrogram melowy, w rzeczywisty kształt fali słyszalnej.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Neuronowe kodeki audio

Neuralne kodeki audio wykorzystują głębokie uczenie się do kompresowania dźwięku w maleńkie strumienie dyskretnych tokenów i rekonstruowania go z wysoką wiernością.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Modele języka VALL-E i kodeków

VALL-E przeformułował zamianę tekstu na mowę jako problem modelowania języka za pomocą tokenów kodeków audio, umożliwiając klonowanie głosu z zaledwie trzech sekund próbki.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

OpenAI Szept

Whisper to system automatycznego rozpoznawania mowy typu open source firmy OpenAI, który transkrybuje i tłumaczy dźwięk mówiony na dziesiątki języków.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Automatyczna transkrypcja muzyki

Automatyczna transkrypcja muzyki (AMT) przekształca surowe nagranie audio muzyki w zapis symboliczny, taki jak nuty, MIDI lub rolka fortepianu.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Śledzenie rytmu i tempa

Śledzenie rytmu i tempa to zadanie polegające na znalezieniu stałego pulsu w muzyce: miejsca, w którym przypada każde uderzenie i szybkości poruszania się utworu w uderzeniach na minutę (BPM).

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Odcisk palca audio

Odcisk palca audio tworzy zwartą, odporną na zakłócenia cyfrową sygnaturę dźwięku, dzięki czemu można go później rozpoznać, nawet poprzez szum tła…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Szafa grająca

Jukebox to sieć neuronowa OpenAI na rok 2020, która generuje surowy dźwięk muzyczny — wraz ze śpiewającymi głosami, instrumentami, a nawet tekstami w stylu określonych…

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.