Bezpłatna biblioteka AI

Dźwiękowa sztuczna inteligencja przewodnikiZa darmo na zawsze.

117 przewodniki w prostym języku angielskim, ustrukturyzowane ścieżki edukacyjne i otwarta biblioteka — stworzone przez niezależną organizację non-profit 501(c)(3), aby każdy mógł zrozumieć współczesną sztuczną inteligencję.

117Bezpłatne przewodniki
1Ścieżki tematyczne
~2 minWedług przewodnika
~4hCzas czytania

Zacznij tutaj

Pięć Kursy oparte na wynikach

Każdy kurs zawiera wyraźne wyniki, zmapowane kompetencje, ćwiczenia oraz praktyczny projekt końcowy.

Ścieżki tematyczne

Przeglądaj według utworu

Wskocz w obszar, na którym Ci zależy. Do każdego utworu dołączono wiele przewodników w języku angielskim.

Pełna biblioteka

Wszystkie przewodniki

117 z 1019 pokazane przewodniki. Filtruj według utworu lub wyszukaj powyżej.

Dźwiękowa sztuczna inteligencja

Wokoder dyfuzyjny DiffWave

DiffWave to wokoder oparty na dyfuzji, który syntetyzuje dźwięk poprzez iteracyjne odszumianie losowego szumu w kształt fali, uwarunkowany spektrogramem mel.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Generatywny model dźwięku kory

Bark to model typu open source firmy Suno zajmujący się przetwarzaniem tekstu na dźwięk, który generuje nie tylko mowę, ale także śmiech, westchnienia, muzykę i efekty dźwiękowe bezpośrednio z komunikatów tekstowych.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Synteza autoregresyjna TTS żółwia

Tortoise TTS to system zamiany tekstu na mowę o otwartym kodzie źródłowym, ceniony za niezwykle naturalne, bogate emocjonalnie głosy i silne klonowanie głosu z zaledwie kilku krótkich…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wielojęzyczne klonowanie głosu XTTS

XTTS to wielojęzyczny model zamiany tekstu na mowę firmy Coqui, który może sklonować głos z krótkiego klipu, a następnie mówić w wielu różnych językach, zachowując…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Równoległe generowanie dźwięku SoundStorm

SoundStorm to Google model generowania dźwięku, który generuje mowę i dźwięk równolegle, a nie pojedynczo, co zapewnia wysokiej jakości syntezę dźwięku…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Synteza tekstu na audio w AudioGen

AudioGen to model Meta, który zamienia opisy tekstowe w realistyczne dźwięki otoczenia i efekty dźwiękowe, takie jak szczekanie psa i ćwierkanie ptaków.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Stabilna dyfuzja utajona dźwięku

Stable Audio to system zamiany tekstu na dźwięk opracowany przez Stability AI, który wykorzystuje utajoną dyfuzję do generowania muzyki i efektów dźwiękowych, z wyraźną kontrolą długości klipu.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Zestaw narzędzi do rozpoznawania mowy Kaldi

Kaldi to darmowy zestaw narzędzi typu open source, który stał się dominującą platformą badawczą do tworzenia systemów rozpoznawania mowy.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Splotowy ASR Wav2Letter

Wav2Letter to kompleksowy system rozpoznawania mowy opracowany przez sztuczną inteligencję Facebooka, który wykorzystuje wyłącznie splotowe sieci neuronowe, bez powtarzalności.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Jasper i QuartzNet ASR

Jasper i QuartzNet to kompleksowe modele splotowego rozpoznawania mowy firmy NVIDIA, przy czym QuartzNet to znacznie mniejszy, wydajny, przeprojektowany…

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Modele dyfuzyjne dla dźwięku

Modele dyfuzji generują dźwięk, ucząc się odwracać krok po kroku proces szumu, zamieniając przypadkowy szum w spójną mowę, muzykę lub efekty dźwiękowe.

2 min. przeczytajPrzeczytaj
Dźwiękowa sztuczna inteligencja

Wykrywanie zdarzeń dźwiękowych

Wykrywanie zdarzeń dźwiękowych (SED) identyfikuje, jakie dźwięki pojawiają się w strumieniu audio oraz dokładnie kiedy się rozpoczynają i kończą.

2 min. przeczytajPrzeczytaj

Skończyłeś czytać? Udowodnij to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.