AI knihovna zdarma

Audio AI průvodciNavždy zdarma.

117 Průvodci v jednoduché angličtině, strukturované výukové programy a otevřená knihovna – vytvořené nezávislou neziskovou organizací 501(c)(3), takže moderní umělé inteligenci může porozumět každý.

117Zdarma průvodci
1Tématické stopy
~2 minPodle průvodce
~4hDoba čtení

Začněte zde

Pět Kurzy založené na výsledcích

Každý kurz obsahuje explicitní výsledky, namapované kompetence, cvičné aktivity a aplikovaný závěrečný projekt.

Tématické stopy

Procházet podle stopy

Skočte do oblasti, na které vám záleží. Každá trať má několik jednoduchých anglických průvodců.

Plná knihovna

Všichni průvodci

117 z 1019 zobrazena vodítka. Filtrujte podle skladby nebo vyhledávání výše.

Audio AI

Difuzní vokodér DiffWave

DiffWave je vokodér založený na difúzi, který syntetizuje zvuk opakovaným odšumováním náhodného šumu do tvaru vlny, podmíněného mel-spektrogramem.

2 min přečtenoPřečtěte si
Audio AI

Generativní zvukový model Bark

Bark je open source model převodu textu na zvuk od Suno, který generuje nejen řeč, ale i smích, povzdechy, hudbu a zvukové efekty přímo z textových výzev.

2 min přečtenoPřečtěte si
Audio AI

Autoregresivní syntéza želvy TTS

Tortoise TTS je open source systém převodu textu na řeč ceněný pro neobvykle přirozené, emocionálně bohaté hlasy a silné klonování hlasu z několika krátkých…

2 min přečtenoPřečtěte si
Audio AI

XTTS křížové klonování hlasu

XTTS je vícejazyčný model převodu textu na řeč společnosti Coqui, který dokáže naklonovat hlas z krátkého klipu a poté hovořit v mnoha různých jazycích při zachování…

2 min přečtenoPřečtěte si
Audio AI

Paralelní generování zvuku SoundStorm

SoundStorm je model generování zvuku Google, který produkuje řeč a zvuk paralelně, nikoli po jednom tokenu, což umožňuje vysoce kvalitní syntézu zvuku…

2 min přečtenoPřečtěte si
Audio AI

AudioGen Text-to-Audio syntéza

AudioGen je model Meta, který přeměňuje textové popisy na realistické zvuky prostředí a zvukové efekty, jako je „štěkání psů při cvrlikání ptáků“.

2 min přečtenoPřečtěte si
Audio AI

Stabilní latentní šíření zvuku

Stable Audio je systém převodu textu na zvuk společnosti Stability AI, který využívá latentní difúzi ke generování hudby a zvukových efektů s explicitní kontrolou nad délkou klipu.

2 min přečtenoPřečtěte si
Audio AI

Kaldi sada nástrojů pro rozpoznávání řeči

Kaldi je bezplatná sada nástrojů s otevřeným zdrojovým kódem, která se stala dominantní výzkumnou platformou pro vytváření systémů rozpoznávání řeči.

2 min přečtenoPřečtěte si
Audio AI

Wav2Letter konvoluční ASR

Wav2Letter je end-to-end systém rozpoznávání řeči od Facebooku AI, který používal pouze konvoluční neuronové sítě, bez opakování.

2 min přečtenoPřečtěte si
Audio AI

Jasper a QuartzNet ASR

Jasper a QuartzNet jsou komplexní modely konvolučního rozpoznávání řeči NVIDIA, přičemž QuartzNet je výrazně menší a efektivnější přepracovaný design…

2 min přečtenoPřečtěte si
Audio AI

Difúzní modely pro zvuk

Difúzní modely generují zvuk tím, že se učí zvrátit krok za krokem proces tvorby šumu a přeměňují náhodný šum na koherentní řeč, hudbu nebo zvukové efekty.

2 min přečtenoPřečtěte si
Audio AI

Detekce zvukové události

Detekce zvukových událostí (SED) identifikuje, jaké zvuky se vyskytují v audio streamu a kdy přesně začínají a kdy končí.

2 min přečtenoPřečtěte si

Dočetl jsi to? Dokaž to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.