AI knihovna zdarma

Audio AI průvodciNavždy zdarma.

117 Průvodci v jednoduché angličtině, strukturované výukové programy a otevřená knihovna – vytvořené nezávislou neziskovou organizací 501(c)(3), takže moderní umělé inteligenci může porozumět každý.

117Zdarma průvodci
1Tématické stopy
~2 minPodle průvodce
~4hDoba čtení

Začněte zde

Pět Kurzy založené na výsledcích

Každý kurz obsahuje explicitní výsledky, namapované kompetence, cvičné aktivity a aplikovaný závěrečný projekt.

Tématické stopy

Procházet podle stopy

Skočte do oblasti, na které vám záleží. Každá trať má několik jednoduchých anglických průvodců.

Plná knihovna

Všichni průvodci

117 z 1019 zobrazena vodítka. Filtrujte podle skladby nebo vyhledávání výše.

Audio AI

Identifikace titulní písně

Identifikace převzaté písně detekuje, kdy dvě velmi odlišně znějící nahrávky jsou ve skutečnosti stejnou základní písní – živá akustická verze, remix…

2 min přečtenoPřečtěte si
Audio AI

DDSP diferencovatelná audio syntéza

DDSP (Differentiable Digital Signal Processing) spojuje klasické stavební bloky syntezátoru s neuronovými sítěmi, takže hluboké učení může ovládat oscilátory…

2 min přečtenoPřečtěte si
Audio AI

VITS End-to-End syntéza řeči

VITS je model převodu textu na řeč, který převádí text přímo na nezpracované zvukové průběhy v jediném trénovaném systému a vynechává obvyklou dvoufázovou linii.

2 min přečtenoPřečtěte si
Audio AI

FastSpeech a neautoregresivní TTS

FastSpeech generuje celý spektrogram řeči paralelně, nikoli po jednom snímku, čímž je syntéza výrazně rychlejší a stabilnější.

2 min přečtenoPřečtěte si
Audio AI

NaturalSpeech a latentní difúze TTS

NaturalSpeech je řada výzkumu Microsoft TTS zaměřená na kvalitu řeči na lidské úrovni, přičemž novější verze využívají latentní difúzi k vytváření bohaté, přirozené…

2 min přečtenoPřečtěte si
Audio AI

Rozpoznávání emocí řeči

Rozpoznávání emocí řeči (SER) je umělá inteligence, která detekuje emoční stav mluvčího – hněv, radost, smutek, frustrace – ze zvuku jeho hlasu, nejen…

2 min přečtenoPřečtěte si
Audio AI

Plně duplexní řeč Moshi

Moshi je open source hlasová umělá inteligence v reálném čase od společnosti Kyutai, která mluví a poslouchá současně – plně duplexně – místo toho, aby se striktně střídala.

2 min přečtenoPřečtěte si
Audio AI

Překlad řeči do řeči

Překlad řeči do řeči (S2ST) přebírá mluvená slova v jednom jazyce a vytváří mluvená slova v jiném – v ideálním případě zachovává hlas mluvčího, tón…

2 min přečtenoPřečtěte si
Audio AI

HiFi-GAN a GAN vokodéry

HiFi-GAN je generativní-adversariální vokodér, který téměř okamžitě přemění mel-spektrogram na surový zvukový průběh a produkuje řeč ve studiové kvalitě daleko…

2 min přečtenoPřečtěte si
Audio AI

Konverze grafému na foném

Konverze grafému na foném (G2P) převádí psaná písmena na zvuky, které by řečový systém měl skutečně vyslovovat.

2 min přečtenoPřečtěte si
Audio AI

Normalizace textu pro řeč

Normalizace textu je úvodním krokem, který přepíše nezpracovaný psaný text na plně vyslovená slova dříve, než to řečový systém řekne.

2 min přečtenoPřečtěte si
Audio AI

Neuralový kodek SoundStream

SoundStream je end-to-end neurální zvukový kodek společnosti Google, který komprimuje řeč a hudbu na extrémně nízké přenosové rychlosti při zachování kvality.

2 min přečtenoPřečtěte si

Dočetl jsi to? Dokaž to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.