AI knihovna zdarma

Audio AI průvodciNavždy zdarma.

117 Průvodci v jednoduché angličtině, strukturované výukové programy a otevřená knihovna – vytvořené nezávislou neziskovou organizací 501(c)(3), takže moderní umělé inteligenci může porozumět každý.

117Zdarma průvodci
1Tématické stopy
~2 minPodle průvodce
~4hDoba čtení

Začněte zde

Pět Kurzy založené na výsledcích

Každý kurz obsahuje explicitní výsledky, namapované kompetence, cvičné aktivity a aplikovaný závěrečný projekt.

Tématické stopy

Procházet podle stopy

Skočte do oblasti, na které vám záleží. Každá trať má několik jednoduchých anglických průvodců.

Plná knihovna

Všichni průvodci

117 z 1019 zobrazena vodítka. Filtrujte podle skladby nebo vyhledávání výše.

Audio AI

Mimi Streaming Audio kodek

Mimi je neurální zvukový kodek, který komprimuje řeč do malého proudu diskrétních tokenů v reálném čase, takže modely AI mohou poslouchat a mluvit s velmi nízkou…

2 min přečtenoPřečtěte si
Audio AI

Poslouchejte Attend and Spell

Listen, Attend and Spell (LAS) je přelomová neuronová síť z roku 2015, která přepisuje řeč přímo do znaků, bez ručně vytvořené výslovnosti…

2 min přečtenoPřečtěte si
Audio AI

SpecAugment pro rozpoznávání řeči

SpecAugment je jednoduchá, ale výkonná metoda rozšiřování dat, která maskuje a deformuje spektrogram řeči, aby byly modely rozpoznávání robustnější.

2 min přečtenoPřečtěte si
Audio AI

Automatické označování hudby

Automatické značkování hudby využívá strojové učení k poslechu skladby a automaticky připojuje popisné štítky, jako je žánr, nálada, nástroje a tempo.

2 min přečtenoPřečtěte si
Audio AI

Přenos hudebního zabarvení

Přenos zabarvení přetváří „barvu tónu“ zvuku, takže jeden nástroj zní jako druhý a mění zabručenou melodii na housle nebo trubku…

2 min přečtenoPřečtěte si
Audio AI

Klasifikace akustické scény

Klasifikace akustické scény (ASC) trénuje stroje, aby rozpoznaly prostředí, ve kterém byl záznam pořízen, rušnou ulici, tichý park, vlak, kavárnu…

2 min přečtenoPřečtěte si
Audio AI

NVIDIA Riva a NeMo Speech

NVIDIA Riva je GPU akcelerované SDK pro produkční řečovou umělou inteligenci (ASR, TTS a překlad), zatímco NeMo je open-source sada nástrojů pro školení a jemné ladění…

2 min přečtenoPřečtěte si
Audio AI

Architektura DeepSpeech

DeepSpeech je komplexní model rozpoznávání řeči představený společností Baidu v roce 2014, který mapuje nezpracované zvukové funkce přímo na text pomocí opakujícího se neuronového…

2 min přečtenoPřečtěte si
Audio AI

Vložení reproduktorů X-Vector

X-vektory jsou numerické otisky prstů s pevnou délkou hlasu mluvčího produkované neuronovou sítí, které se používají k určení, kdo mluví, bez ohledu na to, co říkají.

2 min přečtenoPřečtěte si
Audio AI

Monotónní zarovnání Glow-TTS

Glow-TTS je model převodu textu na řeč, který se pomocí chytrého vyhledávacího triku učí zarovnávat text na řeč sám, čímž odstraňuje potřebu samostatného zarovnávače.

2 min přečtenoPřečtěte si
Audio AI

Paralelní WaveGAN Vocoder

Parallel WaveGAN je rychlý neurální vokodér, který pomocí malého GAN přemění mel-spektrogram na surový zvukový průběh a generuje všechny vzorky najednou.

2 min přečtenoPřečtěte si
Audio AI

Vocoder založený na WaveGlow Flow

WaveGlow je neurální vokodér založený na toku od společnosti NVIDIA, který syntetizuje křivky řeči z mel-spektrogramů v jediném průchodu bez autoregrese.

2 min přečtenoPřečtěte si

Dočetl jsi to? Dokaž to.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.