Ingyenes AI könyvtár

Audio AI útmutatókÖrökre ingyen.

117 egyszerű angol nyelvű útmutatók, strukturált tanulási útvonalak és nyílt könyvtár – egy független 501(c)(3) nonprofit szervezet építette, így bárki megértheti a modern AI-t.

117Ingyenes útmutatók
1Témasávok
~2 minÚtmutató szerint
~4hReading time

Kezdje itt

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Témasávok

Böngésszen szám szerint

Ugorjon be a számodra fontos területre. Minden számnak több egyszerű angol nyelvű útmutatója van.

Teljes könyvtár

Minden útmutató

117 -ból 1019 útmutatók láthatók. Szűrés sáv szerint vagy keresés fent.

Audio AI

Mimi Streaming Audio Codec

A Mimi egy neurális audiokodek, amely valós időben tömöríti a beszédet diszkrét tokenek kis folyamává, így az AI-modellek nagyon halk hangon hallgathatnak és beszélhetnek…

2 min olvasniOlvassa el
Audio AI

Figyelj, figyelj és írj

A Listen, Attend and Spell (LAS) egy mérföldkőnek számító 2015-ös neurális hálózat, amely a beszédet közvetlenül karakterekké írja át, kézzel készített kiejtés nélkül...

2 min olvasniOlvassa el
Audio AI

SpecAugment a beszédfelismeréshez

A SpecAugment egy egyszerű, de hatékony adatkiegészítési módszer, amely maszkolja és torzítja a beszéd spektrogramját, hogy a felismerési modelleket robusztusabbá tegye.

2 min olvasniOlvassa el
Audio AI

Zene automatikus címkézése

A zene automatikus címkézése gépi tanulást használ egy dal meghallgatására, és automatikusan leíró címkéket, például műfajt, hangulatot, hangszereket és tempót csatol hozzá.

2 min olvasniOlvassa el
Audio AI

Zenei hangszín transzfer

A hangszínátvitel átformálja a hang „hangszínét”, így az egyik hangszer úgy szól, mint a másik, és egy dúdolt dallamot hegedűvé vagy trombitasorrá alakít...

2 min olvasniOlvassa el
Audio AI

Akusztikus jelenetek osztályozása

Az akusztikus jelenetosztályozás (ASC) arra tanítja a gépeket, hogy felismerjék azt a környezetet, amelyben a felvétel készült, egy forgalmas utcában, egy csendes parkban, egy vonaton, egy kávézóban…

2 min olvasniOlvassa el
Audio AI

NVIDIA Riva és NeMo Speech

Az NVIDIA Riva egy GPU-gyorsított SDK az éles beszéd AI-hoz (ASR, TTS és fordítás), míg a NeMo a nyílt forráskódú eszközkészlet a képzéshez és a finomhangoláshoz…

2 min olvasniOlvassa el
Audio AI

DeepSpeech architektúra

A DeepSpeech egy végponttól végpontig terjedő beszédfelismerő modell, amelyet a Baidu 2014-ben vezetett be, és amely a nyers hangjellemzőket közvetlenül a szövegre képezi le egy visszatérő neurális…

2 min olvasniOlvassa el
Audio AI

X-Vector hangszóró beágyazások

Az X-vektorok a beszélő hangjának egy neurális hálózat által előállított, rögzített hosszúságú numerikus ujjlenyomatai, amelyek segítségével megmondják, ki beszél, függetlenül attól, hogy mit mondanak.

2 min olvasniOlvassa el
Audio AI

Glow-TTS monoton igazítás

A Glow-TTS egy szövegfelolvasó modell, amely egy ügyes keresési trükk segítségével megtanulja önállóan igazítani a szöveget a beszédhez, így nincs szükség külön igazítóra.

2 min olvasniOlvassa el
Audio AI

Párhuzamos WaveGAN Vocoder

A Parallel WaveGAN egy gyors neurális vocoder, amely a mel-spektrogramot nyers hanghullámformává alakítja egy kis GAN segítségével, egyszerre generálva minden mintát.

2 min olvasniOlvassa el
Audio AI

WaveGlow Flow-alapú Vocoder

A WaveGlow egy áramlásalapú neurális vokóder az NVIDIA-tól, amely egyetlen lépésben, autoregresszió nélkül szintetizálja a beszéd hullámformáit mel-spektrogramokból.

2 min olvasniOlvassa el

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.