Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

DiffWave Diffusion Vocoder

DiffWave är en diffusionsbaserad vokoder som syntetiserar ljud genom att iterativt förvandla slumpmässigt brus till en vågform, beroende på ett mel-spektrogram.

2 min readLäs
Audio AI

Bark Generative Audio Model

Bark är en text-till-ljud-modell med öppen källkod från Suno som genererar inte bara tal utan skratt, suckar, musik och ljudeffekter direkt från textuppmaningar.

2 min readLäs
Audio AI

Tortoise TTS Autoregressive Synthesis

Tortoise TTS är ett text-till-tal-system med öppen källkod prissatt för ovanligt naturliga, känslomässigt rika röster och stark röstkloning från bara några få korta...

2 min readLäs
Audio AI

XTTS Cross-lingual Voice Cloning

XTTS är Coquis flerspråkiga text-till-tal-modell som kan klona en röst från ett kort klipp och sedan tala på många olika språk samtidigt som...

2 min readLäs
Audio AI

SoundStorm Parallell Audio Generation

SoundStorm är en Google ljudgenereringsmodell som producerar tal och ljud parallellt snarare än en token åt gången, vilket gör ljudsyntes av hög kvalitet...

2 min readLäs
Audio AI

AudioGen text-till-ljud syntes

AudioGen är en Meta modell som förvandlar textbeskrivningar till realistiska miljöljud och ljudeffekter, som "hund skäller medan fåglarna kvittrar.

2 min readLäs
Audio AI

Stabil Audio Latent Diffusion

Stable Audio är Stability AI:s text-till-ljud-system som använder latent diffusion för att generera musik och ljudeffekter, med explicit kontroll över klipplängden.

2 min readLäs
Audio AI

Kaldi Speech Recognition Toolkit

Kaldi är en gratis verktygslåda med öppen källkod som blev den dominerande forskningsplattformen för att bygga taligenkänningssystem.

2 min readLäs
Audio AI

Wav2Letter Convolutional ASR

Wav2Letter är ett taligenkänningssystem från Facebook AI som endast använde konvolutionerande neurala nätverk, inga upprepningar.

2 min readLäs
Audio AI

Jasper och QuartzNet ASR

Jasper och QuartzNet är NVIDIAs end-to-end konvolutionella taligenkänningsmodeller, där QuartzNet är en dramatiskt mindre, effektiv omdesign...

2 min readLäs
Audio AI

Diffusionsmodeller för ljud

Diffusionsmodeller genererar ljud genom att lära sig att vända en steg-för-steg brusprocess, förvandla slumpmässigt brus till sammanhängande tal, musik eller ljudeffekter.

2 min readLäs
Audio AI

Ljudhändelsedetektering

Ljudhändelsedetektering (SED) identifierar vilka ljud som uppstår i en ljudström och exakt när de startar och slutar.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.