Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Start her

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

DiffWave Diffusion Vocoder

DiffWave er en diffusjonsbasert vokoder som syntetiserer lyd ved iterativt å forynge tilfeldig støy til en bølgeform, betinget av et mel-spektrogram.

2 min readLes
Audio AI

Bark Generative Audio Model

Bark er en åpen kildekode tekst-til-lyd-modell fra Suno som genererer ikke bare tale, men latter, sukk, musikk og lydeffekter direkte fra tekstmeldinger.

2 min readLes
Audio AI

Skilpadde TTS autoregressiv syntese

Tortoise TTS er et åpen kildekode-tekst-til-tale-system verdsatt for uvanlig naturlige, følelsesmessig rike stemmer og sterk stemmekloning fra bare noen få korte...

2 min readLes
Audio AI

XTTS tverrspråklig stemmekloning

XTTS er Coquis flerspråklige tekst-til-tale-modell som kan klone en stemme fra et kort klipp og deretter snakke på mange forskjellige språk samtidig som ...

2 min readLes
Audio AI

SoundStorm Parallell Audio Generation

SoundStorm er en Google lydgenereringsmodell som produserer tale og lyd parallelt i stedet for ett token om gangen, noe som gjør lydsyntese av høy kvalitet ...

2 min readLes
Audio AI

AudioGen tekst-til-lyd syntese

AudioGen er en Meta-modell som gjør tekstbeskrivelser til realistiske miljølyder og lydeffekter, som «hund som bjeffer mens fugler kvitrer.

2 min readLes
Audio AI

Stabil lyd-latent diffusjon

Stable Audio er Stability AIs tekst-til-lyd-system som bruker latent diffusjon for å generere musikk og lydeffekter, med eksplisitt kontroll over klipplengden.

2 min readLes
Audio AI

Kaldi talegjenkjenningsverktøysett

Kaldi er et gratis verktøysett med åpen kildekode som ble den dominerende forskningsplattformen for å bygge talegjenkjenningssystemer.

2 min readLes
Audio AI

Wav2Letter Convolutional ASR

Wav2Letter er et ende-til-ende-talegjenkjenningssystem fra Facebook AI som bare brukte konvolusjonelle nevrale nettverk, ingen gjentakelse.

2 min readLes
Audio AI

Jasper og QuartzNet ASR

Jasper og QuartzNet er NVIDIAs ende-til-ende konvolusjonelle talegjenkjenningsmodeller, med QuartzNet som en dramatisk mindre, effektiv redesign...

2 min readLes
Audio AI

Diffusjonsmodeller for lyd

Diffusjonsmodeller genererer lyd ved å lære å reversere en trinnvis støyprosess, og gjøre tilfeldig støy om til sammenhengende tale, musikk eller lydeffekter.

2 min readLes
Audio AI

Deteksjon av lydhendelser

Lydhendelsesdeteksjon (SED) identifiserer hvilke lyder som oppstår i en lydstrøm og nøyaktig når de starter og stopper.

2 min readLes

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 7 of 10 | AI Understanding