Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Start her

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Identifikasjon av coverlåt

Identifikasjon av coverlåter oppdager når to innspillinger med svært forskjellig lyd faktisk er den samme underliggende sangen - en live akustisk versjon, en remiks ...

2 min readLes
Audio AI

DDSP differensierbar lydsyntese

DDSP (Differentiable Digital Signal Processing) smelter sammen klassiske synthesizerbyggesteiner med nevrale nettverk, slik at dyp læring kan kontrollere oscillatorer...

2 min readLes
Audio AI

VITS ende-til-ende talesyntese

VITS er en tekst-til-tale-modell som gjør tekst direkte til rå lydbølgeformer i et enkelt opplært system, og hopper over den vanlige to-trinns pipeline.

2 min readLes
Audio AI

FastSpeech og ikke-autoregressiv TTS

FastSpeech genererer et helt talespektrogram parallelt i stedet for én ramme om gangen, noe som gjør syntesen dramatisk raskere og mer stabil.

2 min readLes
Audio AI

NaturalSpeech og latent diffusjon TTS

NaturalSpeech er en linje med Microsoft TTS-forskning som tar sikte på talekvalitet på menneskelig nivå, med senere versjoner som bruker latent diffusjon for å generere rik, naturlig...

2 min readLes
Audio AI

Talefølelsesgjenkjenning

Speech Emotion Recognition (SER) er AI som oppdager en høyttalers følelsesmessige tilstand – sinne, glede, tristhet, frustrasjon – fra lyden av stemmen deres, ikke bare...

2 min readLes
Audio AI

Moshi full-dupleks tale

Moshi er en åpen kildekode, sanntids stemme-AI fra Kyutai som snakker og lytter samtidig – full-dupleks – i stedet for å ta strenge svinger.

2 min readLes
Audio AI

Tale-til-tale-oversettelse

Tale-til-tale-oversettelse (S2ST) tar talte ord på ett språk og produserer talte ord på et annet - ideelt sett bevarer høyttalerens stemme, tone ...

2 min readLes
Audio AI

HiFi-GAN og GAN Vocoders

HiFi-GAN er en generativ-motstridende vokoder som gjør et mel-spektrogram til en rå lydbølgeform nesten umiddelbart, og produserer tale i studiokvalitet langt ...

2 min readLes
Audio AI

Grafem-til-fonem-konvertering

Grafem-til-fonem (G2P) konvertering oversetter skrevne bokstaver til lydene et talesystem faktisk skal uttale.

2 min readLes
Audio AI

Tekstnormalisering for tale

Tekstnormalisering er front-end-trinnet som omskriver rå skrevet tekst til fullstendig talte ord før et talesystem sier det.

2 min readLes
Audio AI

SoundStream Neural Codec

SoundStream er Googles ende-til-ende nevrale lydkodek som komprimerer tale og musikk til ekstremt lave bithastigheter samtidig som kvaliteten bevares.

2 min readLes

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding