Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Start her

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Spleeter stammeseparasjon

Spleeter er et åpen kildekodeverktøy fra Deezer som deler opp en ferdig sang i separate spor (vokal, trommer, bass og mer) ved hjelp av dyp læring.

2 min readLes
Audio AI

CREPE Pitch estimering

CREPE er en dyplæringsmodell som estimerer den grunnleggende frekvensen (pitch) til et monofonisk lydsignal direkte fra dens rå bølgeform.

2 min readLes
Audio AI

PESQ og STOI talekvalitetsmålinger

PESQ og STOI er standard objektive beregninger som viser hvor god bearbeidet tale høres ut og hvor forståelig den er, uten å trenge menneskelige lyttere.

2 min readLes
Audio AI

Kilde-Filter Vocoding og WORLD

En vocoder er et verktøy som tar talen fra hverandre i byggeklossene og gjenoppbygger den.

2 min readLes
Audio AI

Gjennomsnittlig vurdering av meningspoeng

Mean Opinion Score (MOS) er en gjennomsnittlig vurdering fra 1 til 5 fra menneskelige lyttere som måler hvor bra syntetisert eller overført lyd lyder.

2 min readLes
Audio AI

Constant-Q Transform for lyd

Constant-Q Transform (CQT) er en frekvensanalyse som bruker logaritmisk adskilte binger tilpasset musikalsk tonehøyde, i stedet for jevnt fordelte hyller...

2 min readLes
Audio AI

Filterbank og PLP-funksjoner

Filterbank og Perceptual Linear Prediction (PLP)-funksjoner er måter å oppsummere et talesignal til kompakte, perseptuelt meningsfylte tall som maskin ...

2 min readLes
Audio AI

StyleTTS 2 Style Diffusion

StyleTTS 2 er en tekst-til-tale-modell som behandler stemme-"stil" - prosodi, følelser og høyttalerklang - som en tilfeldig variabel samplet med en diffusjonsmodell ...

2 min readLes
Audio AI

FastPitch Pitch-kontrollerbar TTS

FastPitch er en rask, ikke-autoregressiv tekst-til-tale-modell som eksplisitt forutsier tonehøyden (fundamental frekvens) for hvert inndatatoken, slik at du...

2 min readLes
Audio AI

Voicebox Flow-Matching Speech Generation

Voicebox er Metas tekststyrte talegenereringsmodell som er trent med et flyt-matchende mål for å "fylle ut" maskert lyd, slik at én modell kan gjøre null-shot-stemme...

2 min readLes
Audio AI

Utfordring for dyp støydemping

The Deep Noise Suppression (DNS) Challenge er en Microsoft-drevet konkurranse som presser forskere til å bygge nevrale nettverk som fjerner bakgrunnsstøy ...

2 min readLes
Audio AI

Spektral subtraksjon og wienerfiltrering

Spektral subtraksjon og Wiener-filtrering er de klassiske arbeidshestene for støyreduksjon før dyp læring.

2 min readLes

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.