Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Start her

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Beamforming og mikrofonarrayer

Beamforming bruker flere mikrofoner for å lytte i en valgt retning, og forsterker lyden fra et mål mens alt annet undertrykkes.

2 min readLes
Audio AI

Riffusjonsspektrogramdiffusjon

Riffusion er et smart hack som genererer musikk ved å behandle lyd som et bilde: det finjusterer Stable Diffusion-bildemodellen for å male spektrogrammer, så...

2 min readLes
Audio AI

MusicLM: Hierarkiske semantiske og akustiske tokens

Lær hvordan Google MusicLM bruker hierarkiske semantiske og akustiske tokens, SoundStream og MuLan for å gjøre tekstmeldinger om til sammenhengende musikk.

2 min readLes
Audio AI

Noise2Noise Taleforbedring

Noise2Noise er et treningstriks som lar en modell lære å fjerne støy uten noen gang å se en ren referanse, ved å lære av par med forskjellig støyende...

2 min readLes
Audio AI

Conv-TasNet tidsdomene-separasjon

Conv-TasNet er et nevralt nettverk som skiller blandet lyd (som to personer som snakker samtidig) ved å jobbe direkte på den rå lydbølgeformen i stedet...

2 min readLes
Audio AI

Dual-Path RNN-separasjon

Dual-Path RNN (DPRNN) er en lydseparasjonsarkitektur som deler en veldig lang sekvens av lydfunksjoner i korte overlappende biter og behandler dem...

2 min readLes
Audio AI

Åpne-Unmix Music Separation

Open-Unmix (UMX) er et dyplæringssystem med åpen kildekode som deler en sang i deler: vokal, trommer, bass og andre instrumenter.

2 min readLes
Audio AI

Whisper tidsstemplet ordjustering

Hviskeordjustering fester hvert transkribert ord til en nøyaktig start- og sluttid i lyden.

2 min readLes
Audio AI

Musikkmerking med Transformers

Musikkmerking bruker transformatormodeller for å lytte til en sang og forutsi beskrivende etiketter som sjanger, stemning, instrumenter og tempo.

2 min readLes
Audio AI

Onset-deteksjon i lyd

Onset-deteksjon finner de nøyaktige øyeblikkene når toner, beats eller lyder begynner i et lydsignal.

2 min readLes
Audio AI

MelGAN Generative Vocoder

MelGAN er en fullstendig konvolusjonsbasert GAN-basert vokoder som gjør mel-spektrogrammer til rå lydbølgeformer i en enkelt spol fremover.

2 min readLes
Audio AI

UnivNet Multi-Resolution Vocoder

UnivNet er en GAN-vokoder som bedømmer generert lyd ved å bruke flere spektrogrammer beregnet med forskjellige STFT-oppløsninger, og skarpere høyfrekvente detaljer.

2 min readLes

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.