Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Beamforming och mikrofonmatriser

Beamforming använder flera mikrofoner för att lyssna i en vald riktning, förstärker ljudet från ett mål samtidigt som allt annat dämpas.

2 min readLäs
Audio AI

Riffusionsspektrogramdiffusion

Riffusion är ett smart hack som genererar musik genom att behandla ljud som en bild: det finjusterar bildmodellen Stable Diffusion för att måla spektrogram, sedan...

2 min readLäs
Audio AI

MusicLM: Hierarkiska semantiska och akustiska tokens

Lär dig hur Google MusicLM använder hierarkiska semantiska och akustiska tokens, SoundStream och MuLan för att förvandla textuppmaningar till sammanhängande musik.

2 min readLäs
Audio AI

Noise2Noise Speech Enhancement

Noise2Noise är ett träningsknep som låter en modell lära sig att ta bort brus utan att någonsin se en ren referens, genom att lära sig från par med olika bullriga...

2 min readLäs
Audio AI

Conv-TasNet tidsdomänseparation

Conv-TasNet är ett neuralt nätverk som separerar blandat ljud (som två personer som pratar samtidigt) genom att arbeta direkt på den råa ljudvågen istället...

2 min readLäs
Audio AI

Dual-Path RNN Separation

Dual-Path RNN (DPRNN) är en ljudseparationsarkitektur som delar upp en mycket lång sekvens av ljudfunktioner i korta överlappande bitar och bearbetar dem...

2 min readLäs
Audio AI

Öppna-Unmix musikseparation

Open-Unmix (UMX) är ett djupinlärningssystem med öppen källkod som delar upp en låt i dess delar: sång, trummor, bas och andra instrument.

2 min readLäs
Audio AI

Viska tidsstämplad ordjustering

Viskordsjustering fäster varje transkriberat ord till en exakt start- och sluttid i ljudet.

2 min readLäs
Audio AI

Musikmärkning med Transformers

Musiktaggning använder transformatormodeller för att lyssna på en låt och förutsäga beskrivande etiketter som genre, humör, instrument och tempo.

2 min readLäs
Audio AI

Detektering av start i ljud

Onset-detektering hittar de exakta ögonblicken när toner, beats eller ljud börjar i en ljudsignal.

2 min readLäs
Audio AI

MelGAN Generativ Vocoder

MelGAN är en helt konvolutionell GAN-baserad vokoder som förvandlar mel-spektrogram till råa ljudvågformer i en enda snabbspolning framåt.

2 min readLäs
Audio AI

UnivNet Multi-Resolution Vocoder

UnivNet är en GAN-vokoder som bedömer genererat ljud med hjälp av flera spektrogram beräknade med olika STFT-upplösningar, vilket skärper högfrekventa detaljer.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.