Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Mimi Streaming Audio Codec

Mimi är en neural ljudcodec som komprimerar tal till en liten ström av diskreta tokens i realtid, så att AI-modeller kan lyssna och tala med mycket låg...

2 min readLäs
Audio AI

Lyssna Delta och stava

Listen, Attend and Spell (LAS) är ett landmärke 2015 neuralt nätverk som transkriberar tal direkt till tecken, utan handbyggt uttal...

2 min readLäs
Audio AI

SpecAugment för taligenkänning

SpecAugment är en enkel men kraftfull dataförstärkningsmetod som maskerar och förvränger talspektrogrammet för att göra igenkänningsmodeller mer robusta.

2 min readLäs
Audio AI

Automatisk märkning av musik

Autotaggning av musik använder maskininlärning för att lyssna på en låt och automatiskt bifoga beskrivande etiketter som genre, humör, instrument och tempo.

2 min readLäs
Audio AI

Musikalisk Timbre Transfer

Timbreöverföring omformar ljudets "tonfärg" så att ett instrument låter som ett annat, förvandlar en nynnande melodi till en fiol eller en trumpetlinje...

2 min readLäs
Audio AI

Akustisk scenklassificering

Akustisk scenklassificering (ASC) tränar maskiner att känna igen miljön en inspelning gjordes i, en livlig gata, en lugn park, ett tåg, ett kafé...

2 min readLäs
Audio AI

NVIDIA Riva och NeMo Speech

NVIDIA Riva är en GPU-accelererad SDK för produktionstal AI (ASR, TTS och översättning), medan NeMo är öppen källkodsverktygssats för träning och finjustering...

2 min readLäs
Audio AI

DeepSpeech-arkitektur

DeepSpeech är en heltäckande taligenkänningsmodell som introducerades av Baidu 2014 som kartlägger råljudfunktioner direkt till text med hjälp av en återkommande neural...

2 min readLäs
Audio AI

X-Vector högtalarinbäddningar

X-vektorer är numeriska fingeravtryck med fast längd av en talares röst som produceras av ett neuralt nätverk, som används för att tala om vem som talar oavsett vad de säger.

2 min readLäs
Audio AI

Glow-TTS Monotonic Alignment

Glow-TTS är en text-till-tal-modell som lär sig justera text till tal på egen hand med hjälp av ett smart söktrick, vilket tar bort behovet av en separat aligner.

2 min readLäs
Audio AI

Parallell WaveGAN Vocoder

Parallel WaveGAN är en snabb neural vokoder som förvandlar ett mel-spektrogram till en rå ljudvågform med hjälp av en liten GAN, som genererar alla sampel på en gång.

2 min readLäs
Audio AI

WaveGlow Flow-Based Vocoder

WaveGlow är en flödesbaserad neural vokoder från NVIDIA som syntetiserar talvågformer från mel-spektrogram i ett enda pass utan autoregression.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.