Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Identifiering av coverlåt

Identifiering av coverlåtar upptäcker när två mycket olika ljudinspelningar faktiskt är samma underliggande låt - en liveakustisk version, en remix...

2 min readLäs
Audio AI

DDSP differentierbar ljudsyntes

DDSP (Differentiable Digital Signal Processing) förenar klassiska synthesizerbyggstenar med neurala nätverk, så att djupinlärning kan styra oscillatorer...

2 min readLäs
Audio AI

VITS End-to-end talsyntes

VITS är en text-till-tal-modell som omvandlar text direkt till råa ljudvågformer i ett enda tränat system, och hoppar över den vanliga tvåstegspipen.

2 min readLäs
Audio AI

FastSpeech och icke-autoregressiv TTS

FastSpeech genererar ett helt talspektrogram parallellt snarare än en bildruta åt gången, vilket gör syntesen dramatiskt snabbare och mer stabil.

2 min readLäs
Audio AI

NaturalSpeech och Latent Diffusion TTS

NaturalSpeech är en linje av Microsoft TTS-forskning som syftar till talkvalitet på mänsklig nivå, med senare versioner som använder latent diffusion för att generera rik, naturlig...

2 min readLäs
Audio AI

Tal Känsloigenkänning

Speech Emotion Recognition (SER) är AI som upptäcker en talares känslomässiga tillstånd – ilska, glädje, sorg, frustration – från ljudet av deras röst, inte bara...

2 min readLäs
Audio AI

Moshi Full-Duplex Tal

Moshi är en öppen källkod, realtidsröst-AI från Kyutai som pratar och lyssnar samtidigt – full-duplex – istället för att ta strikta svängar.

2 min readLäs
Audio AI

Tal-till-tal-översättning

Speech-to-Speech Translation (S2ST) tar talade ord på ett språk och producerar talade ord på ett annat — idealiskt bevara talarens röst, ton...

2 min readLäs
Audio AI

HiFi-GAN och GAN Vocoders

HiFi-GAN är en generativ-motstridig vokoder som förvandlar ett mel-spektrogram till en rå ljudvågform nästan omedelbart och producerar tal i studiokvalitet långt...

2 min readLäs
Audio AI

Konvertering av grafem till fonem

Grafe-till-fonem-konvertering (G2P) översätter skrivna bokstäver till de ljud som ett talsystem faktiskt borde uttala.

2 min readLäs
Audio AI

Textnormalisering för tal

Textnormalisering är det första steget som skriver om rå skriven text till helt uttalade ord innan ett talsystem säger det.

2 min readLäs
Audio AI

SoundStream Neural Codec

SoundStream är Googles end-to-end neurala ljudcodec som komprimerar tal och musik till extremt låga bithastigheter samtidigt som kvaliteten bevaras.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.