Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Start her

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Mimi Streaming Audio Codec

Mimi er en nevral lydkodek som komprimerer tale til en liten strøm av diskrete tokens i sanntid, slik at AI-modeller kan lytte og snakke med svært lav...

2 min readLes
Audio AI

Lytt Delta og stave

Listen, Attend and Spell (LAS) er et landemerke fra 2015 nevralt nettverk som transkriberer tale direkte til tegn, uten håndbygd uttale...

2 min readLes
Audio AI

SpecAugment for talegjenkjenning

SpecAugment er en enkel, men kraftig dataforsterkningsmetode som maskerer og forvrider talespektrogrammet for å gjøre gjenkjenningsmodeller mer robuste.

2 min readLes
Audio AI

Automatisk merking av musikk

Automatisk merking av musikk bruker maskinlæring for å lytte til en sang og automatisk legge ved beskrivende etiketter som sjanger, stemning, instrumenter og tempo.

2 min readLes
Audio AI

Musikalsk Timbre Transfer

Timbreoverføring omformer "tonefargen" til lyd slik at ett instrument høres ut som et annet, og gjør en nynnet melodi til en fiolin eller en trompetlinje...

2 min readLes
Audio AI

Klassifisering av akustisk scene

Akustisk sceneklassifisering (ASC) trener maskiner til å gjenkjenne miljøet et opptak ble gjort i, en travel gate, en stille park, et tog, en kafé...

2 min readLes
Audio AI

NVIDIA Riva og NeMo Speech

NVIDIA Riva er en GPU-akselerert SDK for produksjonstale AI (ASR, TTS og oversettelse), mens NeMo er åpen kildekode-verktøysettet for trening og finjustering...

2 min readLes
Audio AI

DeepSpeech-arkitektur

DeepSpeech er en ende-til-ende-talegjenkjenningsmodell introdusert av Baidu i 2014 som kartlegger rå lydfunksjoner direkte til tekst ved hjelp av en tilbakevendende nevra...

2 min readLes
Audio AI

X-Vector høyttalerinnbygging

X-vektorer er numeriske fingeravtrykk med fast lengde av en høyttalers stemme produsert av et nevralt nettverk, som brukes til å fortelle hvem som snakker uavhengig av hva de sier.

2 min readLes
Audio AI

Glow-TTS monotonisk justering

Glow-TTS er en tekst-til-tale-modell som lærer å justere tekst til tale på egen hånd ved hjelp av et smart søketriks, som fjerner behovet for en separat aligner.

2 min readLes
Audio AI

Parallell WaveGAN Vocoder

Parallel WaveGAN er en rask nevral vokoder som gjør et mel-spektrogram til en rå lydbølgeform ved hjelp av en liten GAN, som genererer alle samples på en gang.

2 min readLes
Audio AI

WaveGlow Flow-basert Vocoder

WaveGlow er en flytbasert nevral vokoder fra NVIDIA som syntetiserer talebølgeformer fra mel-spektrogrammer i en enkelt pass uten autoregresjon.

2 min readLes

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.