Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Ljudtextning

Ljudtextning genererar en mening på naturligt språk som beskriver innehållet i ett ljudklipp, till exempel "ett tåghorn ljuder när det passerar en plankorsning.

2 min readLäs
Audio AI

Whisper Speech Recognition

Whisper är OpenAIs automatiska taligenkänningssystem med öppen källkod som förvandlar ljud till text på över 90 språk.

2 min readLäs
Audio AI

Wav2Vec 2.0

Wav2Vec 2.0 är Meta AI:s självövervakade talmodell som lär sig kraftfulla ljudrepresentationer från råa, omärkta inspelningar.

2 min readLäs
Audio AI

HuBERT självövervakat tal

HuBERT (Hidden-Unit BERT) är Meta AI:s självövervakade talmodell som lär sig genom att förutsäga klustrade ljudenheter för maskerade segment, i BERT-stil.

2 min readLäs
Audio AI

Neurala vokoder

En neural vocoder är en modell som förvandlar en kompakt akustisk representation, vanligtvis ett mel-spektrogram, till en verklig hörbar vågform.

2 min readLäs
Audio AI

Neural Audio Codecs

Neurala ljudkodekar använder djupinlärning för att komprimera ljud till små strömmar av diskreta tokens och rekonstruera det med hög trohet.

2 min readLäs
Audio AI

VAL-E och Codec språkmodeller

VALL-E omarbetade text-till-tal som ett språkmodelleringsproblem över ljudcodec-tokens, vilket möjliggör röstkloning från bara tre sekunder av ett sampel.

2 min readLäs
Audio AI

OpenAI Viska

Whisper är OpenAIs automatiska taligenkänningssystem med öppen källkod som transkriberar och översätter talat ljud över dussintals språk.

2 min readLäs
Audio AI

Automatisk musiktranskription

Automatic Music Transcription (AMT) konverterar en rå ljudinspelning av musik till en symbolisk notation som noter, MIDI eller en pianorulle.

2 min readLäs
Audio AI

Beat- och tempospårning

Takt- och tempospårning är uppgiften att hitta den stadiga pulsen i musik: var varje slag faller och hur snabbt låten rör sig i slag per minut (BPM).

2 min readLäs
Audio AI

Ljudfingeravtryck

Ljudfingeravtryck skapar en kompakt, brustålig digital signatur av ett ljud så att det kan kännas igen senare, även genom bakgrundsljud...

2 min readLäs
Audio AI

Jukebox

Jukebox är OpenAIs neurala nätverk från 2020 som genererar rå musikljud – komplett med sångröster, instrument och till och med texter i stil med specifika...

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.