Free AI library

Audio AI guiderFree forever.

117 plain-English guides, structured learning paths, and an open library — built by an independent 501(c)(3) nonprofit so anyone can understand modern AI.

117Gratis guider
1Topic tracks
~2 minPer guide
~4hReading time

Börja här

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Topic tracks

Browse by track

Jump into the area you care about. Every track has multiple plain-English guides.

Full library

All guides

117 av 1019 guides shown. Filter by track or search above.

Audio AI

Spleeter stamseparation

Spleeter är ett open source-verktyg från Deezer som delar upp en färdig låt i separata spår (sång, trummor, bas och mer) med hjälp av djupinlärning.

2 min readLäs
Audio AI

CREPE Pitch uppskattning

CREPE är en djupinlärningsmodell som uppskattar grundfrekvensen (pitch) för en monofonisk ljudsignal direkt från dess råa vågform.

2 min readLäs
Audio AI

PESQ och STOI talkvalitetsmått

PESQ och STOI är objektiva standardmått som visar hur bra bearbetat tal låter och hur begripligt det är, utan att behöva mänskliga lyssnare.

2 min readLäs
Audio AI

Källfilter Vocoding och WORLD

En vocoder är ett verktyg som tar isär talet i sina byggstenar och bygger om det.

2 min readLäs
Audio AI

Genomsnittlig åsiktsutvärdering

Mean Opinion Score (MOS) är ett genomsnittligt betyg från 1 till 5 från mänskliga lyssnare som mäter hur bra syntetiserat eller överfört ljud låter.

2 min readLäs
Audio AI

Constant-Q Transform för ljud

Constant-Q Transform (CQT) är en frekvensanalys som använder logaritmiskt fördelade fack som matchas till musikalisk tonhöjd, istället för jämnt fördelade fack...

2 min readLäs
Audio AI

Filterbank och PLP-funktioner

Filterbank och PLP-funktioner (Perceptual Linear Prediction) är sätt att sammanfatta en talsignal till kompakta, perceptuellt meningsfulla tal som maskin...

2 min readLäs
Audio AI

StyleTTS 2 Style Diffusion

StyleTTS 2 är en text-till-tal-modell som behandlar röstens "stil" - prosodi, känsla och högtalares klang - som en slumpmässig variabel samplade med en diffusionsmodell...

2 min readLäs
Audio AI

FastPitch Pitch-kontrollerbar TTS

FastPitch är en snabb, icke-autoregressiv text-till-tal-modell som explicit förutsäger tonhöjden (grundfrekvensen) för varje inmatningstoken, vilket låter dig...

2 min readLäs
Audio AI

Voicebox Flow-Matching Speech Generation

Voicebox är Metas textstyrda talgenereringsmodell tränad med ett flödesmatchande mål att "fylla i" maskerat ljud, så att en modell kan göra noll-shot-röst...

2 min readLäs
Audio AI

Utmaning för djup brusdämpning

The Deep Noise Suppression (DNS) Challenge är en Microsoft-körd tävling som driver forskare att bygga neurala nätverk som tar bort bakgrundsljud...

2 min readLäs
Audio AI

Spektralsubtraktion och wienerfiltrering

Spektral subtraktion och Wiener-filtrering är de klassiska arbetshästarna för djupinlärning av brusreducering.

2 min readLäs

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 5 of 10 | AI Understanding