Gratis AI-bibliotheek

Audio-AI gidsenVoor altijd gratis.

117 duidelijke Engelse handleidingen, gestructureerde leertrajecten en een open bibliotheek – gebouwd door een onafhankelijke 501(c)(3) non-profitorganisatie, zodat iedereen de moderne AI kan begrijpen.

117Gratis gidsen
1Onderwerptracks
~2 minPer gids
~4hReading time

Begin hier

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Onderwerptracks

Blader op nummer

Spring naar het gebied waar u om geeft. Elke track heeft meerdere duidelijke Engelse gidsen.

Volledige bibliotheek

Alle gidsen

117 van 1019 gidsen getoond. Filter op nummer of zoek hierboven.

Audio-AI

Mimi Streaming Audiocodec

Mimi is een neurale audiocodec die spraak in realtime comprimeert tot een kleine stroom discrete tokens, zodat AI-modellen kunnen luisteren en spreken met zeer lage...

2 min gelezenLees
Audio-AI

Luister, bezoek en spel

Listen, Attend and Spell (LAS) is een historisch neuraal netwerk uit 2015 dat spraak rechtstreeks in karakters transcribeert, zonder met de hand gebouwde uitspraak...

2 min gelezenLees
Audio-AI

SpecAugment voor spraakherkenning

SpecAugment is een eenvoudige maar krachtige methode voor gegevensvergroting die het spectrogram van spraak maskeert en vervormt om herkenningsmodellen robuuster te maken.

2 min gelezenLees
Audio-AI

Autotagging van muziek

Autotagging voor muziek maakt gebruik van machinaal leren om naar een nummer te luisteren en voegt automatisch beschrijvende labels toe, zoals genre, stemming, instrumenten en tempo.

2 min gelezenLees
Audio-AI

Muzikale klankkleuroverdracht

Timbre-overdracht hervormt de 'klankkleur' ​​van audio, zodat het ene instrument klinkt als het andere, waardoor een neuriënde melodie verandert in een viool of een trompetlijn...

2 min gelezenLees
Audio-AI

Classificatie van akoestische scènes

Akoestische scèneclassificatie (ASC) traint machines om de omgeving waarin de opname is gemaakt te herkennen: een drukke straat, een rustig park, een trein, een café…

2 min gelezenLees
Audio-AI

NVIDIA Riva en NeMo-spraak

NVIDIA Riva is een GPU-versnelde SDK voor productie-spraak-AI (ASR, TTS en vertaling), terwijl NeMo de open-source toolkit is voor training en afstemming...

2 min gelezenLees
Audio-AI

DeepSpeech-architectuur

DeepSpeech is een end-to-end spraakherkenningsmodel geïntroduceerd door Baidu in 2014 dat onbewerkte audiofuncties rechtstreeks aan tekst toewijst met behulp van een terugkerende neurale...

2 min gelezenLees
Audio-AI

X-Vector luidsprekerinsluitingen

X-vectoren zijn numerieke vingerafdrukken met een vaste lengte van de stem van een spreker, geproduceerd door een neuraal netwerk, en worden gebruikt om te bepalen wie er spreekt, ongeacht wat ze zeggen.

2 min gelezenLees
Audio-AI

Glow-TTS monotone uitlijning

Glow-TTS is een tekst-naar-spraak-model dat zelf leert tekst naar spraak uit te lijnen met behulp van een slimme zoektruc, waardoor er geen aparte aligner nodig is.

2 min gelezenLees
Audio-AI

Parallelle WaveGAN-vocoder

Parallel WaveGAN is een snelle neurale vocoder die een mel-spectrogram omzet in een ruwe audiogolfvorm met behulp van een kleine GAN, waardoor alle samples in één keer worden gegenereerd.

2 min gelezenLees
Audio-AI

WaveGlow Flow-gebaseerde vocoder

WaveGlow is een op flow gebaseerde neurale vocoder van NVIDIA die spraakgolfvormen van mel-spectrogrammen in één keer synthetiseert zonder autoregressie.

2 min gelezenLees

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.