Bibliotecă AI gratuită

Audio AI ghiduriLiber pentru totdeauna.

117 ghiduri în limba engleză simplă, căi de învățare structurate și o bibliotecă deschisă – construită de o organizație nonprofit independentă 501(c)(3), astfel încât oricine să poată înțelege IA modernă.

117Ghiduri gratuite
1Piese de subiecte
~2 minPe ghid
~4hTimp de lectură

Începeți de aici

Cinci cursuri bazate pe rezultate

Fiecare curs include rezultate explicite, competențe mapate, activități de practică și o piatră de bază aplicată.

Piese de subiecte

Răsfoiți după piesă

Sari în zona de care îți pasă. Fiecare piesă are mai multe ghiduri în limba engleză simplă.

Bibliotecă completă

Toate ghidurile

117 de 1019 ghiduri prezentate. Filtrați după piesă sau căutați mai sus.

Audio AI

Mimi Streaming Audio Codec

Mimi este un codec audio neuronal care comprimă vorbirea într-un flux mic de jetoane discrete în timp real, astfel încât modelele AI să poată asculta și vorbi cu un nivel foarte scăzut...

2 min citireCitiți
Audio AI

Ascultă, participă și vrăjește

Listen, Attend and Spell (LAS) este o rețea neuronală emblematică din 2015 care transcrie vorbirea direct în caractere, fără o pronunție construită manual...

2 min citireCitiți
Audio AI

SpecAugment pentru recunoașterea vorbirii

SpecAugment este o metodă simplă, dar puternică de mărire a datelor, care maschează și deformează spectrograma vorbirii pentru a face modelele de recunoaștere mai robuste.

2 min citireCitiți
Audio AI

Etichetarea automată a muzicii

Etichetarea automată a muzicii folosește învățarea automată pentru a asculta o melodie și pentru a atașa automat etichete descriptive precum genul, starea de spirit, instrumentele și tempo.

2 min citireCitiți
Audio AI

Transfer de timbru muzical

Transferul de timbru remodelează „culoarea tonului” audio, astfel încât un instrument să sune ca altul, transformând o melodie fredonată într-o vioară sau o linie de trompetă...

2 min citireCitiți
Audio AI

Clasificarea scenei acustice

Clasificarea scenei acustice (ASC) antrenează mașinile pentru a recunoaște mediul în care a fost făcută o înregistrare, o stradă aglomerată, un parc liniștit, un tren, o cafenea...

2 min citireCitiți
Audio AI

NVIDIA Riva și NeMo Speech

NVIDIA Riva este un SDK accelerat de GPU pentru AI de vorbire de producție (ASR, TTS și traducere), în timp ce NeMo este setul de instrumente open-source pentru instruire și reglare fină...

2 min citireCitiți
Audio AI

Arhitectura DeepSpeech

DeepSpeech este un model de recunoaștere a vorbirii de la capăt la capăt, introdus de Baidu în 2014, care mapează caracteristicile audio brute direct pe text utilizând un neuronal recurent...

2 min citireCitiți
Audio AI

Încorporarea difuzoarelor X-Vector

Vectorii X sunt amprente numerice cu lungime fixă ale vocii unui vorbitor, produse de o rețea neuronală, folosite pentru a spune cine vorbește, indiferent de ceea ce spune.

2 min citireCitiți
Audio AI

Alinierea monotonă Glow-TTS

Glow-TTS este un model text-to-speech care învață să alinieze textul la vorbire singur folosind un truc inteligent de căutare, eliminând nevoia unui alinier separat.

2 min citireCitiți
Audio AI

Vocoder paralel WaveGAN

Parallel WaveGAN este un vocoder neuronal rapid care transformă o spectrogramă mel într-o formă de undă audio brută folosind un GAN mic, generând toate mostrele simultan.

2 min citireCitiți
Audio AI

Vocoder WaveGlow bazat pe flux

WaveGlow este un vocoder neuronal bazat pe flux de la NVIDIA care sintetizează forme de undă de vorbire din spectrograme mel într-o singură trecere fără autoregresie.

2 min citireCitiți

Ai terminat de citit? Demonstrează.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 4 of 10 | AI Understanding