Bibliotecă AI gratuită

Audio AI ghiduriLiber pentru totdeauna.

117 ghiduri în limba engleză simplă, căi de învățare structurate și o bibliotecă deschisă – construită de o organizație nonprofit independentă 501(c)(3), astfel încât oricine să poată înțelege IA modernă.

117Ghiduri gratuite
1Piese de subiecte
~2 minPe ghid
~4hTimp de lectură

Începeți de aici

Cinci cursuri bazate pe rezultate

Fiecare curs include rezultate explicite, competențe mapate, activități de practică și o piatră de bază aplicată.

Piese de subiecte

Răsfoiți după piesă

Sari în zona de care îți pasă. Fiecare piesă are mai multe ghiduri în limba engleză simplă.

Bibliotecă completă

Toate ghidurile

117 de 1019 ghiduri prezentate. Filtrați după piesă sau căutați mai sus.

Audio AI

Separarea tulpinii spleeterului

Spleeter este un instrument open-source de la Deezer care împarte o melodie terminată în piese separate (voce, tobe, bas și multe altele) folosind deep learning.

2 min citireCitiți
Audio AI

Estimarea pasului CREPE

CREPE este un model de învățare profundă care estimează frecvența fundamentală (pitch) a unui semnal audio monofonic direct din forma sa brută de undă.

2 min citireCitiți
Audio AI

PESQ și STOI Speech Quality Metrics

PESQ și STOI sunt metrici obiective standard care evaluează cât de bine sună vorbirea procesată și cât de ușor de înțeles este, fără a avea nevoie de ascultători umani.

2 min citireCitiți
Audio AI

Sursă-filtru Vocoding și WORLD

Un vocoder este un instrument care descompune vorbirea în blocurile sale de construcție și o reconstruiește.

2 min citireCitiți
Audio AI

Evaluarea scorului mediu de opinie

Scorul mediu de opinie (MOS) este o evaluare medie de la 1 la 5 din partea ascultătorilor umani care măsoară cât de bine sunt sunetele sintetizate sau transmise.

2 min citireCitiți
Audio AI

Transformare Q constantă pentru audio

Transformarea Constant-Q (CQT) este o analiză de frecvență care utilizează compartimente distanțate logaritmic, potrivite cu înălțimea muzicală, în loc de compartimentele uniform distanțate...

2 min citireCitiți
Audio AI

Funcții Filterbank și PLP

Funcțiile Filterbank și Perceptual Linear Prediction (PLP) sunt modalități de a rezuma un semnal de vorbire în numere compacte, perceptive semnificative pe care le mașină...

2 min citireCitiți
Audio AI

StyleTTS 2 Style Diffusion

StyleTTS 2 este un model text-to-speech care tratează „stilul” vocii – prozodie, emoție și timbrul vorbitorului – ca pe o variabilă aleatorie eșantionată cu un model de difuzie...

2 min citireCitiți
Audio AI

FastPitch Pitch-TTS controlabil

FastPitch este un model rapid, non-autoregresiv, care prezice în mod explicit înălțimea (frecvența fundamentală) a fiecărui simbol de intrare, permițându-vă...

2 min citireCitiți
Audio AI

Voicebox Flow-Matching Speech Generation

Voicebox este modelul de generare a vorbirii ghidat de text de la Meta, antrenat cu un obiectiv de potrivire a fluxului pentru a „completa” audio mascat, permițând unui model să facă voce zero...

2 min citireCitiți
Audio AI

Provocare pentru suprimarea zgomotului profund

Provocarea Deep Noise Suppression (DNS) este o competiție organizată de Microsoft, care împinge cercetătorii să construiască rețele neuronale care să elimine zgomotul de fundal...

2 min citireCitiți
Audio AI

Scăderea spectrală și filtrarea Wiener

Scăderea spectrală și filtrarea Wiener sunt calitățile clasice de reducere a zgomotului, pre-învățare profundă.

2 min citireCitiți

Ai terminat de citit? Demonstrează.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.