Bibliotecă AI gratuită

Audio AI ghiduriLiber pentru totdeauna.

117 ghiduri în limba engleză simplă, căi de învățare structurate și o bibliotecă deschisă – construită de o organizație nonprofit independentă 501(c)(3), astfel încât oricine să poată înțelege IA modernă.

117Ghiduri gratuite
1Piese de subiecte
~2 minPe ghid
~4hTimp de lectură

Începeți de aici

Cinci cursuri bazate pe rezultate

Fiecare curs include rezultate explicite, competențe mapate, activități de practică și o piatră de bază aplicată.

Piese de subiecte

Răsfoiți după piesă

Sari în zona de care îți pasă. Fiecare piesă are mai multe ghiduri în limba engleză simplă.

Bibliotecă completă

Toate ghidurile

117 de 1019 ghiduri prezentate. Filtrați după piesă sau căutați mai sus.

Audio AI

Beamforming și matrice de microfoane

Beamforming folosește mai multe microfoane pentru a asculta într-o direcție aleasă, amplificând sunetul de la o țintă în timp ce suprimă orice altceva.

2 min citireCitiți
Audio AI

Difuzarea spectrogramei de rifuzie

Riffusion este un hack inteligent care generează muzică tratând sunetul ca pe o imagine: ajustează modelul de imagine Stable Diffusion pentru a picta spectrograme, apoi...

2 min citireCitiți
Audio AI

MusicLM: Jetoane semantice și acustice ierarhice

Aflați cum Google MusicLM utilizează indicative semantice și acustice ierarhice, SoundStream și MuLan pentru a transforma solicitările de text în muzică coerentă.

2 min citireCitiți
Audio AI

Noise2Noise Îmbunătățirea vorbirii

Noise2Noise este un truc de antrenament care permite unui model să învețe să elimine zgomotul fără să vadă vreodată o referință curată, învățând din perechi de zgomot diferit...

2 min citireCitiți
Audio AI

Conv-TasNet Separare timp-domeniu

Conv-TasNet este o rețea neuronală care separă audio mixt (cum ar fi două persoane care vorbesc deodată) lucrând direct pe forma de undă brută a sunetului...

2 min citireCitiți
Audio AI

Separare RNN cu dublă cale

Dual-Path RNN (DPRNN) este o arhitectură de separare audio care împarte o secvență foarte lungă de caracteristici audio în bucăți scurte care se suprapun și le procesează...

2 min citireCitiți
Audio AI

Deschideți-unmix separarea muzicii

Open-Unmix (UMX) este un sistem de învățare profundă open-source care împarte o melodie în părțile sale: voce, tobe, bas și alte instrumente.

2 min citireCitiți
Audio AI

Alinierea cuvintelor marcate în șoaptă

Alinierea cuvântului în șoaptă fixează fiecare cuvânt transcris la o oră exactă de început și de sfârșit în audio.

2 min citireCitiți
Audio AI

Etichetarea muzicii cu Transformers

Etichetarea muzicii folosește modele transformatoare pentru a asculta o melodie și pentru a prezice etichete descriptive precum genul, starea de spirit, instrumentele și tempo-ul.

2 min citireCitiți
Audio AI

Detectarea debutului în audio

Detectarea debutului găsește momentele precise în care notele, bătăile sau sunetele încep într-un semnal audio.

2 min citireCitiți
Audio AI

MelGAN Vocoder generativ

MelGAN este un vocoder complet convoluțional bazat pe GAN, care transformă spectrogramele mel în forme de undă audio brute într-o singură trecere rapidă înainte.

2 min citireCitiți
Audio AI

Vocoder UnivNet multi-rezoluție

UnivNet este un vocoder GAN care judecă sunetul generat folosind mai multe spectrograme calculate la diferite rezoluții STFT, clarificând detaliile de înaltă frecvență.

2 min citireCitiți

Ai terminat de citit? Demonstrează.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.