Bibliotecă AI gratuită

Audio AI ghiduriLiber pentru totdeauna.

117 ghiduri în limba engleză simplă, căi de învățare structurate și o bibliotecă deschisă – construită de o organizație nonprofit independentă 501(c)(3), astfel încât oricine să poată înțelege IA modernă.

117Ghiduri gratuite
1Piese de subiecte
~2 minPe ghid
~4hTimp de lectură

Începeți de aici

Cinci cursuri bazate pe rezultate

Fiecare curs include rezultate explicite, competențe mapate, activități de practică și o piatră de bază aplicată.

Piese de subiecte

Răsfoiți după piesă

Sari în zona de care îți pasă. Fiecare piesă are mai multe ghiduri în limba engleză simplă.

Bibliotecă completă

Toate ghidurile

117 de 1019 ghiduri prezentate. Filtrați după piesă sau căutați mai sus.

Audio AI

DiffWave Diffusion Vocoder

DiffWave este un vocoder bazat pe difuzie care sintetizează sunetul prin eliminarea iterativă a zgomotului aleatoriu într-o formă de undă, condiționată de o spectrogramă mel.

2 min citireCitiți
Audio AI

Model audio generativ Bark

Bark este un model open-source text-to-audio de la Suno care generează nu doar vorbire, ci și râsete, suspine, muzică și efecte sonore direct din mesajele text.

2 min citireCitiți
Audio AI

Sinteză autoregresivă TTS țestoasă

Tortoise TTS este un sistem open-source de transformare a textului în vorbire apreciat pentru voci neobișnuit de naturale, bogate din punct de vedere emoțional și clonarea vocii puternice de la doar câteva scurte...

2 min citireCitiți
Audio AI

Clonarea vocii interlingvistice XTTS

XTTS este modelul text-to-speech multilingv al Coqui care poate clona o voce dintr-un scurt clip și apoi poate vorbi în multe limbi diferite, păstrând în același timp...

2 min citireCitiți
Audio AI

SoundStorm Parallel Audio Generation

SoundStorm este un model de generare audio Google care produce vorbire și sunet în paralel, mai degrabă decât un simbol la un moment dat, realizând sinteza audio de înaltă calitate...

2 min citireCitiți
Audio AI

Sinteza text-to-audio AudioGen

AudioGen este un model Meta care transformă descrierile textului în sunete ambientale realiste și efecte sonore, cum ar fi „câine care lătră în timp ce păsările ciripesc”.

2 min citireCitiți
Audio AI

Difuzie latentă audio stabilă

Stable Audio este sistemul text-to-audio al Stability AI care utilizează difuzia latentă pentru a genera muzică și efecte sonore, cu control explicit asupra lungimii clipului.

2 min citireCitiți
Audio AI

Setul de instrumente pentru recunoașterea vorbirii Kaldi

Kaldi este un set de instrumente gratuit, open-source, care a devenit platforma de cercetare dominantă pentru construirea sistemelor de recunoaștere a vorbirii.

2 min citireCitiți
Audio AI

Wav2Letter ASR convoluțional

Wav2Letter este un sistem end-to-end de recunoaștere a vorbirii de la Facebook AI care a folosit doar rețele neuronale convoluționale, fără recurență.

2 min citireCitiți
Audio AI

Jasper și QuartzNet ASR

Jasper și QuartzNet sunt modelele NVIDIA de recunoaștere a vorbirii convoluționale end-to-end, QuartzNet fiind o reproiectare dramatic mai mică și eficientă...

2 min citireCitiți
Audio AI

Modele de difuzie pentru audio

Modelele de difuzie generează sunet învățând să inverseze un proces de zgomot pas cu pas, transformând zgomotul aleatoriu în vorbire, muzică sau efecte sonore coerente.

2 min citireCitiți
Audio AI

Detectarea evenimentelor sonore

Detectarea evenimentelor sonore (SED) identifică ce sunete apar într-un flux audio și exact când pornesc și se opresc.

2 min citireCitiți

Ai terminat de citit? Demonstrează.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.