Perpustakaan AI percuma

AI Audio panduanPercuma selamanya.

117 panduan bahasa Inggeris biasa, laluan pembelajaran berstruktur dan perpustakaan terbuka — dibina oleh 501(c)(3) bukan untung bebas supaya sesiapa sahaja boleh memahami AI moden.

117Panduan percuma
1Jejak topik
~2 minSetiap panduan
~4hMasa membaca

Mulakan di sini

Lima kursus berasaskan hasil

Setiap kursus merangkumi hasil yang jelas, kompetensi yang dipetakan, aktiviti latihan, dan capstone terapan.

Jejak topik

Semak imbas mengikut trek

Lompat ke kawasan yang anda minati. Setiap trek mempunyai berbilang panduan bahasa Inggeris biasa.

Perpustakaan penuh

Semua panduan

117 daripada 1019 panduan yang ditunjukkan. Tapis mengikut trek atau carian di atas.

AI Audio

Vokoder Penyebaran DiffWave

DiffWave ialah vokoder berasaskan resapan yang mensintesis audio dengan mengulangi bunyi rawak menjadi bentuk gelombang, dikondisikan pada mel-spektrogram.

2 min bacaBaca
AI Audio

Model Audio Generatif Bark

Bark ialah model teks-ke-audio sumber terbuka daripada Suno yang menjana bukan sahaja pertuturan tetapi ketawa, esakan, muzik dan kesan bunyi terus daripada gesaan teks.

2 min bacaBaca
AI Audio

Sintesis Autoregresif Kura-kura TTS

Tortoise TTS ialah sistem teks-ke-ucapan sumber terbuka yang dihargai untuk suara yang luar biasa semula jadi, kaya dengan emosi dan pengklonan suara yang kuat dari beberapa…

2 min bacaBaca
AI Audio

Pengklonan Suara Merentas Bahasa XTTS

XTTS ialah model teks ke pertuturan berbilang bahasa Coqui yang boleh mengklon suara daripada klip pendek dan kemudian bercakap dalam pelbagai bahasa sambil mengekalkan…

2 min bacaBaca
AI Audio

Penjanaan Audio Selari SoundStorm

SoundStorm ialah model penjanaan audio Google yang menghasilkan pertuturan dan bunyi secara selari dan bukannya satu token pada satu masa, menjadikan sintesis audio berkualiti tinggi…

2 min bacaBaca
AI Audio

Sintesis Teks-ke-Audio AudioGen

AudioGen ialah model Meta yang menukar perihalan teks kepada bunyi persekitaran yang realistik dan kesan bunyi, seperti 'anjing menyalak sambil burung berkicauan.

2 min bacaBaca
AI Audio

Resapan Terpendam Audio Stabil

Audio Stable ialah sistem teks-ke-audio Stability AI yang menggunakan resapan terpendam untuk menjana muzik dan kesan bunyi, dengan kawalan eksplisit ke atas panjang klip.

2 min bacaBaca
AI Audio

Kit Alat Pengecaman Pertuturan Kaldi

Kaldi ialah kit alat sumber terbuka percuma yang menjadi platform penyelidikan dominan untuk membina sistem pengecaman pertuturan.

2 min bacaBaca
AI Audio

Wav2Letter Convolutional ASR

Wav2Letter ialah sistem pengecaman pertuturan hujung ke hujung daripada Facebook AI yang hanya menggunakan rangkaian saraf konvolusi, tiada pengulangan.

2 min bacaBaca
AI Audio

Jasper dan QuartzNet ASR

Jasper dan QuartzNet ialah model pengecaman pertuturan konvolusi hujung ke hujung NVIDIA, dengan QuartzNet menjadi reka bentuk semula yang lebih kecil dan cekap secara dramatik…

2 min bacaBaca
AI Audio

Model Penyebaran untuk Audio

Model resapan menjana audio dengan belajar membalikkan proses hingar langkah demi langkah, menukar hingar rawak kepada pertuturan, muzik atau kesan bunyi yang koheren.

2 min bacaBaca
AI Audio

Pengesanan Peristiwa Bunyi

Pengesanan peristiwa bunyi (SED) mengenal pasti bunyi yang berlaku dalam strim audio dan tepat apabila ia bermula dan berhenti.

2 min bacaBaca

Sudah habis membaca? Buktikan.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.