Perpustakaan AI percuma

AI Audio panduanPercuma selamanya.

117 panduan bahasa Inggeris biasa, laluan pembelajaran berstruktur dan perpustakaan terbuka — dibina oleh 501(c)(3) bukan untung bebas supaya sesiapa sahaja boleh memahami AI moden.

117Panduan percuma
1Jejak topik
~2 minSetiap panduan
~4hMasa membaca

Mulakan di sini

Lima kursus berasaskan hasil

Setiap kursus merangkumi hasil yang jelas, kompetensi yang dipetakan, aktiviti latihan, dan capstone terapan.

Jejak topik

Semak imbas mengikut trek

Lompat ke kawasan yang anda minati. Setiap trek mempunyai berbilang panduan bahasa Inggeris biasa.

Perpustakaan penuh

Semua panduan

117 daripada 1019 panduan yang ditunjukkan. Tapis mengikut trek atau carian di atas.

AI Audio

Codec Audio Penstriman Mimi

Mimi ialah codec audio saraf yang memampatkan pertuturan menjadi aliran kecil token diskret dalam masa nyata, jadi model AI boleh mendengar dan bercakap dengan sangat rendah…

2 min bacaBaca
AI Audio

Dengar Hadir dan Eja

Dengar, Hadiri dan Eja (LAS) ialah rangkaian neural mercu tanda 2015 yang menyalin pertuturan terus ke dalam aksara, tanpa sebutan binaan tangan…

2 min bacaBaca
AI Audio

SpecAugment untuk Pengecaman Pertuturan

SpecAugment ialah kaedah pembesaran data yang mudah tetapi berkuasa yang menutup dan meledingkan spektrogram pertuturan untuk menjadikan model pengecaman lebih mantap.

2 min bacaBaca
AI Audio

Pengetegan Auto Muzik

Pengetegan auto muzik menggunakan pembelajaran mesin untuk mendengar lagu dan melampirkan label deskriptif secara automatik seperti genre, mood, instrumen dan tempo.

2 min bacaBaca
AI Audio

Pemindahan Timbre Muzikal

Pemindahan timbre membentuk semula 'warna ton' audio supaya satu instrumen berbunyi seperti yang lain, menukarkan melodi yang disenandungkan menjadi biola atau garisan trompet…

2 min bacaBaca
AI Audio

Klasifikasi Adegan Akustik

Klasifikasi adegan akustik (ASC) melatih mesin untuk mengenali persekitaran ketika rakaman dibuat, jalan yang sibuk, taman yang tenang, kereta api, kafe…

2 min bacaBaca
AI Audio

NVIDIA Riva dan Ucapan NeMo

NVIDIA Riva ialah SDK dipercepatkan GPU untuk AI pertuturan pengeluaran (ASR, TTS dan terjemahan), manakala NeMo ialah kit alat sumber terbuka untuk latihan dan penalaan halus…

2 min bacaBaca
AI Audio

Seni Bina DeepSpeech

DeepSpeech ialah model pengecaman pertuturan hujung ke hujung yang diperkenalkan oleh Baidu pada 2014 yang memetakan ciri audio mentah terus ke teks menggunakan saraf berulang…

2 min bacaBaca
AI Audio

Pembenaman Pembesar Suara X-Vector

X-vectors ialah cap jari berangka panjang tetap bagi suara pembesar suara yang dihasilkan oleh rangkaian saraf, digunakan untuk memberitahu siapa yang bercakap tanpa mengira apa yang mereka katakan.

2 min bacaBaca
AI Audio

Penjajaran Monotonic Glow-TTS

Glow-TTS ialah model teks ke pertuturan yang belajar menjajarkan teks ke pertuturan sendiri menggunakan helah carian yang bijak, menghilangkan keperluan untuk penjajar berasingan.

2 min bacaBaca
AI Audio

Vokoder Gelombang Selari

Parallel WaveGAN ialah vocoder neural pantas yang menukar spektrogram mel menjadi bentuk gelombang audio mentah menggunakan GAN kecil, menjana semua sampel sekaligus.

2 min bacaBaca
AI Audio

Vokoder Berasaskan Aliran WaveGlow

WaveGlow ialah vocoder saraf berasaskan aliran daripada NVIDIA yang mensintesis bentuk gelombang pertuturan daripada mel-spektrogram dalam satu laluan tanpa autoregresi.

2 min bacaBaca

Sudah habis membaca? Buktikan.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.