Perpustakaan AI percuma

AI Audio panduanPercuma selamanya.

117 panduan bahasa Inggeris biasa, laluan pembelajaran berstruktur dan perpustakaan terbuka — dibina oleh 501(c)(3) bukan untung bebas supaya sesiapa sahaja boleh memahami AI moden.

117Panduan percuma
1Jejak topik
~2 minSetiap panduan
~4hMasa membaca

Mulakan di sini

Lima kursus berasaskan hasil

Setiap kursus merangkumi hasil yang jelas, kompetensi yang dipetakan, aktiviti latihan, dan capstone terapan.

Jejak topik

Semak imbas mengikut trek

Lompat ke kawasan yang anda minati. Setiap trek mempunyai berbilang panduan bahasa Inggeris biasa.

Perpustakaan penuh

Semua panduan

117 daripada 1019 panduan yang ditunjukkan. Tapis mengikut trek atau carian di atas.

AI Audio

Pengenalan Lagu Muka Depan

Pengenalan lagu muka depan mengesan apabila dua rakaman bunyi yang sangat berbeza sebenarnya adalah lagu asas yang sama — versi akustik langsung, campuran semula…

2 min bacaBaca
AI Audio

Sintesis Audio Boleh Dibezakan DDSP

DDSP (Pemprosesan Isyarat Digital Boleh Dibezakan) menggabungkan blok binaan pensintesis klasik dengan rangkaian saraf, supaya pembelajaran mendalam boleh mengawal pengayun…

2 min bacaBaca
AI Audio

VITS Sintesis Pertuturan Hujung ke Hujung

VITS ialah model teks ke pertuturan yang menukar teks terus kepada bentuk gelombang audio mentah dalam satu sistem terlatih, melangkau saluran paip dua peringkat biasa.

2 min bacaBaca
AI Audio

FastSpeech dan TTS Bukan Autoregresif

FastSpeech menjana keseluruhan spektrogram pertuturan secara selari dan bukannya satu bingkai pada satu masa, menjadikan sintesis secara dramatik lebih pantas dan lebih stabil.

2 min bacaBaca
AI Audio

Pertuturan Semulajadi dan TTS Resapan Terpendam

NaturalSpeech ialah barisan penyelidikan TTS Microsoft yang menyasarkan kualiti pertuturan peringkat manusia, dengan versi yang lebih baru menggunakan penyebaran terpendam untuk menjana kaya, semula jadi…

2 min bacaBaca
AI Audio

Pengiktirafan Emosi Pertuturan

Speech Emotion Recognition (SER) ialah AI yang mengesan keadaan emosi penceramah — kemarahan, kegembiraan, kesedihan, kekecewaan — daripada bunyi suara mereka, bukan hanya…

2 min bacaBaca
AI Audio

Pertuturan Dupleks Penuh Moshi

Moshi ialah AI suara masa nyata sumber terbuka daripada Kyutai yang bercakap dan mendengar pada masa yang sama — dupleks penuh — dan bukannya mengambil giliran yang ketat.

2 min bacaBaca
AI Audio

Terjemahan Ucapan-ke-Ucapan

Terjemahan Pertuturan ke Pertuturan (S2ST) mengambil perkataan yang dituturkan dalam satu bahasa dan menghasilkan perkataan yang dituturkan dalam bahasa yang lain — idealnya mengekalkan suara, nada…

2 min bacaBaca
AI Audio

Vokoder HiFi-GAN dan GAN

HiFi-GAN ialah vokoder permusuhan generatif yang menukar spektrogram mel menjadi bentuk gelombang audio mentah hampir serta-merta, menghasilkan pertuturan berkualiti studio jauh…

2 min bacaBaca
AI Audio

Penukaran Grapheme-to-Fonem

Penukaran grafem-ke-fonem (G2P) menterjemah huruf bertulis kepada bunyi yang sepatutnya disebut oleh sistem pertuturan.

2 min bacaBaca
AI Audio

Normalisasi Teks untuk Pertuturan

Normalisasi teks ialah langkah hadapan yang menulis semula teks bertulis mentah menjadi perkataan yang dituturkan sepenuhnya sebelum sistem pertuturan menyebutnya.

2 min bacaBaca
AI Audio

Codec Neural SoundStream

SoundStream ialah codec audio saraf hujung ke hujung Google yang memampatkan pertuturan dan muzik kepada kadar bit yang sangat rendah sambil mengekalkan kualiti.

2 min bacaBaca

Sudah habis membaca? Buktikan.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.