Безплатна AI библиотека

Аудио AI водачиСвободен завинаги.

117 ръководства на обикновен английски език, структурирани пътеки за обучение и отворена библиотека — създадена от независима 501(c)(3) организация с нестопанска цел, така че всеки да може да разбере модерния AI.

117Безплатни ръководства
1Тематични песни
~2 minПо ръководство
~4hReading time

Започнете тук

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Тематични песни

Преглед по песен

Скочете в района, който ви интересува. Всяка песен има множество ръководства на обикновен английски.

Пълна библиотека

Всички ръководства

117 на 1019 показани ръководства. Филтрирайте по песен или потърсете по-горе.

Аудио AI

Дифузионен вокодер DiffWave

DiffWave е базиран на дифузия вокодер, който синтезира аудио чрез итеративно обезшумяване на случаен шум във форма на вълната, обусловена от мел-спектрограма.

2 мин. прочетеноПрочетете
Аудио AI

Bark Generative Audio Model

Bark е модел с отворен код за текст към аудио от Suno, който генерира не само реч, но и смях, въздишки, музика и звукови ефекти директно от текстови подкани.

2 мин. прочетеноПрочетете
Аудио AI

Авторегресивен синтез на TTS на костенурка

Tortoise TTS е система за преобразуване на текст в говор с отворен код, ценена за необичайно естествени, емоционално богати гласове и силно клониране на глас само от няколко кратки...

2 мин. прочетеноПрочетете
Аудио AI

XTTS междуезично гласово клониране

XTTS е многоезичният модел за преобразуване на текст в говор на Coqui, който може да клонира глас от кратък клип и след това да говори на много различни езици, като запазва...

2 мин. прочетеноПрочетете
Аудио AI

SoundStorm паралелно аудио генериране

SoundStorm е Google модел за генериране на аудио, който произвежда реч и звук паралелно, а не един токен наведнъж, правейки висококачествен аудио синтез...

2 мин. прочетеноПрочетете
Аудио AI

AudioGen синтез на текст към аудио

AudioGen е Meta модел, който превръща текстовите описания в реалистични звуци от околната среда и звукови ефекти, като „кучешки лай, докато птици чуруликат“.

2 мин. прочетеноПрочетете
Аудио AI

Стабилна аудио латентна дифузия

Stable Audio е текст-към-аудио система на Stability AI, която използва латентна дифузия за генериране на музика и звукови ефекти, с явен контрол върху дължината на клипа.

2 мин. прочетеноПрочетете
Аудио AI

Инструментариум за разпознаване на реч Kaldi

Kaldi е безплатен инструментариум с отворен код, който се превърна в доминираща изследователска платформа за изграждане на системи за разпознаване на реч.

2 мин. прочетеноПрочетете
Аудио AI

Wav2Letter Convolutional ASR

Wav2Letter е система за разпознаване на реч от край до край от Facebook AI, която използва само конволюционни невронни мрежи, без повторение.

2 мин. прочетеноПрочетете
Аудио AI

Jasper и QuartzNet ASR

Jasper и QuartzNet са моделите от край до край на NVIDIA за конволюционно разпознаване на реч, като QuartzNet е драматично по-малък, ефективен редизайн...

2 мин. прочетеноПрочетете
Аудио AI

Дифузионни модели за аудио

Дифузионните модели генерират аудио, като се научават да обръщат процес на шум стъпка по стъпка, превръщайки случаен шум в кохерентна реч, музика или звукови ефекти.

2 мин. прочетеноПрочетете
Аудио AI

Откриване на звукови събития

Откриването на звукови събития (SED) идентифицира какви звуци се появяват в аудио поток и точно кога започват и спират.

2 мин. прочетеноПрочетете

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.