Безплатна AI библиотека

Аудио AI водачиСвободен завинаги.

117 ръководства на обикновен английски език, структурирани пътеки за обучение и отворена библиотека — създадена от независима 501(c)(3) организация с нестопанска цел, така че всеки да може да разбере модерния AI.

117Безплатни ръководства
1Тематични песни
~2 minПо ръководство
~4hReading time

Започнете тук

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Тематични песни

Преглед по песен

Скочете в района, който ви интересува. Всяка песен има множество ръководства на обикновен английски.

Пълна библиотека

Всички ръководства

117 на 1019 показани ръководства. Филтрирайте по песен или потърсете по-горе.

Аудио AI

Mimi Streaming Audio Codec

Mimi е невронен аудио кодек, който компресира речта в малък поток от дискретни токени в реално време, така че AI моделите да могат да слушат и говорят с много ниска...

2 мин. прочетеноПрочетете
Аудио AI

Слушайте, посещавайте и сричайте

Listen, Attend and Spell (LAS) е забележителна невронна мрежа от 2015 г., която транскрибира реч директно в знаци, без ръчно изградено произношение...

2 мин. прочетеноПрочетете
Аудио AI

SpecAugment за разпознаване на реч

SpecAugment е прост, но мощен метод за увеличаване на данните, който маскира и деформира спектрограмата на речта, за да направи моделите за разпознаване по-стабилни.

2 мин. прочетеноПрочетете
Аудио AI

Автоматично маркиране на музика

Автоматичното маркиране на музика използва машинно обучение, за да слуша песен и автоматично да прикрепя описателни етикети като жанр, настроение, инструменти и темпо.

2 мин. прочетеноПрочетете
Аудио AI

Трансфер на музикален тембър

Трансферът на тембър променя „цвета на тона“ на аудиото, така че един инструмент да звучи като друг, превръщайки тананикаща мелодия в линия на цигулка или тромпет…

2 мин. прочетеноПрочетете
Аудио AI

Класификация на акустичните сцени

Класификацията на акустичната сцена (ASC) обучава машините да разпознават средата, в която е направен записът, оживена улица, тих парк, влак, кафене…

2 мин. прочетеноПрочетете
Аудио AI

NVIDIA Riva и NeMo Speech

NVIDIA Riva е GPU-ускорен SDK за производствен реч AI (ASR, TTS и превод), докато NeMo е инструментариум с отворен код за обучение и фина настройка...

2 мин. прочетеноПрочетете
Аудио AI

Архитектура DeepSpeech

DeepSpeech е модел за разпознаване на реч от край до край, въведен от Baidu през 2014 г., който картографира необработените аудио характеристики директно към текста, използвайки повтаряща се невронна...

2 мин. прочетеноПрочетете
Аудио AI

X-Vector вграждане на високоговорители

X-векторите са цифрови пръстови отпечатъци с фиксирана дължина на гласа на говорещия, произведени от невронна мрежа, използвани, за да се каже кой говори, независимо какво казва.

2 мин. прочетеноПрочетете
Аудио AI

Glow-TTS монотонно подравняване

Glow-TTS е модел за преобразуване на текст в говор, който се научава сам да подравнява текст към говор с помощта на умен трик за търсене, премахвайки необходимостта от отделен инструмент за подравняване.

2 мин. прочетеноПрочетете
Аудио AI

Паралелен WaveGAN вокодер

Parallel WaveGAN е бърз неврален вокодер, който превръща мел-спектрограмата в необработена аудио форма на вълната с помощта на малък GAN, генерирайки всички проби наведнъж.

2 мин. прочетеноПрочетете
Аудио AI

WaveGlow Flow-базиран вокодер

WaveGlow е базиран на потоци неврален вокодер от NVIDIA, който синтезира речеви вълни от мел-спектрограми в едно преминаване без авторегресия.

2 мин. прочетеноПрочетете

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.