Безплатна AI библиотека

Аудио AI водачиСвободен завинаги.

117 ръководства на обикновен английски език, структурирани пътеки за обучение и отворена библиотека — създадена от независима 501(c)(3) организация с нестопанска цел, така че всеки да може да разбере модерния AI.

117Безплатни ръководства
1Тематични песни
~2 minПо ръководство
~4hReading time

Започнете тук

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Тематични песни

Преглед по песен

Скочете в района, който ви интересува. Всяка песен има множество ръководства на обикновен английски.

Пълна библиотека

Всички ръководства

117 на 1019 показани ръководства. Филтрирайте по песен или потърсете по-горе.

Аудио AI

Идентификация на кавър песента

Идентификацията на кавър песен открива кога два много различно звучащи записа всъщност са една и съща основна песен — акустична версия на живо, ремикс...

2 мин. прочетеноПрочетете
Аудио AI

DDSP Диференцируем аудио синтез

DDSP (Differentiable Digital Signal Processing) обединява класически градивни блокове на синтезатора с невронни мрежи, така че дълбокото обучение може да контролира осцилаторите...

2 мин. прочетеноПрочетете
Аудио AI

VITS Синтез на реч от край до край

VITS е модел за преобразуване на текст в реч, който превръща текста директно в необработени аудио вълни в една обучена система, прескачайки обичайния двуетапен конвейер.

2 мин. прочетеноПрочетете
Аудио AI

FastSpeech и неавторегресивен TTS

FastSpeech генерира цяла речева спектрограма паралелно, а не един кадър наведнъж, което прави синтеза драматично по-бърз и по-стабилен.

2 мин. прочетеноПрочетете
Аудио AI

NaturalSpeech и Latent Diffusion TTS

NaturalSpeech е линия от Microsoft TTS изследвания, насочени към качество на речта на човешко ниво, като по-късните версии използват латентна дифузия за генериране на богато, естествено...

2 мин. прочетеноПрочетете
Аудио AI

Разпознаване на емоционална реч

Разпознаването на говорни емоции (SER) е AI, който открива емоционалното състояние на говорещия – гняв, радост, тъга, разочарование – от звука на гласа му, не само...

2 мин. прочетеноПрочетете
Аудио AI

Moshi Full-Duplex Speech

Moshi е гласов AI с отворен код в реално време от Kyutai, който говори и слуша едновременно — пълен дуплекс — вместо да се редува строго.

2 мин. прочетеноПрочетете
Аудио AI

Превод от реч към реч

Преводът от реч към реч (S2ST) взема изговорени думи на един език и произвежда изговорени думи на друг — в идеалния случай запазвайки гласа на говорещия, тона...

2 мин. прочетеноПрочетете
Аудио AI

HiFi-GAN и GAN вокодери

HiFi-GAN е генериращ състезателен вокодер, който превръща мел-спектрограмата в необработена аудио вълна почти мигновено, произвеждайки реч със студийно качество далеч...

2 мин. прочетеноПрочетете
Аудио AI

Преобразуване на графема към фонема

Преобразуването от графема към фонема (G2P) превежда написаните букви в звуците, които говорната система трябва действително да произнася.

2 мин. прочетеноПрочетете
Аудио AI

Нормализиране на текст за реч

Нормализирането на текст е стъпката от предния край, която пренаписва необработения писмен текст в напълно изговорени думи, преди системата за говор да го каже.

2 мин. прочетеноПрочетете
Аудио AI

Невронен кодек SoundStream

SoundStream е невронният аудио кодек от край до край на Google, който компресира реч и музика до изключително ниски битрейтове, като същевременно запазва качеството.

2 мин. прочетеноПрочетете

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding