Безплатна AI библиотека

Аудио AI водачиСвободен завинаги.

117 ръководства на обикновен английски език, структурирани пътеки за обучение и отворена библиотека — създадена от независима 501(c)(3) организация с нестопанска цел, така че всеки да може да разбере модерния AI.

117Безплатни ръководства
1Тематични песни
~2 minПо ръководство
~4hReading time

Започнете тук

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Тематични песни

Преглед по песен

Скочете в района, който ви интересува. Всяка песен има множество ръководства на обикновен английски.

Пълна библиотека

Всички ръководства

117 на 1019 показани ръководства. Филтрирайте по песен или потърсете по-горе.

Аудио AI

Разделяне на стъблото на Spleeter

Spleeter е инструмент с отворен код от Deezer, който разделя завършена песен на отделни песни (вокали, барабани, бас и други) с помощта на дълбоко обучение.

2 мин. прочетеноПрочетете
Аудио AI

Оценка на стъпката на CREPE

CREPE е модел за дълбоко обучение, който оценява основната честота (височина) на монофоничен аудио сигнал директно от необработената му форма на вълната.

2 мин. прочетеноПрочетете
Аудио AI

PESQ и STOI показатели за качество на речта

PESQ и STOI са стандартни обективни показатели, които оценяват колко добре звучи обработената реч и колко разбираема е тя, без да са необходими човешки слушатели.

2 мин. прочетеноПрочетете
Аудио AI

Вокодиране на филтъра на източника и WORLD

Вокодерът е инструмент, който разделя речта на градивни елементи и я възстановява.

2 мин. прочетеноПрочетете
Аудио AI

Средна оценка на мнението

Средната оценка на мнението (MOS) е средна оценка от 1 до 5 от слушатели, която измерва колко добре звучи синтезирано или предадено аудио.

2 мин. прочетеноПрочетете
Аудио AI

Constant-Q трансформация за аудио

Constant-Q Transform (CQT) е честотен анализ, който използва логаритмично разпределени интервали, съответстващи на музикалната височина, вместо равномерно разположените интервали...

2 мин. прочетеноПрочетете
Аудио AI

Filterbank и PLP функции

Функциите Filterbank и Perceptual Linear Prediction (PLP) са начини за обобщаване на говорен сигнал в компактни, перцептивно значими числа, които машинно...

2 мин. прочетеноПрочетете
Аудио AI

StyleTTS 2 Стилна дифузия

StyleTTS 2 е модел за преобразуване на текст в говор, който третира „стила“ на гласа — прозодия, емоция и тембър на говорещия — като произволна променлива, избрана с модел на дифузия…

2 мин. прочетеноПрочетете
Аудио AI

FastPitch Pitch-Controllable TTS

FastPitch е бърз, неавторегресивен модел за преобразуване на текст в реч, който изрично предсказва височината (основната честота) на всеки входен токен, което ви позволява...

2 мин. прочетеноПрочетете
Аудио AI

Voicebox Flow-Matching Speech Generation

Voicebox е моделът на Meta за генериране на реч с насочване на текст, обучен с цел за съпоставяне на потока за „запълване“ на маскиран звук, позволявайки на един модел да прави глас без изстрел…

2 мин. прочетеноПрочетете
Аудио AI

Предизвикателство за дълбоко потискане на шума

Предизвикателството за дълбоко потискане на шума (DNS) е състезание, провеждано от Microsoft, което тласка изследователите да изграждат невронни мрежи, които премахват фоновия шум...

2 мин. прочетеноПрочетете
Аудио AI

Спектрално изваждане и Винерово филтриране

Спектралното изваждане и Wiener филтрирането са класическите работни коне за намаляване на шума преди задълбочено обучение.

2 мин. прочетеноПрочетете

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.