Безплатна AI библиотека

Аудио AI водачиСвободен завинаги.

117 ръководства на обикновен английски език, структурирани пътеки за обучение и отворена библиотека — създадена от независима 501(c)(3) организация с нестопанска цел, така че всеки да може да разбере модерния AI.

117Безплатни ръководства
1Тематични песни
~2 minПо ръководство
~4hReading time

Започнете тук

Five outcome-based courses

Each course includes explicit outcomes, mapped competencies, practice activities, and an applied capstone.

Тематични песни

Преглед по песен

Скочете в района, който ви интересува. Всяка песен има множество ръководства на обикновен английски.

Пълна библиотека

Всички ръководства

117 на 1019 показани ръководства. Филтрирайте по песен или потърсете по-горе.

Аудио AI

Формиране на лъч и микрофонни масиви

Beamforming използва множество микрофони за слушане в избрана посока, усилвайки звука от целта, като същевременно потиска всичко останало.

2 мин. прочетеноПрочетете
Аудио AI

Рифузионна спектрограма Дифузия

Riffusion е умен хак, който генерира музика, като третира звука като картина: той фино настройва модела на изображението Stable Diffusion, за да рисува спектрограми, след което...

2 мин. прочетеноПрочетете
Аудио AI

MusicLM: Йерархични семантични и акустични токени

Научете как Google MusicLM използва йерархични семантични и акустични токени, SoundStream и MuLan, за да превърне текстовите подкани в последователна музика.

2 мин. прочетеноПрочетете
Аудио AI

Noise2Noise Подобряване на речта

Noise2Noise е тренировъчен трик, който позволява на модел да се научи да премахва шума, без изобщо да вижда чиста препратка, като се учи от двойки различни шумни...

2 мин. прочетеноПрочетете
Аудио AI

Conv-TasNet Time-Domain Separation

Conv-TasNet е невронна мрежа, която разделя смесеното аудио (като двама души, които говорят едновременно), като вместо това работи директно върху необработената звукова вълна...

2 мин. прочетеноПрочетете
Аудио AI

Двупътно RNN разделяне

Dual-Path RNN (DPRNN) е архитектура за разделяне на звука, която разделя много дълга поредица от аудио характеристики на къси припокриващи се части и ги обработва...

2 мин. прочетеноПрочетете
Аудио AI

Отваряне-Размиксиране на музикално разделяне

Open-Unmix (UMX) е система за дълбоко обучение с отворен код, която разделя песен на части: вокали, барабани, бас и други инструменти.

2 мин. прочетеноПрочетете
Аудио AI

Whisper Подравняване на думи с клеймо за време

Шепотното подравняване на думи закрепва всяка транскрибирана дума към точен начален и краен час в аудиото.

2 мин. прочетеноПрочетете
Аудио AI

Музикално етикетиране с Transformers

Музикалното маркиране използва трансформаторни модели за слушане на песен и предвиждане на описателни етикети като жанр, настроение, инструменти и темпо.

2 мин. прочетеноПрочетете
Аудио AI

Начало на откриване в аудио

Разпознаването на началото намира точните моменти, когато започват ноти, удари или звуци в аудио сигнал.

2 мин. прочетеноПрочетете
Аудио AI

MelGAN Generative Vocoder

MelGAN е напълно конволюционен GAN-базиран вокодер, който превръща мел-спектрограмите в необработени аудио вълни с едно бързо преминаване напред.

2 мин. прочетеноПрочетете
Аудио AI

UnivNet вокодер с много разделителна способност

UnivNet е GAN вокодер, който оценява генерираното аудио с помощта на множество спектрограми, изчислени при различни STFT резолюции, изостряйки високочестотните детайли.

2 мин. прочетеноПрочетете

Finished reading? Prove it.

Check what you learned with topic quizzes, then explore our structured courses and current certification requirements. Core guides remain free to read.