Безкоштовна бібліотека ШІ

Аудіо AI напрямніВільний назавжди.

117 посібники простою англійською мовою, структуровані навчальні маршрути та відкрита бібліотека — створена незалежною некомерційною організацією 501(c)(3), щоб кожен міг зрозуміти сучасний ШІ.

117Безкоштовні путівники
1Тематичні треки
~2 minЗа посібником
~4hЧас читання

Почніть тут

П'ять курси, орієнтовані на результат

Кожен курс включає чіткі результати, компетенції, практичні дії та прикладний завершальний камінь.

02

Відповідальний користувач ШІ

Використовуйте штучний інтелект продуктивно, захищаючи конфіденційність, перевіряючи результати та зберігаючи підзвітність людини.

  1. 1Prompt Engineering
  2. 2ШІ Галюцинації
  3. 3ШІ та конфіденційність
  4. 4ШІ в повсякденному житті
~5h для завершенняПереглянути курс

Тематичні треки

Перегляд за треком

Перейдіть у сферу, яка вам цікава. Кожен трек має декілька гідів простою англійською мовою.

Повна бібліотека

Всі путівники

117 з 1019 показано напрямні. Фільтруйте за треком або шукайте вище.

Аудіо AI

Дифузійний вокодер DiffWave

DiffWave — це вокодер на основі дифузії, який синтезує аудіо шляхом ітеративного зменшення випадкового шуму в хвилю на основі мел-спектрограми.

2 хв. читанняПрочитайте
Аудіо AI

Модель Bark Generative Audio

Bark — це модель перетворення тексту в аудіо з відкритим кодом від Suno, яка генерує не лише мову, але й сміх, зітхання, музику та звукові ефекти безпосередньо з текстових підказок.

2 хв. читанняПрочитайте
Аудіо AI

Авторегресійний синтез черепахового TTS

Tortoise TTS — це система перетворення тексту в мовлення з відкритим кодом, яку цінують за надзвичайно природні, емоційно насичені голоси та потужне клонування голосу лише з кількох коротких…

2 хв. читанняПрочитайте
Аудіо AI

Міжмовне клонування голосу XTTS

XTTS — це багатомовна модель перетворення тексту в мовлення Coqui, яка може клонувати голос із короткого кліпу, а потім говорити багатьма різними мовами, зберігаючи…

2 хв. читанняПрочитайте
Аудіо AI

SoundStorm Parallel Audio Generation

SoundStorm — це модель генерації аудіо Google, яка виробляє мову та звук паралельно, а не по одному токену за раз, створюючи високоякісний синтез аудіо…

2 хв. читанняПрочитайте
Аудіо AI

AudioGen Синтез тексту в аудіо

AudioGen — це модель Meta, яка перетворює текстові описи на реалістичні звуки навколишнього середовища та звукові ефекти, як-от «гавкіт собаки під час цвірінькання птахів».

2 хв. читанняПрочитайте
Аудіо AI

Стабільна латентна дифузія звуку

Stable Audio — це система Stability AI для перетворення тексту в аудіо, яка використовує приховану дифузію для створення музики та звукових ефектів із явним контролем тривалості кліпу.

2 хв. читанняПрочитайте
Аудіо AI

Набір інструментів для розпізнавання мовлення Kaldi

Kaldi — це безкоштовний інструментарій із відкритим кодом, який став домінуючою дослідницькою платформою для створення систем розпізнавання мовлення.

2 хв. читанняПрочитайте
Аудіо AI

Згортковий ASR Wav2Letter

Wav2Letter — це наскрізна система розпізнавання мовлення від Facebook AI, яка використовує лише згорточні нейронні мережі без повторення.

2 хв. читанняПрочитайте
Аудіо AI

Jasper і QuartzNet ASR

Jasper і QuartzNet — це наскрізні моделі згорткового розпізнавання мовлення від NVIDIA, причому QuartzNet — це значно менша й ефективна модернізована…

2 хв. читанняПрочитайте
Аудіо AI

Дифузійні моделі для аудіо

Дифузійні моделі генерують аудіо, навчаючись змінювати покроковий шумовий процес, перетворюючи випадковий шум на зв’язну мову, музику чи звукові ефекти.

2 хв. читанняПрочитайте
Аудіо AI

Виявлення звукових подій

Виявлення звукових подій (SED) визначає, які звуки відбуваються в аудіопотоці та коли саме вони починаються та припиняються.

2 хв. читанняПрочитайте

Закінчив читати? Доведіть це.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 7 of 10 | AI Understanding