Безкоштовна бібліотека ШІ

Аудіо AI напрямніВільний назавжди.

117 посібники простою англійською мовою, структуровані навчальні маршрути та відкрита бібліотека — створена незалежною некомерційною організацією 501(c)(3), щоб кожен міг зрозуміти сучасний ШІ.

117Безкоштовні путівники
1Тематичні треки
~2 minЗа посібником
~4hЧас читання

Почніть тут

П'ять курси, орієнтовані на результат

Кожен курс включає чіткі результати, компетенції, практичні дії та прикладний завершальний камінь.

02

Відповідальний користувач ШІ

Використовуйте штучний інтелект продуктивно, захищаючи конфіденційність, перевіряючи результати та зберігаючи підзвітність людини.

  1. 1Prompt Engineering
  2. 2ШІ Галюцинації
  3. 3ШІ та конфіденційність
  4. 4ШІ в повсякденному житті
~5h для завершенняПереглянути курс

Тематичні треки

Перегляд за треком

Перейдіть у сферу, яка вам цікава. Кожен трек має декілька гідів простою англійською мовою.

Повна бібліотека

Всі путівники

117 з 1019 показано напрямні. Фільтруйте за треком або шукайте вище.

Аудіо AI

Mimi Streaming Audio Codec

Mimi — це нейронний аудіокодек, який стискає мовлення в крихітний потік окремих токенів у реальному часі, тому моделі штучного інтелекту можуть слухати та говорити з дуже низьким...

2 хв. читанняПрочитайте
Аудіо AI

Слухайте, відвідуйте та читайте заклинання

Listen, Attend and Spell (LAS) — це знакова нейронна мережа 2015 року, яка транскрибує мову безпосередньо в символи, без ручної вимови…

2 хв. читанняПрочитайте
Аудіо AI

SpecAugment для розпізнавання мовлення

SpecAugment — це простий, але потужний метод доповнення даних, який маскує та деформує спектрограму мовлення, щоб зробити моделі розпізнавання більш надійними.

2 хв. читанняПрочитайте
Аудіо AI

Автоматичне тегування музики

Автоматичне позначення музики використовує машинне навчання для прослуховування пісні та автоматичного додавання описових міток, таких як жанр, настрій, інструменти та темп.

2 хв. читанняПрочитайте
Аудіо AI

Передача музичного тембру

Передача тембру змінює «колір тону» звуку, щоб один інструмент звучав як інший, перетворюючи наспівану мелодію на лінію скрипки чи труби…

2 хв. читанняПрочитайте
Аудіо AI

Класифікація акустичних сцен

Класифікація акустичних сцен (ASC) навчає машини розпізнавати середовище, в якому було здійснено запис: жваву вулицю, тихий парк, поїзд, кафе…

2 хв. читанняПрочитайте
Аудіо AI

NVIDIA Riva і NeMo Speech

NVIDIA Riva — це SDK із прискоренням графічного процесора для штучного інтелекту мовлення (ASR, TTS і переклад), а NeMo — це набір інструментів із відкритим вихідним кодом для навчання та тонкого налаштування…

2 хв. читанняПрочитайте
Аудіо AI

Архітектура DeepSpeech

DeepSpeech — це модель наскрізного розпізнавання мовлення, представлена ​​Baidu у 2014 році, яка відображає необроблені аудіофайли безпосередньо в тексті за допомогою періодичної нейронної...

2 хв. читанняПрочитайте
Аудіо AI

Вбудовані динаміки X-Vector

Х-вектори — це цифрові відбитки голосу мовця фіксованої довжини, створені нейронною мережею, які використовуються для визначення того, хто говорить незалежно від того, що він говорить.

2 хв. читанняПрочитайте
Аудіо AI

Монотонне вирівнювання Glow-TTS

Glow-TTS — це модель синтезу мовлення з тексту, яка вчиться самостійно вирівнювати текст із мовленням за допомогою хитрого пошуку, усуваючи потребу в окремому вирівнювачі.

2 хв. читанняПрочитайте
Аудіо AI

Паралельний вокодер WaveGAN

Parallel WaveGAN — це швидкий нейронний вокодер, який перетворює мел-спектрограму на сиру звукову форму за допомогою невеликого GAN, генеруючи всі зразки одночасно.

2 хв. читанняПрочитайте
Аудіо AI

Вокодер на основі потоку WaveGlow

WaveGlow — це нейронний вокодер на основі потоку від NVIDIA, який синтезує мовні сигнали з мел-спектрограм за один прохід без авторегресії.

2 хв. читанняПрочитайте

Закінчив читати? Доведіть це.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.