Безкоштовна бібліотека ШІ

Аудіо AI напрямніВільний назавжди.

117 посібники простою англійською мовою, структуровані навчальні маршрути та відкрита бібліотека — створена незалежною некомерційною організацією 501(c)(3), щоб кожен міг зрозуміти сучасний ШІ.

117Безкоштовні путівники
1Тематичні треки
~2 minЗа посібником
~4hЧас читання

Почніть тут

П'ять курси, орієнтовані на результат

Кожен курс включає чіткі результати, компетенції, практичні дії та прикладний завершальний камінь.

02

Відповідальний користувач ШІ

Використовуйте штучний інтелект продуктивно, захищаючи конфіденційність, перевіряючи результати та зберігаючи підзвітність людини.

  1. 1Prompt Engineering
  2. 2ШІ Галюцинації
  3. 3ШІ та конфіденційність
  4. 4ШІ в повсякденному житті
~5h для завершенняПереглянути курс

Тематичні треки

Перегляд за треком

Перейдіть у сферу, яка вам цікава. Кожен трек має декілька гідів простою англійською мовою.

Повна бібліотека

Всі путівники

117 з 1019 показано напрямні. Фільтруйте за треком або шукайте вище.

Аудіо AI

Ідентифікація кавер-версії пісні

Ідентифікація кавер-версії пісні визначає, коли два дуже різні за звучанням записи насправді є тією самою основною піснею — живою акустичною версією, реміксом…

2 хв. читанняПрочитайте
Аудіо AI

Диференційований аудіосинтез DDSP

DDSP (Differentiable Digital Signal Processing) об’єднує класичні будівельні блоки синтезатора з нейронними мережами, тому глибоке навчання може керувати осциляторами…

2 хв. читанняПрочитайте
Аудіо AI

VITS Наскрізний синтез мовлення

VITS — це модель перетворення тексту в мовлення, яка перетворює текст безпосередньо на необроблені звукові сигнали в одній навченій системі, пропускаючи звичайний двоетапний конвеєр.

2 хв. читанняПрочитайте
Аудіо AI

FastSpeech і неавторегресивний TTS

FastSpeech генерує всю спектрограму мови паралельно, а не по одному кадру за раз, що робить синтез значно швидшим і стабільнішим.

2 хв. читанняПрочитайте
Аудіо AI

NaturalSpeech і Latent Diffusion TTS

NaturalSpeech — це лінія досліджень Microsoft TTS, спрямована на якість мовлення людського рівня, а пізніші версії використовують латентну дифузію для створення насиченого, природного...

2 хв. читанняПрочитайте
Аудіо AI

Розпізнавання мовних емоцій

Розпізнавання мовних емоцій (SER) — це штучний інтелект, який визначає емоційний стан мовця — гнів, радість, смуток, розчарування — за звуком його голосу, а не лише за…

2 хв. читанняПрочитайте
Аудіо AI

Повнодуплексне мовлення Moshi

Moshi — це голосовий штучний інтелект із відкритим вихідним кодом у режимі реального часу від Kyutai, який розмовляє та слухає одночасно — у дуплексному режимі — замість чіткої черги.

2 хв. читанняПрочитайте
Аудіо AI

Переклад з мови на мову

Переклад мови в мову (S2ST) приймає слова, вимовлені однією мовою, і створює вимовлені слова іншою — ідеально зберігаючи голос мовця, тон…

2 хв. читанняПрочитайте
Аудіо AI

Вокодери HiFi-GAN і GAN

HiFi-GAN — це генеративно-змагальний вокодер, який майже миттєво перетворює мел-спектрограму на необроблений аудіосигнал, створюючи мову студійної якості далеко…

2 хв. читанняПрочитайте
Аудіо AI

Перетворення графем у фонеми

Перетворення графеми у фонему (G2P) перетворює написані літери на звуки, які насправді має вимовляти мовна система.

2 хв. читанняПрочитайте
Аудіо AI

Нормалізація тексту для мовлення

Нормалізація тексту — це початковий крок, який переписує необроблений письмовий текст у повністю вимовлені слова до того, як це промовить мовна система.

2 хв. читанняПрочитайте
Аудіо AI

Нейронний кодек SoundStream

SoundStream — це наскрізний нейронний аудіокодек Google, який стискає мову та музику до надзвичайно низьких бітрейтів, зберігаючи якість.

2 хв. читанняПрочитайте

Закінчив читати? Доведіть це.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding