Бесплатная библиотека искусственного интеллекта

Аудио ИИ гидыБесплатно навсегда.

117 простые руководства на английском языке, структурированные схемы обучения и открытая библиотека, созданная независимой некоммерческой организацией 501(c)(3), чтобы каждый мог понять современный искусственный интеллект.

117Бесплатные гиды
1Тематические треки
~2 minЗа руководство
~4hВремя чтения

Начните здесь

Пять курсы, ориентированные на результат

Каждый курс включает в себя явные результаты, обозначенные компетенции, практические занятия и прикладной завершающий этап.

01

Фонды искусственного интеллекта

Поймите, что такое ИИ, как системы учатся, где они терпят неудачу и как оценивать претензии без шумихи.

  1. 1Что такое ИИ?
  2. 2Как учится ИИ
  3. 3Объяснение моделей искусственного интеллекта
  4. 4Тесты искусственного интеллекта
~4ч, чтобы завершитьПосмотреть курс
03

ИИ в работе

Оценивайте варианты использования на рабочем месте, запускайте безопасные пилотные проекты, измеряйте ценность и ответственно сообщайте об изменениях.

  1. 1Автоматизация рабочих процессов с использованием искусственного интеллекта
  2. 2Тесты искусственного интеллекта
  3. 3ИИ и рабочие места
  4. 4Управление ИИ
~6ч, чтобы завершитьПосмотреть курс
04

Политика и общество в области искусственного интеллекта

Анализируйте системы ИИ с точки зрения прав, справедливости, управления, безопасности и результатов, отвечающих общественным интересам.

  1. 1Этика ИИ
  2. 2ИИ и конфиденциальность
  3. 3Регулирование ИИ
  4. 4Мифы об искусственном интеллекте
~6ч, чтобы завершитьПосмотреть курс
05

Строительство с использованием систем искусственного интеллекта

Понимание языковых моделей, поиска, агентов, оценки, стоимости и гарантий развертывания посредством практического проектирования системы.

  1. 1ChatGPT и LLM
  2. 2Качество поиска
  3. 3ИИ-агенты
  4. 4Тесты искусственного интеллекта
~8ч, чтобы завершитьПосмотреть курс

Тематические треки

Просмотр по треку

Прыгайте в область, которая вас волнует. У каждого трека есть несколько путеводителей на простом английском языке.

Полная библиотека

Все руководства

117 из 1019 показаны направляющие. Фильтруйте по треку или выполните поиск выше.

Аудио ИИ

Идентификация кавер-песни

Идентификация кавер-версии позволяет обнаружить, что две совершенно разные по звучанию записи на самом деле представляют собой одну и ту же песню — концертную акустическую версию, ремикс…

2 минута чтенияЧитать
Аудио ИИ

Дифференцируемый синтез звука DDSP

DDSP (дифференцируемая цифровая обработка сигналов) объединяет классические строительные блоки синтезаторов с нейронными сетями, поэтому глубокое обучение может управлять генераторами…

2 минута чтенияЧитать
Аудио ИИ

VITS Сквозной синтез речи

VITS — это модель преобразования текста в речь, которая преобразует текст непосредственно в необработанные аудиосигналы в единой обученной системе, минуя обычный двухэтапный конвейер.

2 минута чтенияЧитать
Аудио ИИ

FastSpeech и неавторегрессионный TTS

FastSpeech генерирует всю речевую спектрограмму параллельно, а не по одному кадру за раз, что делает синтез значительно быстрее и стабильнее.

2 минута чтенияЧитать
Аудио ИИ

NaturalSpeech и TTS со скрытой диффузией

NaturalSpeech — это направление исследований Microsoft TTS, направленное на качество речи человеческого уровня, а в более поздних версиях используется скрытая диффузия для создания богатых, естественных…

2 минута чтенияЧитать
Аудио ИИ

Распознавание речевых эмоций

Распознавание эмоций речи (SER) — это искусственный интеллект, который определяет эмоциональное состояние говорящего — гнев, радость, печаль, разочарование — по звуку его голоса, а не только…

2 минута чтенияЧитать
Аудио ИИ

Полнодуплексная речь Моши

Moshi — это голосовой искусственный интеллект с открытым исходным кодом, работающий в реальном времени от компании Kyutai, который говорит и слушает одновременно — в полнодуплексном режиме — вместо того, чтобы делать резкие повороты.

2 минута чтенияЧитать
Аудио ИИ

Перевод речи в речь

Перевод речи в речь (S2ST) берет произнесенные слова на одном языке и воспроизводит произнесенные слова на другом — в идеале сохраняя голос говорящего, тон…

2 минута чтенияЧитать
Аудио ИИ

HiFi-GAN и вокодеры GAN

HiFi-GAN — это генеративно-состязательный вокодер, который почти мгновенно превращает мел-спектрограмму в необработанный звуковой сигнал, воспроизводя речь студийного качества далеко…

2 минута чтенияЧитать
Аудио ИИ

Преобразование графемы в фонему

Преобразование графемы в фонему (G2P) переводит письменные буквы в звуки, которые речевая система должна произносить.

2 минута чтенияЧитать
Аудио ИИ

Нормализация текста для речи

Нормализация текста — это предварительный этап, который переписывает необработанный письменный текст в полностью произнесенные слова до того, как его произнесет речевая система.

2 минута чтенияЧитать
Аудио ИИ

Нейронный кодек SoundStream

SoundStream — это сквозной нейронный аудиокодек Google, который сжимает речь и музыку до чрезвычайно низкого битрейта, сохраняя при этом качество.

2 минута чтенияЧитать

Закончили читать? Докажите это.

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.

Audio AI AI Guides — Page 2 of 10 | AI Understanding