人工智能基金会
了解什么是人工智能,系统如何学习,哪些地方失误,以及如何在不夸大的情况下判断主张。
免费人工智能库
117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。
从这里开始
每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。
了解什么是人工智能,系统如何学习,哪些地方失误,以及如何在不夸大的情况下判断主张。
在保护隐私、核查输出和保持人类问责的同时,高效使用人工智能。
评估工作场所用例,运行安全试点,衡量价值,负责任地沟通变更。
通过权利、公平、治理、安全和公共利益结果分析人工智能系统。
通过实用的系统设计,理解语言模型、检索、代理、评估、成本和部署保障。
主题曲目
跳入您关心的领域。每条赛道都有多个简单的英文指南。
全库
117 的 1019 显示指南。按曲目过滤或在上方搜索。
Mimi 是一种神经音频编解码器,可将语音实时压缩为微小的离散标记流,因此 AI 模型可以以非常低的速度听和说……
音频人工智能Listen、Attend and Spell (LAS) 是 2015 年具有里程碑意义的神经网络,它可以将语音直接转录成字符,无需手工构建发音……
音频人工智能SpecAugment 是一种简单但功能强大的数据增强方法,可以屏蔽和扭曲语音频谱图,使识别模型更加稳健。
音频人工智能音乐自动标记使用机器学习来听歌曲并自动附加描述性标签,例如流派、情绪、乐器和节奏。
音频人工智能音色转换重塑了音频的“音色”,使一种乐器听起来像另一种乐器,将哼唱的旋律变成小提琴或小号线......
音频人工智能声学场景分类 (ASC) 训练机器识别录音的环境,繁忙的街道、安静的公园、火车、咖啡馆……
音频人工智能NVIDIA Riva 是一款用于生产语音 AI(ASR、TTS 和翻译)的 GPU 加速 SDK,而 NeMo 是用于训练和微调的开源工具包……
音频人工智能DeepSpeech 是百度于 2014 年推出的一种端到端语音识别模型,它使用循环神经网络将原始音频特征直接映射到文本......
音频人工智能X 向量是由神经网络生成的说话者声音的固定长度数字指纹,用于判断谁在说话,无论他们说什么。
音频人工智能Glow-TTS 是一种文本转语音模型,它可以使用巧妙的搜索技巧自行学习将文本与语音对齐,从而无需单独的对齐器。
音频人工智能Parallel WaveGAN 是一种快速神经声码器,它使用小型 GAN 将梅尔频谱图转换为原始音频波形,同时生成所有样本。
音频人工智能WaveGlow 是 NVIDIA 的一款基于流的神经声码器,可一次性从梅尔频谱图合成语音波形,无需自回归。