人工智能基金会
了解什么是人工智能,系统如何学习,哪些地方失误,以及如何在不夸大的情况下判断主张。
免费人工智能库
117 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。
从这里开始
每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。
了解什么是人工智能,系统如何学习,哪些地方失误,以及如何在不夸大的情况下判断主张。
在保护隐私、核查输出和保持人类问责的同时,高效使用人工智能。
评估工作场所用例,运行安全试点,衡量价值,负责任地沟通变更。
通过权利、公平、治理、安全和公共利益结果分析人工智能系统。
通过实用的系统设计,理解语言模型、检索、代理、评估、成本和部署保障。
主题曲目
跳入您关心的领域。每条赛道都有多个简单的英文指南。
全库
117 的 1019 显示指南。按曲目过滤或在上方搜索。
翻唱歌曲识别可以检测两个听起来截然不同的录音实际上是同一首歌曲——现场原声版本、混音版……
音频人工智能DDSP(可微分数字信号处理)将经典合成器构建块与神经网络融合在一起,因此深度学习可以控制振荡器……
音频人工智能VITS 是一种文本转语音模型,可在单个经过训练的系统中将文本直接转换为原始音频波形,跳过通常的两级管道。
音频人工智能FastSpeech 并行生成整个语音频谱图,而不是一次生成一帧,从而使合成速度显着更快、更稳定。
音频人工智能NaturalSpeech 是 Microsoft TTS 研究的一个系列,旨在实现人类水平的语音质量,后续版本使用潜在扩散来生成丰富、自然的……
音频人工智能语音情绪识别 (SER) 是一种人工智能,可以从说话者的声音中检测他们的情绪状态——愤怒、快乐、悲伤、沮丧,而不仅仅是……
音频人工智能Moshi 是 Kyutai 的一款开源实时语音 AI,它可以同时说话和聆听(全双工),而不是严格轮流。
音频人工智能语音转语音翻译 (S2ST) 获取一种语言的口语单词并生成另一种语言的口语单词 - 理想地保留说话者的声音、语气……
音频人工智能HiFi-GAN 是一种生成对抗式声码器,几乎可以立即将梅尔频谱图转换为原始音频波形,从而产生录音室质量的语音......
音频人工智能字素到音素 (G2P) 转换将书面字母转换为语音系统实际应发音的声音。
音频人工智能文本规范化是在语音系统说出原始书面文本之前将其重写为完全说出的单词的前端步骤。
音频人工智能SoundStream 是 Google 的端到端神经音频编解码器,可将语音和音乐压缩到极低的比特率,同时保持质量。