免费人工智能库

学习人工智能。永远免费。

1019 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

1019免费指南
9主题曲目
~2 min根据指南
~34h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

1019 1019 显示指南。按曲目过滤或在上方搜索。

技术的

Kubernetes 上的 KServe 和模型服务

KServe 是一个标准化的 Kubernetes 原生平台,用于大规模服务机器学习模型。

2 最小阅读量阅读
技术的

Seldon 核心和推理图

Seldon Core 是一个用于在 Kubernetes 上部署机器学习模型的开源平台,具有一个突出的功能:推理图。

2 最小阅读量阅读
视觉人工智能

用于图像提示的 IP 适配器

IP-Adapter 是一个轻量级附加组件,可让稳定扩散等扩散模型接受图像作为提示,而不仅仅是文本。

2 最小阅读量阅读
视觉人工智能

Imagen 文本到图像

Imagen 是 Google 的文本到图像系统,可将书面描述转化为逼真的图片。

2 最小阅读量阅读
视觉人工智能

滑翔扩散模型

GLIDE 是一种早期的 OpenAI 文本到图像扩散模型,它显示提示加上“无分类器指导”,可以击败早期基于 GAN 的系统。

2 最小阅读量阅读
音频人工智能

音乐自动标记

音乐自动标记使用机器学习来听歌曲并自动附加描述性标签,例如流派、情绪、乐器和节奏。

2 最小阅读量阅读
音频人工智能

音乐音色转移

音色转换重塑了音频的“音色”,使一种乐器听起来像另一种乐器,将哼唱的旋律变成小提琴或小号线......

2 最小阅读量阅读
音频人工智能

声学场景分类

声学场景分类 (ASC) 训练机器识别录音的环境,繁忙的街道、安静的公园、火车、咖啡馆……

2 最小阅读量阅读
音频人工智能

NVIDIA Riva 和 NeMo 语音

NVIDIA Riva 是一款用于生产语音 AI(ASR、TTS 和翻译)的 GPU 加速 SDK,而 NeMo 是用于训练和微调的开源工具包……

2 最小阅读量阅读
音频人工智能

深度语音架构

DeepSpeech 是百度于 2014 年推出的一种端到端语音识别模型,它使用循环神经网络将原始音频特征直接映射到文本......

2 最小阅读量阅读
音频人工智能

X 向量扬声器嵌入

X 向量是由神经网络生成的说话者声音的固定长度数字指纹,用于判断谁在说话,无论他们说什么。

2 最小阅读量阅读
语言人工智能

密集通道检索

密集段落检索 (DPR) 通过比较问题和段落的含义(作为数字向量,而不是匹配单词)来查找相关文本。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.