免费人工智能库

视觉人工智能 指南永远免费。

133 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

133免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

133 1019 显示指南。按曲目过滤或在上方搜索。

视觉人工智能

光学字符识别

光学字符识别 (OCR) 将文本图像(扫描文档、标志照片、PDF)转换为机器可读、可编辑的文本。

2 最小阅读量阅读
视觉人工智能

光流

光流估计每个像素如何在连续视频帧之间移动,产生运动矢量的密集图。

2 最小阅读量阅读
视觉人工智能

单目深度估计

单目深度估计可预测每个像素与单张普通照片的距离 - 无需立体相机、激光雷达或深度传感器。

2 最小阅读量阅读
视觉人工智能

潜在扩散模型

潜在扩散模型通过在压缩的潜在空间而不是原始像素中运行扩散过程来生成图像,从而大幅削减计算成本。

2 最小阅读量阅读
视觉人工智能

控制网

ControlNet 是一个附加组件,可为图像生成模型提供精确的结构控制,让您可以通过边缘、姿势、深度图或涂鸦来控制输出。

2 最小阅读量阅读
视觉人工智能

无分类器指导

无分类器指导是一种使扩散模型真正遵循您的提示的技术,用一些多样性换取更强的依从性。

2 最小阅读量阅读
视觉人工智能

视觉SLAM

视觉 SLAM 让移动摄像机构建未知空间的地图,同时跟踪其自身在该地图内的位置。

2 最小阅读量阅读
视觉人工智能

Sora 和文本转视频

Sora 是 OpenAI 的文本到视频模型,可将书面提示转换为简短的高分辨率视频剪辑。

2 最小阅读量阅读
视觉人工智能

视频扩散模型

视频扩散模型通过逐渐将随机噪声转化为连贯帧来生成运动图像,将扩散思想从图片扩展到时间。

2 最小阅读量阅读
视觉人工智能

文本转 3D 生成

文本到 3D 生成将“老式皮革扶手椅”等书面提示转变为完整的 3D 模型,您可以旋转、点亮并放入游戏或场景中。

2 最小阅读量阅读
视觉人工智能

可微渲染

可微渲染使得将 3D 场景转换为 2D 图像的过程完全可微,因此您可以根据渲染的像素计算梯度……

2 最小阅读量阅读
视觉人工智能

U-Net架构

U-Net 是一种形状像“U”的卷积神经网络,擅长产生像素精确的输出,最初用于生物医学图像分割。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.