免费人工智能库

视觉人工智能 指南永远免费。

133 简明英语指南、结构化学习路径和开放图书馆——由独立的 501(c)(3) 非营利组织构建,以便任何人都可以理解现代人工智能。

133免费指南
1主题曲目
~2 min根据指南
~4h阅读时间

从这里开始

成果导向课程

每门课程都包含明确的成果、能力规划、实践活动和应用毕业设计。

主题曲目

按曲目浏览

跳入您关心的领域。每条赛道都有多个简单的英文指南。

全库

所有指南

133 1019 显示指南。按曲目过滤或在上方搜索。

视觉人工智能

图像协调和合成

图像协调会自动调整粘贴的前景对象,使其颜色、灯光和色调与新背景相匹配,使合成图像看起来更真实。

2 最小阅读量阅读
视觉人工智能

SDXL 和级联扩散

SDXL 是 Stability AI 的高分辨率文本到图像模型,它将强大的基础生成器与精炼器配对,而级联扩散链多个……

2 最小阅读量阅读
视觉人工智能

GLIGEN 接地一代

GLIGEN(接地语言到图像生成)可让您通过输入模型边界框来精确控制对象在生成的图像中出现的位置......

2 最小阅读量阅读
视觉人工智能

用于多条件扩散控制的 T2I 适配器

了解用于多条件扩散控制的 T2I-Adapter:它如何使用轻量级…控制边缘、深度、姿势和其他条件下的稳定扩散……

2 最小阅读量阅读
视觉人工智能

空文本反转

空文本反转是一种技术,可让您使用文本驱动的扩散模型(如稳定扩散)编辑真实照片,同时保留您所...

2 最小阅读量阅读
视觉人工智能

定制扩散多概念调音

自定义扩散是一种轻量级微调方法,可以教授文本到图像模型新的个人概念,例如您的狗或特定的椅子,从……

2 最小阅读量阅读
视觉人工智能

潜在混合和图像插值

潜在混合通过在模型的潜在空间内组合图像的压缩表示来混合图像,而不是平均原始像素。

2 最小阅读量阅读
视觉人工智能

机器人视觉-语言-动作模型

视觉-语言-动作(VLA)模型是大型神经网络,它接收相机图像和书面指令并直接输出机器人电机命令。

2 最小阅读量阅读
视觉人工智能

机器人控制的扩散策略

扩散策略将稳定扩散等图像生成器背后的相同去噪思想应用于机器人控制:而不是预测单个下一个动作......

2 最小阅读量阅读
视觉人工智能

制作视频文本转视频

Make-A-Video 是 Meta 的 2022 年系统,可将文本提示转换为短视频剪辑,而无需对标记的文本-视频对进行训练。

2 最小阅读量阅读
视觉人工智能

Imagen 视频级联

Imagen Video 是 Google 的 2022 年文本转视频系统,它通过级联七个扩散模型构建剪辑,每个模型都会添加更多帧或更高的分辨率。

2 最小阅读量阅读
视觉人工智能

CogVideo 和 CogVideoX

CogVideo (2022) 是第一个大规模开放的文本到视频模型,CogVideoX (2024) 是清华/智普人工智能的更强大的开源继承者。

2 最小阅读量阅读

读完了吗?证明给我看。

Check what you learned with a topic quiz, then explore our structured courses or work toward a certificate. Every guide stays free to read.