视觉人工智能指南

机器人控制的扩散策略

扩散策略将稳定扩散等图像生成器背后的相同去噪思想应用于机器人控制:它不是预测单个下一个动作,而是通过迭代细化噪声来生成未来动作的整个短序列。

阅读时间:2分钟最后更新

概述

It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.

深入探讨

扩散策略由哥伦比亚大学、麻省理工学院和丰田研究院的研究人员于 2023 年提出,将视觉运动学习重新定义为条件降噪。给定最近的相机图像和机器人状态,它从随机噪声开始,运行几个去噪步骤来生成“动作块”——例如末端执行器姿势的接下来 8 到 16 个时间步长。最大的胜利是多模态:当一个任务有多个有效的解决方案时(你可以从左边或右边抓住一个杯子),传统回归将它们平均为一个糟糕的中间动作,而扩散模型可以干净地致力于一种模式。它还可以从人类演示(行为克隆)中稳定地学习,并很好地应对高维动作空间,使其成为许多现代操纵系统的默认选择。

技术洞察

训练将高斯噪声添加到演示的动作序列中,并教导网络(通常是 U-Net 或 Transformer)根据视觉和本体感觉观察来预测该噪声。在运行时,它通过几个步骤(DDPM/DDIM)对随机样本进行降噪,以产生动作轨迹。预测块加上“后退地平线”重新规划可以提供时间一致性,同时对新观察保持反应。

战略影响

速度与规模

视觉人工智能可以大规模自动化检查、检测和标记任务。

构建选择

创意团队可以通过更少的手动修改更快地构建概念原型。

团队与工作流程

操作可以使用以前难以处理的图像和视频信号。

机器人控制扩散政策的未来

工作是减少去噪步骤的数量(通过一致性模型和流匹配),以便策略在真实硬件上以高控制率运行。扩散动作头被固定在大型视觉语言骨干上以形成 VLA,并且 3D 感知和等变变体提高了样本效率。预计基于扩散的控制仍将是驱动灵巧和双手任务的通用机器人“大脑”的核心要素。

现实世界的实施

机器人手臂将 T 形块推向目标姿势,这是扩散策略明显优于先前行为克隆方法的基准

双手机器人学习精细的厨房任务,例如从人类远程操作演示中翻转食物或组装零件

杂乱的垃圾箱拣选,其中存在多个有效的抓取,并且策略承诺一个而不是平均

视觉-语言-动作系统内的动作头模块为灵巧的手生成平滑的高频运动

风险与防护栏

如果出处不明,肖像权和同意可能会成为法律风险。

模型性能可能因光照、人口统计和环境的不同而有所不同。

除非监控置信阈值,否则误报可能会被忽视。

实施路线图

1

定义精确度、召回率和错误成本的接受标准。

2

使用符合实际生产条件的数据进行测试。

3

为低置信度或高影响力的预测添加人工审核。

4

跟踪模型漂移并在相机或数据集更改后重新验证。

不断探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Policy for Robot Control quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

开始测验

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一个指南

Stable Diffusion

常见问题

What is Diffusion Policy for Robot Control?

扩散策略将稳定扩散等图像生成器背后的相同去噪思想应用于机器人控制:它不是预测单个下一个动作,而是通过迭代细化噪声来生成未来动作的整个短序列。这很重要,因为它比旧方法更好地处理真实操作的混乱、多模式性质。

扩散策略在每个决策点会生成什么?

扩散策略通过去噪而不是一个孤立的命令来产生一个动作块——几个未来的动作时间步。

扩散策略借鉴了图像人工智能的哪种生成技术?

与图像扩散模型一样,它从噪声开始并迭代去噪,但这里的输出是基于观察的动作轨迹。

扩散策略比简单回归更好地解决多模态任务的哪些问题?

当多个动作有效时(例如,向左或向右抓握),回归将它们平均为较差的中间选项;扩散可以完全致力于单一模式。

在训练过程中,扩散策略中的网络要预测什么?

高斯噪声被添加到演示的动作中,并且网络学习预测该噪声(以观察为条件),即标准去噪目标。

什么是扩散政策中的“后退视野”重新规划?

该策略预测大量行动,但定期使用新的观察结果重新计划,平衡时间一致性和反应性。