視覺人工智慧指南

機器人控制的擴散策略

擴散策略將穩定擴散等影像產生器背後相同的去噪思想應用於機器人控制:它不是預測單一下一個動作,而是透過迭代細化雜訊來產生未來動作的整個短序列。

閱讀時間約2分鐘最後更新

概述

It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.

深入探討

擴散策略由哥倫比亞大學、麻省理工學院和豐田研究院的研究人員於 2023 年提出,將視覺運動學習重新定義為條件降噪。給定最近的相機影像和機器人狀態,它從隨機雜訊開始,運行幾個去噪步驟來產生「動作區塊」——例如末端執行器姿勢的接下來 8 到 16 個時間步長。最大的勝利是多模態:當一個任務有多個有效的解決方案時(你可以從左邊或右邊抓住一個杯子),傳統回歸將它們平均為一個糟糕的中間動作,而擴散模型可以乾淨地致力於一種模式。它還可以從人類演示(行為克隆)中穩定地學習,並很好地應對高維動作空間,使其成為許多現代操縱系統的預設選擇。

技術洞察

訓練將高斯噪音添加到演示的動作序列中,並教導網路(通常是 U-Net 或 Transformer)根據視覺和本體感覺觀察來預測該噪音。在運行時,它會透過幾個步驟(DDPM/DDIM)對隨機樣本進行降噪,以產生動作軌跡。預測區塊加上「後退地平線」重新規劃可以提供時間一致性,同時對新觀察值保持反應。

戰略影響

速度與規模

視覺人工智慧可以大規模自動化檢查、檢測和標記任務。

配裝選擇

創意團隊可以透過更少的手動修改來更快地建立概念原型。

團隊與工作流程

操作可以使用以前難以處理的影像和視訊訊號。

機器人控制擴散政策的未來

工作是減少去雜訊步驟的數量(透過一致性模型和串流匹配),以便策略在真實硬體上以高控制率運行。擴散動作頭被固定在大型視覺語言骨幹上以形成 VLA,並且 3D 感知和等變體提高了樣本效率。預計基於擴散的控制仍將是驅動靈巧和雙手任務的通用機器人「大腦」的核心要素。

現實世界的實施

機器手臂將 T 形塊推向目標姿勢,這是擴散策略明顯優於先前行為克隆方法的基準

雙手機器人學習精細的廚房任務,例如從人類遠端操作演示中翻轉食物或組裝零件

雜亂的垃圾箱揀選,其中存在多個有效的抓取,並且策略承諾一個而不是平均

視覺-語言-動作系統內的動作頭模組為靈巧的手產生平滑的高頻運動

風險與防護欄

如果出處不明,肖像權和同意可能會成為法律風險。

模型表現可能因光照、人口統計和環境的不同而有所不同。

除非監控置信閾值,否則誤報可能會被忽略。

實施路線圖

1

定義精確度、召回率和錯誤成本的接受標準。

2

使用符合實際生產條件的數據進行測試。

3

為低置信度或高影響力的預測添加人工審核。

4

追蹤模型漂移並在相機或資料集變更後重新驗證。

不斷探索

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Policy for Robot Control quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

開始測驗

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

下一步指南

Stable Diffusion

常見問題

What is Diffusion Policy for Robot Control?

擴散策略將穩定擴散等影像產生器背後相同的去噪思想應用於機器人控制:它不是預測單一下一個動作,而是透過迭代細化雜訊來產生未來動作的整個短序列。這很重要,因為它比舊方法更好地處理真實操作的混亂、多模式性質。

擴散策略在每個決策點會產生什麼?

擴散策略透過去噪而不是一個孤立的命令來產生一個動作塊——幾個未來的動作時間步。

擴散策略借鑒了圖像人工智慧的哪種生成技術?

與影像擴散模型一樣,它從雜訊開始並迭代去噪,但這裡的輸出是基於觀察的動作軌跡。

擴散策略比簡單迴歸更能解決多模態任務的哪些問題?

當多個動作有效時(例如,向左或向右抓握),回歸將它們平均為較差的中間選項;擴散可以完全致力於單一模式。

在訓練過程中,擴散策略中的網路要預測什麼?

高斯雜訊被加入到演示的動作中,而網路學習預測該雜訊(以觀察為條件),即標準去噪目標。

什麼是擴散政策中的「後退視野」重新規劃?

該策略預測大量行動,但定期使用新的觀察結果重新計劃,平衡時間一致性和反應性。