Görsel Yapay Zeka KILAVUZU

Robot Kontrolüne İlişkin Yayılma Politikası

Difüzyon Politikası, Stabil Difüzyon gibi görüntü oluşturucuların arkasındaki aynı gürültü giderici fikri robot kontrolüne uygular: tek bir sonraki eylemi tahmin etmek yerine, gürültüyü yinelemeli olarak iyileştirerek gelecekteki eylemlerin kısa bir dizisini üretir.

2 min readSon güncelleme

Genel Bakış

It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.

Derin Dalış

Columbia, MIT ve Toyota Araştırma Enstitüsü'ndeki araştırmacılar tarafından 2023 yılında tanıtılan Difüzyon Politikası, görsel-motor öğrenmeyi koşullu gürültü giderme olarak yeniden çerçeveliyor. En son kamera görüntüleri ve robot durumu göz önüne alındığında, rastgele gürültüden başlıyor ve bir 'hareket yığını' üretmek için birkaç gürültü giderici adım atıyor - örneğin son efektör pozlarının sonraki 8 ila 16 zaman adımı. Büyük kazanç çok modluluktur: Bir görevin birden fazla geçerli çözümü olduğunda (soldan veya sağdan bir kupa alabilirsiniz), geleneksel regresyon bunları ortalama olarak kötü bir orta eyleme dönüştürürken, bir yayılma modeli temiz bir şekilde tek bir moda geçebilir. Aynı zamanda insan gösterilerinden (davranış klonlama) istikrarlı bir şekilde öğrenir ve yüksek boyutlu eylem alanlarıyla iyi bir şekilde başa çıkar, bu da onu birçok modern manipülasyon sisteminde varsayılan bir seçim haline getirir.

Teknik Bilgi

Eğitim, gösterilen eylem sekanslarına Gauss gürültüsünü ekler ve bir ağa (genellikle bir U-Net veya transformatör), görsel ve özduyusal gözlemlere bağlı olarak bu gürültüyü tahmin etmeyi öğretir. Çalışma zamanında, bir eylem yörüngesi oluşturmak için bir avuç adım (DDPM/DDIM) üzerinden rastgele örneklerden gürültü giderir. Parçaları tahmin etmek ve 'uzaklaşan ufuk' yeniden planlama, yeni gözlemlere tepkisel kalırken zamansal tutarlılık sağlar.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Robot Kontrolünde Yayılım Politikasının Geleceği

Çalışmalar, (tutarlılık modelleri ve akış eşleştirme aracılığıyla) gürültü giderme adımlarının sayısını azaltarak politikaların gerçek donanım üzerinde yüksek kontrol oranlarıyla çalışmasını sağlıyor. Difüzyon eylem kafaları, VLA'lar oluşturmak için geniş görüş dili omurgalarına cıvatalanıyor ve 3D uyumlu ve eşdeğer değişkenler numune verimliliğini artırıyor. Difüzyon tabanlı kontrolün, hünerli ve iki elle kullanılan görevleri yerine getiren genel robot 'beyinlerinde' temel bir bileşen olarak kalmasını bekliyoruz.

Gerçek Dünya Uygulaması

T şeklindeki bir bloğu hedef pozuna iten bir robot kolu; bu, Difüzyon Politikasının önceki davranış klonlama yöntemlerinden belirgin şekilde daha iyi performans gösterdiği bir referans noktasıdır

Bimanual robotlar, yiyecekleri çevirmek veya insan teleoperasyon demolarından parçaları birleştirmek gibi hassas mutfak görevlerini öğreniyor

Birden fazla geçerli kavramanın mevcut olduğu ve politikanın ortalama almak yerine bir tanesini taahhüt ettiği dağınık çöp kutusu toplama

Becerikli eller için yumuşak, yüksek frekanslı hareket üreten görüş-dil-hareket sistemlerinin içindeki hareket başlığı modülü

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Policy for Robot Control quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Stable Diffusion

Sık sorulan sorular

What is Diffusion Policy for Robot Control?

Difüzyon Politikası, Stabil Difüzyon gibi görüntü oluşturucuların arkasındaki aynı gürültü giderici fikri robot kontrolüne uygular: tek bir sonraki eylemi tahmin etmek yerine, gürültüyü yinelemeli olarak iyileştirerek gelecekteki eylemlerin kısa bir dizisini üretir. Bu önemlidir çünkü gerçek manipülasyonun karmaşık, çok modlu doğasını eski yöntemlerden çok daha iyi bir şekilde ele alır.

Yayılma Politikası her karar noktasında ne üretir?

Difüzyon Politikası, tek bir izole komut yerine gürültüyü gidererek bir eylem yığını (eylemlerin gelecekteki birkaç zaman adımı) üretir.

Yayılma Politikası görüntü yapay zekasından hangi üretken tekniği ödünç alıyor?

Görüntü yayılım modellerinde olduğu gibi, gürültüden başlar ve yinelemeli olarak gürültüyü giderir, ancak burada çıktı, gözlemlere bağlı bir eylem yörüngesidir.

Çok modlu görevlerin hangi sorununu Yayılma Politikası basit regresyondan daha iyi çözer?

Birkaç eylem geçerli olduğunda (örneğin, solu veya sağı kavramak), regresyon bunları ortalama olarak zayıf bir orta seçeneğe yönlendirir; difüzyon temiz bir şekilde tek bir moda geçebilir.

Eğitim sırasında, Yayılma Politikasındaki ağın neyi tahmin etmesi öğretiliyor?

Gösterilen eylemlere Gauss gürültüsü eklenir ve ağ, standart gürültü giderme hedefi olan bu gürültüyü (gözlemlere bağlı olarak) tahmin etmeyi öğrenir.

Yayılma Politikasında 'uzaklaşan ufuk' yeniden planlaması nedir?

Politika, bir dizi eylemi öngörüyor ancak zamansal tutarlılığı tepkisellikle dengeleyerek yeni gözlemler kullanarak periyodik olarak yeniden plan yapıyor.