นโยบายการแพร่กระจายสำหรับการควบคุมหุ่นยนต์
นโยบายการแพร่กระจายใช้แนวคิดการลดสัญญาณรบกวนแบบเดียวกันเบื้องหลังตัวสร้างภาพ เช่น การกระจายแสงที่เสถียรกับการควบคุมหุ่นยนต์: แทนที่จะคาดการณ์การกระทำถัดไปเพียงอย่างเดียว มันสร้างลำดับสั้น ๆ ของการกระทำในอนาคตทั้งหมดโดยการปรับปรุงสัญญาณรบกวนซ้ำ ๆ
ภาพรวม
It matters because it handles the messy, multi-modal nature of real manipulation far better than older methods.
เจาะลึก
นโยบายการแพร่กระจาย (Diffusion Policy) เปิดตัวในปี 2023 โดยนักวิจัยจากโคลัมเบีย, เอ็มไอที และสถาบันวิจัยโตโยต้า โดยปรับกรอบการเรียนรู้ด้วยการมองเห็นด้วยมอเตอร์เป็นการลดสัญญาณรบกวนแบบมีเงื่อนไข เมื่อพิจารณาจากภาพจากกล้องและสถานะของหุ่นยนต์ล่าสุด มันเริ่มต้นจากสัญญาณรบกวนแบบสุ่มและดำเนินขั้นตอนการลดสัญญาณรบกวนหลายขั้นตอนเพื่อสร้าง 'ฉากแอ็คชั่น' — พูด 8 ถึง 16 ครั้งถัดไปของท่าเอนด์เอฟเฟกต์เตอร์ ชัยชนะครั้งใหญ่คือการมีหลากหลายรูปแบบ: เมื่องานมีวิธีแก้ปัญหาที่ถูกต้องหลายประการ (คุณสามารถหยิบแก้วจากซ้ายหรือขวาได้) การถดถอยแบบดั้งเดิมจะเฉลี่ยให้เป็นการกระทำตรงกลางที่ไม่ดี ในขณะที่แบบจำลองการแพร่กระจายสามารถกระทำในโหมดเดียวได้อย่างหมดจด นอกจากนี้ยังเรียนรู้ได้อย่างเสถียรจากการสาธิตของมนุษย์ (การโคลนพฤติกรรม) และรับมือกับพื้นที่การกระทำที่มีมิติสูงได้ดี ทำให้เป็นตัวเลือกเริ่มต้นในระบบการจัดการสมัยใหม่หลายระบบ
ข้อมูลเชิงลึกทางเทคนิค
การฝึกอบรมจะเพิ่มสัญญาณรบกวนแบบเกาส์เซียนเพื่อแสดงลำดับการกระทำ และสอนเครือข่าย (มักเป็น U-Net หรือหม้อแปลงไฟฟ้า) เพื่อทำนายสัญญาณรบกวนนั้น โดยมีเงื่อนไขจากการสังเกตด้วยสายตาและการรับรู้การรับรู้ ในขณะรันไทม์ ระบบจะปฏิเสธจากตัวอย่างแบบสุ่มในไม่กี่ขั้นตอน (DDPM/DDIM) เพื่อให้ได้วิถีการกระทำ การคาดการณ์ชิ้นส่วนบวกกับการวางแผนใหม่แบบ 'ขอบฟ้าที่กำลังถอย' จะทำให้มีความสอดคล้องกันชั่วคราวในขณะที่ยังคงตอบสนองต่อการสังเกตใหม่ๆ
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
นโยบายการแพร่กระจายในอนาคตสำหรับการควบคุมหุ่นยนต์
งานกำลังลดจำนวนขั้นตอนการลดสัญญาณรบกวน (ผ่านโมเดลความสอดคล้องและการจับคู่โฟลว์) ดังนั้นนโยบายจึงทำงานที่อัตราการควบคุมสูงบนฮาร์ดแวร์จริง หัวการดำเนินการการแพร่กระจายถูกยึดเข้ากับแบ็คโบนภาษาการมองเห็นขนาดใหญ่เพื่อสร้าง VLA และตัวแปรที่รับรู้ 3 มิติและตัวแปรที่เทียบเท่าช่วยปรับปรุงประสิทธิภาพของตัวอย่าง คาดว่าการควบคุมแบบแพร่กระจายจะยังคงเป็นองค์ประกอบหลักใน 'สมอง' ของหุ่นยนต์ทั่วไปที่ขับเคลื่อนงานที่คล่องแคล่วและแบบใช้คนสองมือ
การใช้งานจริงในโลกแห่งความเป็นจริง
แขนหุ่นยนต์ดันบล็อกรูปตัว T เข้าไปในท่าเป้าหมาย ซึ่งเป็นเกณฑ์มาตรฐานที่นโยบายการแพร่กระจายมีประสิทธิภาพเหนือกว่าวิธีการโคลนนิ่งพฤติกรรมก่อนหน้านี้อย่างเห็นได้ชัด
หุ่นยนต์สองมือเรียนรู้งานครัวที่ละเอียดอ่อน เช่น การพลิกอาหารหรือการประกอบชิ้นส่วนจากการสาธิตการทำงานทางไกลของมนุษย์
การเลือกถังรกที่มีการจัดการที่ถูกต้องหลายรายการ และนโยบายยอมรับหนึ่งรายการแทนที่จะหาค่าเฉลี่ย
โมดูล Action-head ภายในระบบการมองเห็น ภาษา และการกระทำที่สร้างการเคลื่อนไหวความถี่สูงที่ราบรื่นสำหรับมือที่คล่องแคล่ว
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Diffusion Policy for Robot Control quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
Stable Diffusion
คำถามที่พบบ่อย
What is Diffusion Policy for Robot Control?
นโยบายการแพร่กระจายใช้แนวคิดการลดสัญญาณรบกวนแบบเดียวกันเบื้องหลังตัวสร้างภาพ เช่น การกระจายแสงที่เสถียรกับการควบคุมหุ่นยนต์: แทนที่จะคาดการณ์การกระทำถัดไปเพียงอย่างเดียว มันสร้างลำดับสั้น ๆ ของการกระทำในอนาคตทั้งหมดโดยการปรับปรุงสัญญาณรบกวนซ้ำ ๆ มันสำคัญเพราะมันจัดการกับลักษณะการจัดการที่แท้จริงที่ยุ่งเหยิงและหลากหลายรูปแบบได้ดีกว่าวิธีการแบบเก่ามาก
นโยบายการแพร่กระจายก่อให้เกิดอะไรในแต่ละจุดการตัดสินใจ?
นโยบายการแพร่กระจายจะสร้างส่วนการดำเนินการ — หลายขั้นตอนในอนาคตของการดำเนินการ — โดยการปฏิเสธ แทนที่จะแยกคำสั่งเดียว
เทคนิคการกำเนิดใดที่ยืมมาจาก Image AI
เช่นเดียวกับโมเดลการแพร่กระจายของภาพ มันเริ่มต้นจากสัญญาณรบกวนและ denoise ซ้ำๆ แต่ที่นี่ผลลัพธ์ที่ได้คือวิถีการกระทำที่มีเงื่อนไขจากการสังเกต
นโยบายการแพร่กระจายของปัญหาของงานหลายรูปแบบแก้ปัญหาได้ดีกว่าการถดถอยแบบธรรมดาอย่างไร
เมื่อการกระทำหลายอย่างถูกต้อง (เช่น จับซ้ายหรือขวา) การถดถอยจะเฉลี่ยการกระทำเหล่านั้นให้เป็นตัวเลือกตรงกลางที่ไม่ดี การแพร่กระจายสามารถกระทำในโหมดเดียวได้อย่างหมดจด
ในระหว่างการฝึกอบรม เครือข่ายใน Diffusion Policy สอนให้คาดการณ์อะไรบ้าง
เสียงแบบเกาส์เซียนจะถูกเพิ่มเข้าไปในการแสดงการกระทำ และเครือข่ายจะเรียนรู้ที่จะทำนายเสียงนั้น (มีเงื่อนไขจากการสังเกต) ซึ่งเป็นวัตถุประสงค์การลดเสียงรบกวนมาตรฐาน
การวางแผนใหม่ 'ขอบฟ้าถอย' ในนโยบายการแพร่กระจายคืออะไร
นโยบายคาดการณ์การดำเนินการบางส่วน แต่จะมีการวางแผนใหม่เป็นระยะโดยใช้ข้อสังเกตใหม่ โดยรักษาสมดุลระหว่างความสอดคล้องชั่วคราวกับปฏิกิริยา