โมเดลการมองเห็น-ภาษา-การกระทำสำหรับวิทยาการหุ่นยนต์
โมเดล Vision-Language-Action (VLA) เป็นโครงข่ายประสาทเทียมขนาดใหญ่ที่ถ่ายภาพจากกล้องพร้อมคำแนะนำที่เป็นลายลักษณ์อักษรและส่งออกคำสั่งมอเตอร์หุ่นยนต์โดยตรง
ภาพรวม
They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.
เจาะลึก
แบบจำลอง VLA หลอมรวมสามกระแส: การมองเห็น (เฟรมกล้อง) ภาษา (เป้าหมายเช่น 'วางถ้วยลงในอ่างล้างจาน') และการกระทำ (มุมที่ข้อต่อ การเปิด/ปิดของกริปเปอร์ หรือความเร็วของเอฟเฟกต์ที่ปลาย) Google RT-2 ของ DeepMind ถือเป็นจุดสังเกต โดยต้องใช้โมเดลภาษาการมองเห็นที่ฝึกฝนเกี่ยวกับรูปภาพและข้อความบนเว็บ จากนั้นจึงปรับแต่งร่วมกันบนวิถีการเคลื่อนที่ของหุ่นยนต์ เพื่อให้เป็นเครือข่ายเดียวกันที่สามารถตอบได้ว่า 'นี่คือผลไม้อะไร' ยังส่งเสียงการกระทำที่โทเค็นเป็นข้อความด้วย โมเดลเปิดเช่น OpenVLA (พารามิเตอร์ 7B) และ pi-0 ของ Physical Intelligence ตามมา สิ่งสำคัญที่สุดคือ โมเดลเหล่านี้แสดงให้เห็นถึงการถ่ายโอนแบบ 'ฉุกเฉิน': ความรู้ทางเว็บ (การจดจำโลโก้ของแบรนด์ การทำความเข้าใจ 'โลโก้ที่เล็กกว่า') นำไปสู่การยักยอก ดังนั้นหุ่นยนต์จึงสรุปกับวัตถุและคำแนะนำที่ไม่เคยเห็นในระหว่างการฝึกหุ่นยนต์
ข้อมูลเชิงลึกทางเทคนิค
VLA จำนวนมากแยกการกระทำที่ต่อเนื่องออกเป็นโทเค็น เพื่อให้หม้อแปลงสามารถคาดเดาการกระทำเหล่านั้นแบบถดถอยอัตโนมัติ เช่นเดียวกับคำพูด RT-2 แมปแต่ละมิติการกระทำกับหนึ่งใน 256 ถังขยะ และปล่อยเป็นสตริงข้อความ การออกแบบที่ใหม่กว่าเช่น pi-0 ติดหัว 'ผู้เชี่ยวชาญด้านการดำเนินการ' ที่แพร่กระจายหรือจับคู่การไหลเข้ากับกระดูกสันหลังของภาษาการมองเห็นที่แช่แข็ง สร้างชิ้นส่วนการกระทำความถี่สูงที่ราบรื่น (เช่น 50 Hz) แทนที่จะเป็นขั้นตอนเดียวที่แยกจากกัน ปรับปรุงความคล่องแคล่ว
ผลกระทบเชิงกลยุทธ์
ความเร็วและขนาด
Visual AI สามารถทำให้การตรวจสอบ การตรวจจับ และการแท็กเป็นอัตโนมัติในขนาดต่างๆ
สร้างทางเลือก
ทีมสร้างสรรค์สามารถสร้างต้นแบบแนวคิดได้รวดเร็วขึ้นโดยต้องมีการแก้ไขด้วยตนเองน้อยลง
ทีมงานและขั้นตอนการทำงาน
การดำเนินการสามารถใช้สัญญาณภาพและวิดีโอที่ก่อนหน้านี้ประมวลผลได้ยาก
อนาคตของแบบจำลองการมองเห็น ภาษา การกระทำสำหรับวิทยาการหุ่นยนต์
คาดว่าจะมีชุดข้อมูลข้ามรูปลักษณ์ที่ใหญ่กว่า (ความพยายามของ Open X-Embodiment ได้รวบรวมข้อมูลจากหุ่นยนต์มากกว่า 22 ประเภทแล้ว) ดังนั้นโมเดลหนึ่งจึงขับเคลื่อนแขน หุ่นยนต์ฮิวแมนนอยด์ และฐานเคลื่อนที่ การวิจัยผลักดันไปสู่การอนุมานที่รวดเร็วยิ่งขึ้นสำหรับการควบคุมแบบเรียลไทม์ อินพุต 3 มิติและสัมผัสที่สมบูรณ์ยิ่งขึ้น และห่วงโซ่การให้เหตุผลที่โมเดล 'คิด' ก่อนดำเนินการ เป้าหมายคือนโยบายทั่วไปเดียวที่คุณสามารถแจ้งเป็นภาษาอังกฤษธรรมดา พร้อมการแก้ไขได้ทันที เหมือนกับการพูดคุยกับผู้ช่วย
การใช้งานจริงในโลกแห่งความเป็นจริง
RT-2 ควบคุมหุ่นยนต์ในครัว Google เพื่อ 'ย้ายกล้วยไปที่หมายเลข 3' โดยใช้ตัวเลขที่เรียนรู้จากข้อความเว็บ ไม่ใช่การสาธิตหุ่นยนต์
OpenVLA ซึ่งเป็นโมเดลโอเพ่นซอร์ส 7B ได้รับการปรับแต่งโดยห้องปฏิบัติการเพื่อดำเนินการเลือกและวางบนโต๊ะบนแขนที่มีต้นทุนต่ำ
การซักผ้าแบบพับ pi-0 ของ Physical Intelligence และการเคลียร์โต๊ะโดยการเชื่อมโยงทักษะย่อยมากมายจากคำสั่งเดียว
แขนโกดังบอกว่า 'เลือกสิ่งของที่เปราะบางที่สุด' และอนุมานได้ว่าวัตถุใดที่มาจากรูปลักษณ์ภายนอก
ความเสี่ยงและรั้ว
สิทธิ์และความยินยอมในรูปภาพอาจกลายเป็นความเสี่ยงทางกฎหมายได้หากแหล่งที่มาไม่ชัดเจน
ประสิทธิภาพของโมเดลอาจแตกต่างกันไปตามสภาพแสง ข้อมูลประชากร และสภาพแวดล้อม
ผลบวกลวงอาจไม่สังเกตเห็นเว้นแต่จะมีการตรวจสอบเกณฑ์ความเชื่อมั่น
แผนงานการดำเนินงาน
กำหนดเกณฑ์การยอมรับสำหรับความแม่นยำ การเรียกคืน และต้นทุนข้อผิดพลาด
ทดสอบด้วยข้อมูลที่ตรงกับเงื่อนไขการผลิตจริง
เพิ่มการตรวจสอบโดยเจ้าหน้าที่สำหรับการคาดการณ์ที่มีความมั่นใจต่ำหรือมีผลกระทบสูง
ติดตามการเคลื่อนตัวของโมเดลและตรวจสอบความถูกต้องอีกครั้งหลังจากการเปลี่ยนแปลงกล้องหรือชุดข้อมูล
สำรวจต่อไป
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision-Language-Action Models for Robotics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
คำแนะนำต่อไป
CLIP และโมเดลภาษาวิสัยทัศน์
คำถามที่พบบ่อย
What is Vision-Language-Action Models for Robotics?
โมเดล Vision-Language-Action (VLA) เป็นโครงข่ายประสาทเทียมขนาดใหญ่ที่ถ่ายภาพจากกล้องพร้อมคำแนะนำที่เป็นลายลักษณ์อักษรและส่งออกคำสั่งมอเตอร์หุ่นยนต์โดยตรง สิ่งเหล่านี้มีความสำคัญเพราะพวกเขานำสามัญสำนึกที่กว้างขวางของแบบจำลองพื้นฐานมาสู่เครื่องจักรทางกายภาพ โดยปล่อยให้แบบจำลองหนึ่งตัวควบคุมหุ่นยนต์ในงานต่างๆ มากมาย แทนที่จะเขียนโค้ดแต่ละพฤติกรรมด้วยมือ
อินพุต/เอาท์พุตสามประเภทใดที่กำหนดโมเดล Vision-Language-Action (VLA)
VLA นำการมองเห็น (ภาพ) บวกกับเป้าหมายทางภาษาและส่งออกการกระทำ (คำสั่งของมอเตอร์) การรับรู้ที่เป็นหนึ่งเดียว การปฏิบัติตามคำสั่ง และการควบคุม
Google RT-2 ของ DeepMind เป็นตัวแทนการกระทำของหุ่นยนต์เพื่อที่หม้อแปลงไฟฟ้าจะสร้างการกระทำเหล่านี้ได้อย่างไร
RT-2 รวบรวมแต่ละมิติการกระทำเป็นโทเค็นแยกกัน (เช่น 256 ถังขยะ) และปล่อยออกมาเป็นสตริง เพื่อให้กลไกแบบจำลองภาษาทำนายการกระทำเช่นคำพูด
'การโอนฉุกเฉิน' หมายถึงอะไรในบริบทของ VLA
เนื่องจาก VLA เริ่มต้นจากแบบจำลองภาษาการมองเห็นที่ได้รับการฝึกบนเว็บ ความรู้เช่นการจดจำโลโก้หรือความเข้าใจ 'โลโก้ที่เล็กกว่า' จึงถ่ายโอนไปยังงานจัดการที่ไม่เคยพบเห็นในข้อมูลหุ่นยนต์
อะไรคือข้อได้เปรียบที่สำคัญของหัวการดำเนินการแบบกระจาย/การจับคู่การไหลของ pi-0 เมื่อเปรียบเทียบกับโทเค็นการดำเนินการแบบแยกเดี่ยว
แทนที่จะแยกทีละขั้นตอน pi-0 จะสร้างชิ้นส่วนการทำงานต่อเนื่องที่ความถี่สูง ช่วยให้การเคลื่อนไหวราบรื่นและกระฉับกระเฉงยิ่งขึ้น
เหตุใดชุดข้อมูล Open X-Embodiment จึงมีความสำคัญสำหรับ VLA
Open X-Embodiment รวมวิถีจากหุ่นยนต์ต่างๆ มากมาย ช่วยฝึกนโยบายที่ถ่ายโอนข้ามแขน ฐานเคลื่อนที่ และรูปลักษณ์อื่นๆ