Hanyoyi-Harshen-Ayyukan Ayyuka don Robotics
Samfuran Vision-Language-Action (VLA) manyan hanyoyin sadarwa ne na jijiyoyi waɗanda ke ɗaukar hotunan kyamara tare da rubutacciyar umarni da fitar da umarnin motar robot kai tsaye.
Dubawa
They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.
Zurfafa nutsewa
Samfurin VLA yana haɗa rafuka guda uku: hangen nesa (firam ɗin kyamara), harshe (maƙasudi kamar 'sanya ƙoƙon a cikin nutsewa'), da kuma aiki (kusurwoyi na haɗin gwiwa, buɗewa / kusa, ko saurin tasiri). Google DeepMind's RT-2 ya kasance abin tarihi: ya ɗauki samfurin hangen nesa wanda aka horar da shi akan hotuna da rubutu na yanar gizo, sannan aka daidaita shi akan hanyoyin robot don haka hanyar sadarwa iri ɗaya ce zata iya amsa 'wane 'ya'yan itace wannan?' Hakanan yana fitar da ayyuka masu alama azaman rubutu. Buɗe samfura kamar OpenVLA (ma'auni na 7B) da kuma Pi-0 na Intelligence na Jiki. Mahimmanci, waɗannan samfuran suna nuna canja wurin 'gaggawa': ilimin gidan yanar gizo (gane tambarin alama, fahimtar 'ƙaramin') yana ɗauka cikin magudi, don haka robot ɗin gabaɗaya ga abubuwa da umarnin da bai taɓa gani ba yayin horon robot.
Fahimtar Fasaha
Yawancin VLAs suna ɓarna ayyukan ci gaba a cikin alamomi don haka mai canzawa zai iya tsinkayar su ta atomatik, kamar kalmomi. RT-2 taswirar kowane nau'i na aiki zuwa ɗayan bins 256 kuma yana fitar da su azaman sigar rubutu. Sabbin ƙira irin su pi-0 suna haɗe da watsawa ko kwarara-madaidaicin 'kwararre na ayyuka' kan kashin baya-bayan hangen nesa mai sanyi, yana haifar da chunks mai saurin mitoci mai santsi (misali, 50 Hz) maimakon matakai masu hankali guda ɗaya, haɓaka ƙima.
Dabarun Tasiri
Gudu da sikelin
Kayayyakin AI na iya sarrafa aiki da bincike, ganowa, da ayyuka masu alama a sikelin.
Gina zaɓuɓɓuka
Ƙungiyoyin ƙirƙira za su iya samar da ra'ayoyi cikin sauri tare da ƙarancin bita da hannu.
Ƙungiya da aikin aiki
Ayyuka na iya amfani da siginar hoto da bidiyo waɗanda a baya suke da wahalar aiwatarwa.
Makomar Hanyoyi-Harshen-Ayyukan Samfura don Robotics
Yi tsammanin manyan bayanan bayanan giciye (yunƙurin Buɗewar X-Embodiment ya riga ya tattara bayanai daga nau'ikan mutum-mutumi 22+) don haka ƙirar ɗaya tana sarrafa makamai, ɗan adam, da sansanonin wayar hannu. Bincike yana turawa zuwa ga saurin fahimta don sarrafa lokaci na ainihi, 3D mafi arziƙi da abubuwan shigar da hankali, da sarƙoƙin tunani inda ƙirar ta 'tunani' kafin yin aiki. Manufar ita ce manufar gama gari guda ɗaya da za ku iya faɗakar da ita cikin bayyanannen Ingilishi, tare da gyaran kan-tashi, kamar yin hira da mataimaki.
Aiwatar da Gaskiyar Duniya
RT-2 yana sarrafa robot Google don ' matsar da ayaba zuwa lamba 3' ta amfani da lambobi da aka koya daga rubutun yanar gizo, ba demos robot.
OpenVLA, samfurin 7B mai buɗe ido, wanda aka tsara shi ta hanyar labs don gudanar da zaɓin tebur da wuri akan makamai masu arha.
Wanke kayan wanki na Intelligence's Pi-0 da share tebur ta hanyar ɗaure ƙananan fasaha da yawa daga umarni ɗaya.
Wani hannun ma'ajiya ya gaya wa 'ka ɗauki abu mafi rauni' kuma ya faɗi abin da yake daga kamanninsa na gani
Hatsari & Tsare-tsare
Haƙƙoƙin hoto da yarda na iya zama haxarin doka idan ba a fayyace ba.
Ayyukan samfuri na iya bambanta a ko'ina cikin haske, ƙididdiga, da mahalli.
Ƙarya tabbataccen ƙila ba za a iya lura da shi ba sai dai idan an kula da ƙofofin amincewa.
Taswirar Hanya
Ƙayyade ma'auni na karɓa don daidaito, tunowa, da farashi na kuskure.
Gwada tare da bayanan da suka dace da ainihin yanayin samarwa.
Ƙara bita na ɗan adam don ƙarancin amincewa ko tsinkaya mai tasiri.
Bi diddigin ƙirar ƙira kuma sake ingantawa bayan canje-canjen kamara ko saitin bayanai.
Ci gaba da Bincike
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision-Language-Action Models for Robotics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Jagora na gaba
CLIP da Samfuran Harshen Hangen nesa
Tambayoyin da ake yawan yi
What is Vision-Language-Action Models for Robotics?
Samfuran Vision-Language-Action (VLA) manyan hanyoyin sadarwa ne na jijiyoyi waɗanda ke ɗaukar hotunan kyamara tare da rubutacciyar umarni da fitar da umarnin motar robot kai tsaye. Suna da mahimmanci saboda suna kawo ma'anar gama gari na ƙirar tushe zuwa injina na zahiri, barin ƙirar ɗaya ta sarrafa mutum-mutumi a cikin ɗawainiya da yawa maimakon sanya hannu a kowane hali.
Wadanne nau'o'in shigarwa/fitarwa guda uku ne suka ayyana samfurin Vision-Language-Action (VLA)?
VLA tana ɗaukar hangen nesa (hotuna) tare da burin harshe kuma tana fitar da ayyuka (umarnin mota), haɗakar fahimta, bin koyarwa, da sarrafawa.
Ta yaya Google DeepMind's RT-2 ya wakilci ayyukan mutum-mutumi ta yadda na'urar wuta za ta iya samar da su?
RT-2 ya ɗaure kowane nau'i na aiki zuwa alamomi masu hankali (misali, 256 bins) kuma ya fitar da su azaman kirtani, yana barin injin-samfurin harshe ya faɗi ayyuka kamar kalmomi.
Menene ma'anar 'canja wurin gaggawa' a cikin mahallin VLAs?
Saboda VLAs suna farawa daga nau'ikan yaren hangen nesa da aka horar akan yanar gizo, ilimi kamar gane tambura ko fahimtar 'ƙaramin' yana canjawa zuwa ayyukan magudin da ba a taɓa gani a cikin bayanan mutum-mutumi ba.
Menene mabuɗin fa'ida na pi-0's diffusion/flow-matching head function idan aka kwatanta da sahihan ayyuka guda ɗaya?
Maimakon mataki ɗaya mai hankali a lokaci guda, pi-0 yana samar da ci gaba da aiki chunks a babban mitar, yana ba da damar motsi mai sauƙi da sauƙi.
Me yasa Bude X-Embodiment datasetset ke da mahimmanci ga VLAs?
Buɗe X-Embodiment yana haɗa hanyoyi daga mutummutumi daban-daban, yana taimakawa manufofin jirgin ƙasa waɗanda ke jujjuya makamai, sansanonin wayar hannu, da sauran abubuwa.