Ọhụụ-Asụsụ-Ụdị omume maka Robotics
Ụdị Ọhụụ-Asụsụ-Ọrụ (VLA) bụ nnukwu netwọkụ akwara ozi na-ewere onyonyo igwefoto gbakwunyere ntuziaka edere na iwepụta iwu moto robot ozugbo.
Nchịkọta
They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.
Ime miri emi
Ihe nlereanya VLA na-ejikọta iyi atọ: ọhụụ (okirikiri igwefoto), asụsụ (ihe mgbaru ọsọ dị ka 'tinye iko n'ime sink'), na ime ihe (akụkụ ọnụ, gripper open/ close, or end-effector velocities). Google DeepMind's RT-2 bụ ihe ama ama: ọ were ụdị asụsụ ọhụụ zụrụ na onyonyo weebụ na ederede, wee mekọrịta ya nke ọma na trajectories robot ka otu netwọk ahụ nwere ike ịza 'gịnị mkpụrụ bụ nke a?' na-ewepụtakwa omume tokened dị ka ederede. Mepee ụdị dị ka OpenVLA (nkeji 7B) na ọgụgụ isi nke anụ ahụ pi-0 sochiri. N'ụzọ dị mkpa, ụdị ndị a na-egosi ịnyefe 'ngwa ngwa': ihe ọmụma weebụ (ịghọta akara ngosi akara ngosi, ịghọta 'nke nta') na-arụ ọrụ, ya mere robot na-ejikọta ihe na ntụziaka ọ na-ahụtụbeghị n'oge ọzụzụ robot.
Nghọta nka nka
Ọtụtụ VLA na-amapụ omume na-aga n'ihu n'ime akara ka onye ngbanwe nwere ike ibu amụma na-akpaghị aka, dị ka okwu. Maapụ RT-2 na-esetịpụ akụkụ omume ọ bụla gaa na otu n'ime bins 256 wee wepụta ha dị ka eriri ederede. Ụdị ọhụrụ dị ka pi-0 na-etinye mgbasa ozi ma ọ bụ na-asọba 'ọkachamara ihe omume' n'isi n'ọkpụkpụ azụ nke asụsụ ọhụụ kpọnwụrụ akpọnwụ, na-emepụta chunks dị elu dị elu (dịka, 50 Hz) kama otu usoro pụrụ iche, na-eme ka ọ dị mma.
Mmetụta atụmatụ
Ọsọ na ọnụ ọgụgụ
Visual AI nwere ike megharịa nyocha, nchọpụta na mkpado ọrụ n'ọtụtụ.
Mee nhọrọ
Otu ndị na-emepụta ihe nwere ike imepụta echiche ngwa ngwa site na ngbanwe akwụkwọ ntuziaka ole na ole.
Team na usoro ọrụ
Ọrụ nwere ike iji onyonyo na akara vidiyo siri ike ịhazi.
Ọdịnihu nke Ọhụụ-Asụsụ-Ụdị Omume maka Robotics
Na-atụ anya nnukwu datasets cross-embodiment (mgbalị Mepee X-Embodiment na-etinyerị data sitere na ụdị robot 22+) yabụ otu ụdị na-ebugharị ogwe aka, humanoids, na ntọala mkpanaka. Nchọcha na-akwalite nhọpụta ngwa ngwa maka njikwa oge, 3D bara ụba na ntinye aka, yana ụdọ echiche ebe ihe nlereanya ahụ 'na-eche' tupu ya emee ihe. Ebumnobi bụ otu amụma izugbe ị nwere ike kpalite n'asụsụ bekee dị larịị, yana mgbazi na-efe efe, dị ka iso onye inyeaka kparịta ụka.
Mmejuputa n'ezie n'ụwa
RT-2 na-achịkwa robot kichin Google iji 'bugharịa banana ahụ gaa na nọmba 3' site na iji ọnụọgụ ọ mụtara na ederede webụ, ọ bụghị ngosi robot.
OpenVLA, ihe ngosi 7B mepere emepe, nke ụlọ nyocha na-eme nke ọma ka ọ na-etinye tebụl na ebe dị ọnụ ala.
Ọgụgụ isi nke anụ ahụ pi-0 na-ehicha akwa ma na-ekpochapụ tebụl site na ijikọ ọtụtụ obere nka site na otu nkuzi.
Otu ogwe aka ụlọ nkwakọba ihe gwara 'buru ihe kacha emebi emebi' wee chepụta ihe sitere na ọdịdị anya ya
Ihe ize ndụ & okporo ụzọ nche
Ikike onyonyo na nkwenye nwere ike bụrụ ihe egwu dị n'iwu ma ọ bụrụ na edoghị anya.
Ọrụ nlereanya nwere ike ịdịgasị iche n'ofe ọkụ, igwe mmadụ, na gburugburu.
Enwere ike ghara ịhụ ihe dị mma ma ọ bụrụ na enyochaghị oke ntụkwasị obi.
Map mmejuputa
Kọwaa ụkpụrụ nnabata maka nkenke, icheta, na ụgwọ njehie.
Nwalee na data dabara na ọnọdụ mmepụta n'ezie.
Tinye nyocha mmadụ maka obere obi ike ma ọ bụ amụma mmetụta dị elu.
Sochie ihe nlere anya wee megharịa ka emechara mgbanwe igwefoto ma ọ bụ dataset.
Nọgide na-eme nchọpụta
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision-Language-Action Models for Robotics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Ntuziaka na-esote
Ụdị CLIP na Ọhụụ-Asụsụ
Ajụjụ a na-ajụkarị
What is Vision-Language-Action Models for Robotics?
Ụdị Ọhụụ-Asụsụ-Ọrụ (VLA) bụ nnukwu netwọkụ akwara ozi na-ewere onyonyo igwefoto gbakwunyere ntuziaka edere na iwepụta iwu moto robot ozugbo. Ha dị mkpa n'ihi na ha na-ebute nghọta zuru oke nke ụdị ntọala na igwe anụ ahụ, na-ahapụ ka otu ụdị chịkwaa robot n'ọtụtụ ọrụ kama iji aka na-edepụta àgwà ọ bụla.
Kedu ụdị ntinye/mmepụta atọ na-akọwapụta ụdị ọhụụ-asụsụ-omume (VLA)?
VLA na-ewere ọhụụ (onyinyo) gbakwunyere ebumnuche asụsụ wee wepụta omume (iwu moto), imekọ nghọta, nkuzi na njikwa.
Kedu ka Google DeepMind's RT-2 siri nọchite anya omume robot ka ihe ngbanwe nwere ike imepụta ha?
RT-2 jikọtara akụkụ omume ọ bụla n'ime akara ngosi pụrụ iche (dịka ọmụmaatụ, 256 bins) wee wepụta ha dị ka eriri, na-ahapụ ka igwe-ụdị asụsụ buru amụma omume dị ka okwu.
Kedu ihe 'nbufe ngwa ngwa' pụtara na ọnọdụ nke VLAs?
N'ihi na VLA na-amalite site na ụdị asụsụ ọhụụ zụrụ na webụ, ihe ọmụma dị ka ịmata akara ngosi ma ọ bụ ịghọta 'nke nta' na-ebufe na ọrụ aghụghọ ahụbeghị na data robot.
Kedu uru bụ isi nke isi mgbasa ozi pi-0 na isi ihe na-adaba adaba ma e jiri ya tụnyere otu akara ngosi ihe pụrụ iche?
Kama otu nzọụkwụ pụrụ iche n'otu oge, pi-0 na-emepụta ihe na-aga n'ihu na-eme ihe n'ogo dị elu, na-eme ka ọ dịkwuo nro na nke na-adịghị mma.
Kedu ihe kpatara Open X-Embodiment dataset ji dị mkpa maka VLA?
Mepee X-Embodiment na-ejikọta trajectories sitere na ọtụtụ robots dị iche iche, na-enyere atumatu ụgbọ oloko aka na-agafe n'ofe ogwe aka, ntọala mkpanaka na ihe ndị ọzọ.