ራዕይ-ቋንቋ-የድርጊት ሞዴሎች ለሮቦቲክስ
ቪዥን-ቋንቋ-ድርጊት (VLA) ሞዴሎች የካሜራ ምስሎችን እና የጽሑፍ መመሪያን የሚወስዱ እና የሮቦት ሞተር ትዕዛዞችን በቀጥታ የሚያወጡ ትልልቅ የነርቭ አውታሮች ናቸው።
አጠቃላይ እይታ
They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.
ጥልቅ ዳይቭ
የVLA ሞዴል ሶስት ዥረቶችን ያዋህዳል፡ ራዕይ (የካሜራ ፍሬሞች)፣ ቋንቋ (እንደ 'ጽዋውን በመታጠቢያ ገንዳ ውስጥ ማስገባት' ያለ ግብ) እና እርምጃ (የጋራ ማዕዘኖች፣ ግሪፐር ክፍት/ቅርብ፣ ወይም የመጨረሻ ውጤት ፍጥነቶች)። Google DeepMind's RT-2 ትልቅ ምልክት ነበር፡ በድር ምስሎች እና ፅሁፍ ላይ የሰለጠነ የራዕይ-ቋንቋ ሞዴል ወስዷል፣ከዚያም በሮቦት ዱካዎች ላይ በደንብ አስተካክለው 'ይህ ምን ፍሬ ነው?' የሚል መልስ የሚሰጥ ተመሳሳይ አውታረ መረብ ነው። እንደ ጽሑፍ ምልክት የተደረጉ ድርጊቶችንም ያስወጣል። እንደ OpenVLA (7B መለኪያዎች) እና ፊዚካል ኢንተለጀንስ ፒ-0 ያሉ ሞዴሎችን ተከትለዋል። በወሳኝ መልኩ፣ እነዚህ ሞዴሎች 'ድንገተኛ' ማስተላለፍን ያሳያሉ፡ የድረ-ገጽ እውቀት (ብራንድ ሎጎን ማወቅ፣ 'ትንሹን' መረዳት) ወደ ማጭበርበር ይሸጋገራል፣ ስለዚህ ሮቦቱ በሮቦት ስልጠና ወቅት አይቷቸው የማታውቁትን ነገሮች እና መመሪያዎችን ጠቅለል አድርጎ ያሳያል።
ቴክኒካዊ ግንዛቤ
አንድ ትራንስፎርመር ልክ እንደ ቃላቶች በራስ-ሰር መተንበይ እንዲችል ብዙ VLAዎች ቀጣይነት ያላቸውን ድርጊቶች ወደ ቶከኖች ይለያሉ። RT-2 እያንዳንዱን የእርምጃ ልኬት ከ256 ቢን ወደ አንዱ ያዘጋጃል እና እንደ የጽሑፍ ሕብረቁምፊ ያስወጣቸዋል። እንደ ፒ-0 ያሉ አዳዲስ ዲዛይኖች ስርጭትን ወይም ፍሰትን የሚዛመድ 'የድርጊት ኤክስፐርት' ጭንቅላትን ወደ በረዶ የእይታ-ቋንቋ የጀርባ አጥንት ያያይዙታል፣ ይህም በነጠላ ርምጃዎች ምትክ ለስላሳ ከፍተኛ ድግግሞሽ (ለምሳሌ 50 ኸርዝ) በመፍጠር ቅልጥፍናን ያሻሽላል።
ስልታዊ ተጽእኖ
ፍጥነት እና ልኬት
ቪዥዋል AI የመመርመሪያ፣ የማወቅ እና የመለያ ስራዎችን በሚዛን መጠን በራስ ሰር ሊያደርግ ይችላል።
ምርጫዎችን ይገንቡ
የፈጠራ ቡድኖች በጥቂት የእጅ ክለሳዎች ጽንሰ-ሀሳቦችን በፍጥነት መተየብ ይችላሉ።
ቡድን እና የስራ ፍሰት
ክዋኔዎች ከዚህ ቀደም ለማስኬድ አስቸጋሪ የነበሩትን የምስል እና የቪዲዮ ምልክቶችን መጠቀም ይችላሉ።
የወደፊት የራዕይ-ቋንቋ-ድርጊት ሞዴሎች ለሮቦቲክስ
ትላልቅ የተሻገሩ ዳታ ስብስቦችን ይጠብቁ (የOpen X-Embodiment ጥረት ቀድሞውኑ ከ22+ የሮቦት አይነቶች መረጃን ያጠራቅማል) ስለዚህ አንድ ሞዴል ክንዶችን፣ ሰዉኦይድ እና የሞባይል መሰረትን ይነዳል። ምርምሩ ለትክክለኛ ጊዜ ቁጥጥር፣ ለበለጸጉ 3D እና የሚዳሰሱ ግብአቶች እና አምሳያው ከመተግበሩ በፊት 'ያሰበበትን' የማመዛዘን ሰንሰለቶችን ወደ ፈጣን ግንዛቤ ይገፋል። ግቡ ከረዳት ጋር እንደመነጋገር በበረራ ላይ እርማት በቀላል እንግሊዝኛ መጠየቅ የምትችለው ነጠላ አጠቃላይ ፖሊሲ ነው።
የእውነተኛ-ዓለም አተገባበር
RT-2 የ Google ኩሽና ሮቦትን በመቆጣጠር ሙዙን ወደ ቁጥር 3 ለማንቀሳቀስ ከድር ጽሁፍ የተማረውን አሃዝ በመጠቀም እንጂ የሮቦት ማሳያዎችን አይደለም
OpenVLA፣ ክፍት ምንጭ 7B ሞዴል፣ በዝቅተኛ ዋጋ ክንዶች ላይ የጠረጴዛ መረጣ እና ቦታን ለማሄድ በቤተ ሙከራ የተስተካከለ
የአካላዊ ኢንተለጀንስ ፒ -0 ታጣፊ የልብስ ማጠቢያ እና ጠረጴዛን ማጽዳት ከአንድ መመሪያ ብዙ ንዑስ ክህሎትን በማሰር
አንድ የመጋዘን ክንድ 'በጣም ደካማ የሆነውን ነገር ምረጥ' እና የትኛውን ነገር በምስላዊ መልኩ እንደሚገምት ተናገረ
አደጋዎች እና የጥበቃ መንገዶች
የምስል መብቶች እና ፈቃድ ግልጽ ካልሆነ ህጋዊ አደጋዎች ሊሆኑ ይችላሉ።
የሞዴል አፈጻጸም በብርሃን፣ በስነ-ሕዝብ እና በአካባቢው ሊለያይ ይችላል።
የመተማመን ገደቦች ካልተቆጣጠሩ የውሸት አወንታዊ ነገሮች ላይታዩ ይችላሉ።
የትግበራ ፍኖተ ካርታ
ለትክክለኛነት፣ ለማስታወስ እና ለስህተት ወጪዎች የመቀበያ መስፈርቶችን ይግለጹ።
ከእውነተኛ የምርት ሁኔታዎች ጋር በሚዛመድ ውሂብ ይሞክሩ።
ለዝቅተኛ እምነት ወይም ከፍተኛ ተጽዕኖ ትንበያ የሰው ግምገማን ያክሉ።
ከካሜራ ወይም የውሂብ ስብስብ ለውጦች በኋላ የሞዴሉን ተንሸራታች ይከታተሉ እና እንደገና ያረጋግጡ።
ማሰስዎን ይቀጥሉ
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Vision-Language-Action Models for Robotics quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
ቀጣይ መመሪያ
CLIP እና ራዕይ-ቋንቋ ሞዴሎች
በተደጋጋሚ የሚጠየቁ ጥያቄዎች
What is Vision-Language-Action Models for Robotics?
ቪዥን-ቋንቋ-ድርጊት (VLA) ሞዴሎች የካሜራ ምስሎችን እና የጽሑፍ መመሪያን የሚወስዱ እና የሮቦት ሞተር ትዕዛዞችን በቀጥታ የሚያወጡ ትልልቅ የነርቭ አውታሮች ናቸው። እነሱ አስፈላጊ ናቸው ምክንያቱም ሰፊውን የጋራ የመሠረት ሞዴሎችን ወደ አካላዊ ማሽኖች በማምጣት አንድ ሞዴል ሮቦትን እያንዳንዱን ባህሪ በእጅ ከመፃፍ ይልቅ በብዙ ስራዎች ላይ እንዲቆጣጠር ያስችለዋል።
ራዕይ-ቋንቋ-ድርጊት (VLA) ሞዴልን የሚገልጹት የትኞቹ ሶስት የግብአት/ውፅዓት ዓይነቶች ናቸው?
VLA ራዕይን (ምስሎችን) እና የቋንቋ ግብን ይወስዳል እና እርምጃዎችን (የሞተር ትዕዛዞችን) ፣ ግንዛቤን ፣ ትምህርትን እና ቁጥጥርን ያወጣል።
እንዴት Google DeepMind's RT-2 ትራንስፎርመር እንዲያመነጭ የሮቦት ድርጊቶችን ይወክላል?
RT-2 እያንዳንዱን የእርምጃ ልኬት ወደ ልዩ ቶከኖች (ለምሳሌ፡ 256 ቢን) አጣምሮ እንደ ሕብረቁምፊ አወጣቸው፣ ይህም የቋንቋ ሞዴል ማሽነሪ እንደ ቃላት ያሉ ድርጊቶችን እንዲተነብይ አስችሎታል።
በVLA አውድ ውስጥ 'ድንገተኛ ማስተላለፍ' ምን ማለት ነው?
ቪኤልኤዎች የሚጀምሩት በድረ-ገጽ ላይ ከሰለጠኑ የራዕይ-ቋንቋ ሞዴሎች ስለሆነ እንደ ሎጎዎችን ማወቅ ወይም 'ትንሹን' መረዳት በሮቦት ውሂብ ውስጥ ታይቶ በማይታወቅ ሁኔታ ወደ ማጭበርበር ተግባራት ያስተላልፋል።
የpi-0 ስርጭት/ፍሰት ተዛማጅ የድርጊት ጭንቅላት ከነጠላ የድርጊት ቶከኖች ጋር ሲነጻጸር ቁልፍ ጠቀሜታ ምንድነው?
በአንድ ጊዜ ከአንድ እርምጃ ይልቅ፣ pi-0 ቀጣይነት ያለው የእርምጃ ክፍሎችን በከፍተኛ ድግግሞሽ ያመነጫል፣ ይህም ለስላሳ እና የበለጠ ቀልጣፋ እንቅስቃሴን ያስችላል።
ለምንድነው የክፍት X-Embodiment ዳታ ስብስብ ለVLAዎች አስፈላጊ የሆነው?
ክፍት ኤክስ-ኢምቦዲመንት ከተለያዩ ሮቦቶች የሚመጡ ዱካዎችን ያጣምራል።