Vizuális MI ÚTMUTATÓ

Látás-nyelv-cselekvés modellek robotikához

A Vision-Language-Action (VLA) modellek nagy neurális hálózatok, amelyek kameraképeket, valamint írásos utasításokat vesznek fel, és közvetlenül adják ki a robotmotoros parancsokat.

2 perc olvasásUtoljára frissítve

Áttekintés

They matter because they bring the broad common sense of foundation models to physical machines, letting one model control a robot across many tasks instead of hand-coding each behavior.

Mély merülés

A VLA-modell három folyamot egyesít: látást (kamerakeretek), nyelvet (például „tegyük a poharat a mosogatóba”) és cselekvést (csuklós szögek, megfogó nyitási/zárási sebessége vagy végkifejező sebessége). Google A DeepMind RT-2 mérföldkő volt: egy látásnyelvi modellt használt, amelyet webes képeken és szövegeken tanítottak, majd együtt finomította a robotpályákon, hogy ugyanaz a hálózat válaszolhasson a „mi gyümölcs ez?” kérdésre. szövegként tokenizált műveleteket is kibocsát. Nyílt modellek következtek, mint például az OpenVLA (7B paraméterek) és a Physical Intelligence pi-0. Lényeges, hogy ezek a modellek „feltörekvő” átvitelt mutatnak: a webes ismeretek (márkalogó felismerése, „a kisebbik” megértése) manipulációt jelent, így a robot olyan tárgyakra és utasításokra általánosít, amelyeket soha nem látott a robotképzés során.

Technikai betekintés

Sok VLA diszkretizálja a folyamatos cselekvéseket tokenekbe, így a transzformátor autoregresszív módon előre tudja jelezni azokat, akárcsak a szavakat. Az RT-2 minden akciódimenziót leképez a 256 tároló egyikére, és szöveges karakterláncként bocsátja ki. Az olyan újabb dizájnok, mint a pi-0, diffúziós vagy áramláshoz illeszkedő „akciószakértői” fejet rögzítenek a bemerevedett látásnyelv gerincéhez, sima, nagyfrekvenciás akciódarabokat (pl. 50 Hz) generálva egyetlen különálló lépés helyett, javítva a kézügyességet.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A jövőkép-nyelv-művelet modellek robotika számára

Nagyobb, több kiviteli alakra kiterjedő adatkészletekre számíthat (az Open X-Embodiment erőfeszítés már 22+ robottípus adatait gyűjti össze), így egy modell karokat, humanoidokat és mobil bázisokat vezérel. A kutatás a valós idejű vezérlés, a gazdagabb 3D-s és tapintható bemenetek, valamint az érvelési láncok gyorsabb következtetései felé törekszik, ahol a modell „gondolkodik”, mielőtt cselekszik. A cél egy egységes általános irányelv, amelyet egyszerű angol nyelven kérhet, menet közbeni javítással, akárcsak egy asszisztenssel.

Valós megvalósítás

Az RT-2 egy Google konyhai robotot vezérel, hogy „a banánt a 3-as számra vigye” a webszövegből tanult számjegyekkel, nem a robotbemutatókkal

OpenVLA, egy nyílt forráskódú 7B modell, amelyet a laborok finomhangoltak úgy, hogy olcsó fegyvereken asztali pick-and-place funkciót hajtsanak végre.

A Physical Intelligence pi-0 ruhanemű összecsukása és asztal letisztítása sok részkészség leláncolásával egyetlen utasításból

A raktári kar azt mondta, hogy „válasszuk ki a legtörékenyebb tételt”, és a vizuális megjelenéséből következtetnek arra, hogy melyik tárgyról van szó.

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision-Language-Action Models for Robotics quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

CLIP és Vision-Language modellek

Gyakran ismételt kérdések

What is Vision-Language-Action Models for Robotics?

A Vision-Language-Action (VLA) modellek nagy neurális hálózatok, amelyek kameraképeket, valamint írásos utasításokat vesznek fel, és közvetlenül adják ki a robotmotoros parancsokat. Ezek azért fontosak, mert az alapmodellek tág, józan értelmét hozzák a fizikai gépekhez, lehetővé téve, hogy egy modell számos feladaton keresztül irányítsa a robotot, ahelyett, hogy az egyes viselkedéseket kézzel kódolná.

Milyen három típusú bemenet/kimenet határozza meg a Vision-Language-Action (VLA) modellt?

A VLA víziót (képeket) és nyelvi célt vesz fel, és cselekvéseket (motoros parancsokat) ad ki, egyesítve az észlelést, az utasítások követését és az irányítást.

Hogyan ábrázolta a Google DeepMind RT-2 robotműveleteit, hogy egy transzformátor generálhassa azokat?

Az RT-2 minden cselekvési dimenziót különálló tokenekbe (például 256 rekeszbe) bontott, és karakterláncként bocsátotta ki őket, lehetővé téve a nyelvi modell gépezetének, hogy előrejelezze a cselekvéseket, például a szavakat.

Mit jelent az „emergent transfer” a VLA-k összefüggésében?

Mivel a VLA-k a weben betanított látásnyelvi modellekből indulnak ki, az olyan ismeretek, mint a logók felismerése vagy a „kisebbik” megértése, átkerülnek a robotadatokban soha nem látott manipulációs feladatokba.

Mi a fő előnye a pi-0 diffúziós/áramlás-illesztő akciófejének az egyedi diszkrét akciójelzőkkel szemben?

Egyszerre egy-egy diszkrét lépés helyett a pi-0 folyamatos akciódarabokat állít elő magas frekvencián, így simább és ügyesebb mozgást tesz lehetővé.

Miért számít az Open X-Embodiment adatkészlet a VLA-k számára?

Az Open X-Embodiment számos különböző robot pályáját egyesíti, segítve a karok, mobil bázisok és más megvalósítási módok közötti átvitelt.