Vizuális MI ÚTMUTATÓ

Open-vocabulary objektumészlelés

A nyílt szókészletű objektumészlelés lehetővé teszi a modell számára, hogy tetszőleges szöveggel leírt objektumokat keressen és dobozba helyezzen, beleértve a kategóriákat, amelyeket soha nem látott felcímkézve a képzés során.

2 perc olvasásUtoljára frissítve

Áttekintés

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

Mély merülés

A klasszikus detektorok zárt kategóriákra vannak kiképezve, mondjuk a COCO 80 osztályára, és nem tudnak felismerni a listán kívül eső „dolgot”. A nyílt szókincs észlelési törései korlátozzák a vizuális régió jellemzőit egy megosztott látás-nyelv beágyazási térhez igazítva, amelyet általában a hatalmas kép-szöveg párokból tanulnak meg (mint a CLIP-ben). Ha arra következtet, hogy szöveges címkéket ad meg, a modell beágyazza ezeket a címkéket, és az észlelt régiókat a legközelebbi szövegbeágyazáshoz igazítja, így az új kategóriák addig működnek, amíg le tudja őket írni. Az olyan rendszerek, mint a ViLD, a GLIP, az OWL-ViT, a Detic és a Grounding A DINO népszerűsítették ezt a megközelítést az észlelési gerincek és a nyelvi alapozás kombinálásával, valamint a nagy, gyengén címkézett vagy földelő adatkészletek képzésével.

Technikai betekintés

A trükk az, hogy egy rögzített osztályozó réteget szövegbeágyazásokkal helyettesítenek. Ahelyett, hogy ismert osztályonként egy súlyvektort tanulna meg, a detektor minden régiót ugyanabba a térbe vetít, mint egy nyelvi kódoló; Az osztályozás a régió jellemzői és a felhasználó által megadott kategórianevek vagy kifejezések beágyazása közötti hasonlóság-összehasonlítássá válik. Mivel a szövegkódoló nem látott szavakra általánosít, az új címke karakterláncok tesztidőben történő felcserélése lehetővé teszi a határolódoboz tanítási adataiból hiányzó kategóriák észlelését.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A nyílt szókészletű objektumészlelés jövője

A nyílt szókincs észlelése konvergál a földeléssel és a szegmentálással, ahol szabad formájú kifejezések (nem csak egyes szavak) lokalizálják az objektumokat, valamint a felszólító rendszerekkel kombinálva olyan modellekkel, mint a SAM a maszkokhoz. Erősebb nulla-lövés pontosságra, hosszabb és kompozíciósabb szöveges lekérdezésekre („a laptop mögött a piros bögre”) és a szükség szerint észlelő multimodális asszisztensekkel való szoros kapcsolatra számíthat. Ahogy javul a webes méretű kép-szöveg képzés, az észlelés, a visszakeresés és a nyelvi megértés közötti határ folyamatosan elmosódik az általános vizuális alapozás felé.

Valós megvalósítás

Képek keresése ritka vagy egyedi objektumok után nevük beírásával, átképzés nélkül

A robotrendszerek megtalálják a felhasználó által elnevezett elemet természetes nyelven, mielőtt megfogják

Adatkészletek automatikus címkézése sok új kategória felismerésével egy szöveges listából

Tartalmi moderálás, amely megjelöli az eredeti tanítási címkékben nem szereplő objektumokat

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Gyakran ismételt kérdések

What is Open-Vocabulary Object Detection?

A nyílt szókészletű objektumészlelés lehetővé teszi a modell számára, hogy tetszőleges szöveggel leírt objektumokat keressen és dobozba helyezzen, beleértve a kategóriákat, amelyeket soha nem látott felcímkézve a képzés során. Ez azért fontos, mert a hagyományos detektorok az osztályok rögzített listájához vannak zárva, míg a nyílt szókincs modellek szinte bármit képesek észlelni, amit el lehet nevezni.

Mi a nyílt szókincs tárgyfelismerésének meghatározó képessége?

A nyitott szókincs észlelése képes lokalizálni a szöveggel meghatározott kategóriákat a tesztidőben, még azokat is, amelyeket soha nem látott határolókeretekkel felcímkézve.

Hogyan osztályozzák ezek a modellek az észlelt régiót?

Régiókat vetítenek egy látásnyelvi beágyazási térbe, és minden régiót a legközelebbi szövegcímke-beágyazáshoz illesztenek.

Melyik előképzési erőforrás teszi leginkább lehetővé a nyílt szókincs észlelését?

A (CLIP-stílusú modellek által használt) tömeges kép-szöveg adatok létrehozzák a megosztott beágyazási teret, amely lehetővé teszi a szöveg általánosítását új kategóriákra.

Melyik alkatrészt kell cserélni egy zárt érzékelőhöz képest?

Rögzített osztálysúlyvektorok helyett az osztályozás a szövegbeágyazásokhoz hasonlóságot használ, így a tesztidőben új címkesorokat lehet hozzáadni.

Ezek közül melyik a nyílt szókincs vagy a földelés észlelési modellje?

A földelő DINO, valamint a GLIP, OWL-ViT, ViLD és Detic jól ismert nyílt szókincs vagy földelés detektorok.