Vizuális MI ÚTMUTATÓ

CLIP és Vision-Language modellek

A CLIP a OpenAI modellje, amely megtanulja összekapcsolni a képeket és a szöveget úgy, hogy mindkettőt ugyanabba a matematikai térbe helyezi.

2 perc olvasásUtoljára frissítve

Áttekintés

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Mély merülés

A 2021-ben kiadott CLIP (Contrastive Language-Image Pre-training) nagyjából 400 millió, az internetről lekapart kép-feliratpáron tanult. Két kódolót használ: az egyik a képet vektorrá alakítja, a másik a szöveget vektorossá, és mindkettő egy megosztott beágyazási térben landol. A modell úgy tanulja meg, hogy egy kutyáról készült fotó és a "kutyáról készült fotó" szavak egymáshoz közel helyezkednek el, míg az össze nem illő párok távol helyezkednek el egymástól. Ez feloldja a nullapontos besorolást: egy kép címkézéséhez összehasonlítja azt a jelölt kategóriák szöveges leírásával, és kiválasztja a legközelebbit anélkül, hogy külön osztályozót tanítana. A CLIP alapvető infrastruktúra lett, amely irányítja a képgenerátorokat, a szemantikus képkeresést, az adatkészletek szűrését és a mai nagyobb látásnyelvi modellek, például a Flamingo, LLaVA és GPT-4V beültetését.

Technikai betekintés

A CLIP kontrasztív objektívvel van kiképezve. Kép-szöveg párok kötegében kiszámítja a hasonlóságot (koszinusz hasonlóságon keresztül) minden kép és minden felirat között, majd úgy állítja be a kódolókat, hogy maximalizálja a megfelelő párok pontszámát, és minimalizálja az összes rossz kombináció pontszámát. A képkódoló általában egy Vision Transformer, amely foltokra osztja a képet; a szövegkódoló egy Transformer over tokens. Mivel mindkettő összehasonlítható vektorokat hoz létre, bármilyen képet bármilyen szöveghez illeszthet menet közben.

Stratégiai hatás

Sebesség és méretarány

A vizuális AI képes automatizálni az ellenőrzési, észlelési és címkézési feladatokat nagy léptékben.

Építési lehetőségek

A kreatív csapatok gyorsabban prototípusokat készíthetnek a koncepciókból, kevesebb kézi átdolgozással.

Csapat és munkafolyamat

A műveletek olyan kép- és videojeleket használhatnak, amelyeket korábban nehéz volt feldolgozni.

A CLIP és a Vision-Language modellek jövője

A CLIP-stílusú igazítás ma már a nagyobb multimodális modellek építőköve, amely képes csevegni, érvelni és megválaszolni a képekkel kapcsolatos kérdéseket. Nagyobb és tisztább oktatókészletekre, számos nyelv támogatására, valamint a videóra és a hangra való kiterjesztésre számíthat. A kutatók azon dolgoznak, hogy csökkentsék a CLIP webes adatokból felvett társadalmi és demográfiai torzításait, és javítsák a finomszemcsés megértést (objektumok számlálása, szövegolvasás, térbeli viszonyok), ahol a kontrasztív modellek továbbra is gyengék. Ahogy a nyílt verziók, például az OpenCLIP kiforrnak, ez a kép-szöveg ragasztó tovább terjed a keresési, robotikai és kisegítő lehetőségek között.

Valós megvalósítás

Keresés egy fotótárban természetes kifejezésekkel, például „naplemente a hegyek felett” a fájlnévcímkék helyett

Szöveg-kép generátorok irányítása, hogy a kimenetek megfeleljenek a kért promptnak

Nem biztonságos vagy a szabályzatnak nem megfelelő képek megjelölése a tiltott tartalom szöveges leírásaival való összehasonlítással

Nagyméretű, címkézetlen képadatkészletek automatikus rendszerezése vagy feliratozása kutatás vagy e-kereskedelem céljára

Kockázatok és védőkorlátok

A képhez fűződő jogok és a beleegyezés jogi kockázatot jelenthet, ha a származás nem egyértelmű.

A modell teljesítménye a világítástól, a demográfiai adatoktól és a környezettől függően változhat.

A hamis pozitívumok észrevétlenek maradhatnak, hacsak nem figyelik a megbízhatósági küszöböket.

Végrehajtási ütemterv

1

Határozza meg a pontosság, a visszahívás és a hibaköltségek elfogadási kritériumait.

2

Tesztelje a valós gyártási feltételeknek megfelelő adatokkal.

3

Adjon hozzá emberi felülvizsgálatot az alacsony megbízhatóságú vagy nagy hatású előrejelzésekhez.

4

A modell elsodródásának nyomon követése és újbóli érvényesítése a kamera vagy az adatkészlet módosítása után.

Folytassa a felfedezést

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Kezdő kvíz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Következő útmutató

Látás-nyelv-cselekvés modellek robotikához

Gyakran ismételt kérdések

What is CLIP and Vision-Language Models?

A CLIP a OpenAI modellje, amely megtanulja összekapcsolni a képeket és a szöveget úgy, hogy mindkettőt ugyanabba a matematikai térbe helyezi. Ez a csendes igásló a képkeresés, a tartalommoderálás és számos szöveg-képgenerátor mögött.

Mi a CLIP alapötlete?

A CLIP a képeket és a szöveget egy megosztott vektortérbe képezi le, így a hasonlóságuk közvetlenül mérhető.

Milyen képzési megközelítést alkalmaz a CLIP?

A CLIP kontrasztos objektívet használ: a megfelelő kép-felirat párokat a rendszer összehúzza, míg a nem egyező párokat széttolja.

Mit jelent a „nullapontos besorolás” a CLIP-pel?

A CLIP képes megcímkézni azokat a képeket, amelyeket soha nem képeztek ki kifejezetten az osztályozásra, összehasonlítva azokat a jelölt kategóriák szöveges leírásaival.

Hogyan méri a CLIP, hogy egy kép és egy felirat egyezik-e?

A CLIP mindegyiket egy vektorba kódolja, és kiszámítja a koszinusz hasonlóságot; a nagyobb hasonlóság szorosabb szemantikai egyezést jelent.

Körülbelül mennyi adatra képezték ki a CLIP-et?

A CLIP nagyjából 400 millió kép-feliratpárból tanult, amelyeket az internetről gyűjtöttek össze, így széles körű vizuális nyelvi ismereteket szerzett.