GHID AI vizual

Modele CLIP și Vision-Language

CLIP este un model de la OpenAI care învață să conecteze imagini și text prin plasarea pe ambele în același spațiu matematic.

2 minute de lecturăUltima actualizare

Prezentare generală

Este adevăratul pilon de povară din spatele căutării de imagini, moderării conținutului și multor generatoare text-to-image.

Scufundare în profunzime

Lansat în 2021, CLIP (Contrastive Language-Image Pre-training) s-a antrenat pe aproximativ 400 de milioane de perechi de subtitrări imagini extrase de pe web. Folosește două codificatoare: unul transformă o imagine într-un vector, celălalt transformă textul într-un vector și ambele aterizează într-un spațiu de încorporare comun. Modelul învață astfel că o fotografie a unui câine și cuvintele „o fotografie a unui câine” stau aproape una de cealaltă, în timp ce perechile nepotrivite stau departe. Acest lucru deblochează clasificarea zero-shot: pentru a eticheta o imagine, o comparați cu descrierile text ale categoriilor candidate și o alegeți pe cea mai apropiată, fără a antrena un clasificator dedicat. CLIP a devenit o infrastructură de bază, ghidând generatoarele de imagini, propulsând căutarea semantică a imaginilor, filtrand seturile de date și generând modele mai mari de limbaj vizual, cum ar fi Flamingo, LLaVA și GPT-4V.

Perspectivă tehnică

CLIP este antrenat cu un obiectiv contrastiv. Într-un lot de perechi imagine-text, calculează similaritatea (prin asemănarea cosinusului) între fiecare imagine și fiecare legendă, apoi ajustează codificatoarele pentru a maximiza scorurile pentru perechile corecte și pentru a minimiza scorurile pentru toate combinațiile greșite. Codificatorul de imagine este de obicei un Vision Transformer care împarte o imagine în patch-uri; codificatorul de text este un Transformator peste jetoane. Deoarece ambele produc vectori comparabili, puteți potrivi orice imagine cu orice text din mers.

Impact strategic

Viteză și scară

Visual AI poate automatiza sarcinile de inspecție, detectare și etichetare la scară.

Alegeri de construcție

Echipele creative pot crea prototipuri mai rapid cu mai puține revizuiri manuale.

Echipa și fluxul de lucru

Operațiunile pot utiliza semnale de imagine și video care anterior erau greu de procesat.

Viitorul modelelor CLIP și Vision-Language

Alinierea în stilul CLIP este acum un element de construcție în interiorul modelelor multimodale mai mari care pot, de asemenea, să discute, să motiveze și să răspundă la întrebări despre imagini. Așteptați-vă seturi de antrenament mai mari și mai curate, suport pentru multe limbi și extindere la video și audio. Cercetătorii lucrează pentru a reduce părtinirile sociale și demografice absorbite de CLIP din datele web și pentru a îmbunătăți înțelegerea fină (numărarea obiectelor, citirea textului, relațiile spațiale) acolo unde modelele contrastante rămân slabe. Pe măsură ce versiunile deschise precum OpenCLIP se maturizează, acest adeziv imagine-text se va răspândi în continuare în instrumentele de căutare, robotică și accesibilitate.

Implementare în lumea reală

Căutarea într-o bibliotecă de fotografii cu expresii naturale precum „apus de soare peste munți” în loc de etichete de nume de fișier

Ghidarea generatoarelor de text în imagine, astfel încât rezultatele să se potrivească cu promptul solicitat

Semnalarea imaginilor nesigure sau în afara politicii comparându-le cu descrierile text ale conținutului interzis

Organizarea automată sau subtitrărea seturilor de date mari de imagini fără etichete pentru cercetare sau comerț electronic

Riscuri și balustrade

Drepturile de imagine și consimțământul pot deveni riscuri legale dacă proveniența este neclară.

Performanța modelului poate varia în funcție de iluminare, demografie și mediu.

Falsele pozitive pot trece neobservate dacă nu sunt monitorizate pragurile de încredere.

Foaia de parcurs de implementare

1

Definiți criteriile de acceptare pentru costurile de precizie, rechemare și erori.

2

Testați cu date care corespund condițiilor reale de producție.

3

Adăugați o recenzie umană pentru predicții cu încredere scăzută sau cu impact ridicat.

4

Urmăriți derapajul modelului și revalidați după modificarea camerei sau a setului de date.

Continuați să explorați

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Quiz Start

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Următorul ghid

Modele de viziune-limbaj-acțiune pentru robotică

Întrebări frecvente

Ce este CLIP și modelele de viziune-limbaj?

CLIP este un model de la OpenAI care învață să conecteze imagini și text prin plasarea pe ambele în același spațiu matematic. Este calul de bătaie liniștit din spatele căutării de imagini, moderarea conținutului și multor generatori de text în imagine.

Care este ideea de bază din spatele CLIP?

CLIP mapează atât imaginile, cât și textul într-un spațiu vectorial partajat, astfel încât asemănarea lor să poată fi măsurată direct.

Ce abordare de formare folosește CLIP?

CLIP folosește un obiectiv contrastiv: perechile corecte imagine-titlu sunt strânse în timp ce perechile nepotrivite sunt împinse în afară.

Ce înseamnă „clasificare zero-shot” cu CLIP?

CLIP poate eticheta imagini pentru care nu a fost niciodată instruit în mod special să le clasifice, comparându-le cu descrierile text ale categoriilor candidate.

Cum măsoară CLIP dacă o imagine și o legendă se potrivesc?

CLIP codifică fiecare într-un vector și calculează asemănarea cosinusului; similaritate mai mare înseamnă o potrivire semantică mai apropiată.

Aproximativ pe câte date a fost instruit CLIP?

CLIP a învățat din aproximativ 400 de milioane de perechi de subtitrări imagini adunate de pe internet, oferindu-i cunoștințe ample de limbaj vizual.