Modelli CLIP e linguaggio visivo
CLIP è un modello di OpenAI che impara a connettere immagini e testo posizionandoli entrambi nello stesso spazio matematico.
Panoramica
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
Immersione profonda
Rilasciato nel 2021, CLIP (Contrastive Language-Image Pre-training) si è formato su circa 400 milioni di coppie di immagini-didascalie recuperate dal web. Utilizza due codificatori: uno trasforma un'immagine in un vettore, l'altro trasforma il testo in un vettore ed entrambi finiscono in uno spazio di incorporamento condiviso. Il modello impara in modo che la foto di un cane e le parole "una foto di un cane" siano vicine, mentre le coppie non corrispondenti siano distanti. Ciò sblocca la classificazione zero-shot: per etichettare un'immagine, la confronti con le descrizioni testuali delle categorie candidate e scegli quella più vicina, senza addestrare un classificatore dedicato. CLIP è diventata un'infrastruttura fondamentale, guidando i generatori di immagini, alimentando la ricerca semantica di immagini, filtrando set di dati e seminando i più ampi modelli di linguaggio visivo odierni come Flamingo, LLaVA e GPT-4V.
Approfondimento tecnico
CLIP è addestrato con un obiettivo contrastivo. In un batch di coppie immagine-testo, calcola la somiglianza (tramite la somiglianza del coseno) tra ogni immagine e ogni didascalia, quindi regola i codificatori per massimizzare i punteggi per le coppie corrette e minimizzare i punteggi per tutte le combinazioni sbagliate. Il codificatore di immagini è in genere un Vision Transformer che divide un'immagine in porzioni; il codificatore di testo è un trasformatore su token. Poiché entrambi producono vettori comparabili, puoi abbinare qualsiasi immagine a qualsiasi testo al volo.
Impatto strategico
Velocità e scala
L’intelligenza artificiale visiva può automatizzare le attività di ispezione, rilevamento ed etichettatura su larga scala.
Scelte di build
I team creativi possono prototipare i concetti più velocemente con meno revisioni manuali.
Team e flusso di lavoro
Le operazioni possono utilizzare segnali immagine e video che in precedenza erano difficili da elaborare.
Il futuro dei modelli CLIP e del linguaggio visivo
L'allineamento in stile CLIP è ora un elemento fondamentale all'interno di modelli multimodali più ampi che possono anche chattare, ragionare e rispondere a domande sulle immagini. Aspettatevi set di formazione più grandi e più puliti, supporto per molte lingue ed estensione a video e audio. I ricercatori stanno lavorando per ridurre i pregiudizi sociali e demografici assorbiti da CLIP dai dati web e per migliorare la comprensione a grana fine (conteggio di oggetti, lettura di testi, relazioni spaziali) dove i modelli contrastivi rimangono deboli. Man mano che le versioni aperte come OpenCLIP maturano, questo collante immagine-testo continuerà a diffondersi negli strumenti di ricerca, robotica e accessibilità.
Implementazione nel mondo reale
Ricerca in una libreria di foto con frasi naturali come "tramonto sulle montagne" invece dei tag dei nomi dei file
Guidare i generatori di testo in immagine in modo che gli output corrispondano al prompt richiesto
Segnalazione di immagini non sicure o non conformi alle norme confrontandole con le descrizioni testuali di contenuti vietati
Organizzazione automatica o sottotitolazione di grandi set di dati di immagini senza etichetta per la ricerca o l'e-commerce
Rischi e guardrail
I diritti di immagine e il consenso possono diventare rischi legali se la provenienza non è chiara.
Le prestazioni del modello possono variare in base all'illuminazione, ai dati demografici e agli ambienti.
I falsi positivi possono passare inosservati a meno che non vengano monitorate le soglie di confidenza.
Tabella di marcia per l'implementazione
Definire i criteri di accettazione per i costi di precisione, richiamo ed errore.
Testare con dati che corrispondono alle reali condizioni di produzione.
Aggiungi la revisione umana per previsioni poco attendibili o ad alto impatto.
Tieni traccia della deriva del modello e riconvalida dopo le modifiche alla fotocamera o al set di dati.
Continua a esplorare
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Prossima guida
Modelli di visione-linguaggio-azione per la robotica
Domande frequenti
What is CLIP and Vision-Language Models?
CLIP è un modello di OpenAI che impara a connettere immagini e testo posizionandoli entrambi nello stesso spazio matematico. È il silenzioso cavallo di battaglia dietro la ricerca di immagini, la moderazione dei contenuti e molti generatori di testo in immagine.
Qual è l'idea alla base di CLIP?
CLIP mappa sia le immagini che il testo in uno spazio vettoriale condiviso in modo che la loro somiglianza possa essere misurata direttamente.
Quale approccio formativo utilizza CLIP?
CLIP utilizza un obiettivo contrastivo: le coppie immagine-didascalia corrette vengono avvicinate mentre le coppie non corrispondenti vengono separate.
Cosa significa "classificazione zero-shot" con CLIP?
CLIP può etichettare immagini che non è mai stato specificamente addestrato a classificare confrontandole con le descrizioni testuali delle categorie candidate.
In che modo CLIP misura se un'immagine e una didascalia corrispondono?
CLIP codifica ciascuno in un vettore e calcola la somiglianza del coseno; una somiglianza più elevata significa una corrispondenza semantica più stretta.
Approssimativamente su quanti dati è stato addestrato CLIP?
CLIP ha imparato da circa 400 milioni di coppie di immagini-didascalie raccolte da Internet, acquisendo così un'ampia conoscenza del linguaggio visivo.