Görsel Yapay Zeka KILAVUZU

CLIP ve Vizyon-Dil Modelleri

CLIP, görselleri ve metni aynı matematiksel uzaya yerleştirerek bağlamayı öğrenen OpenAI modelinin bir modelidir.

2 min readSon güncelleme

Genel Bakış

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Derin Dalış

2021'de piyasaya sürülen CLIP (Karşılaştırmalı Dil-Görüntü Ön Eğitimi), web'den alınan yaklaşık 400 milyon resim yazısı çifti üzerinde eğitildi. İki kodlayıcı kullanır: Biri görüntüyü bir vektöre dönüştürür, diğeri metni bir vektöre dönüştürür ve her ikisi de ortak bir yerleştirme alanına yerleşir. Model, bir köpeğin fotoğrafı ile "bir köpeğin fotoğrafı" kelimelerinin birbirine yakın, eşleşmeyen çiftlerin ise birbirinden uzak duracağını öğrenir. Bu, sıfır atışlı sınıflandırmanın kilidini açar: Bir görüntüyü etiketlemek için, onu aday kategorilerin metin açıklamalarıyla karşılaştırırsınız ve özel bir sınıflandırıcıyı eğitmeden en yakın olanı seçersiniz. CLIP, görüntü oluşturuculara rehberlik eden, anlamsal görüntü aramayı güçlendiren, veri kümelerini filtreleyen ve Flamingo, LLaVA ve GPT-4V gibi günümüzün daha büyük görüntü dili modellerinin tohumunu atan temel bir altyapı haline geldi.

Teknik Bilgi

CLIP karşılaştırmalı bir amaç ile eğitilmiştir. Bir dizi görüntü-metin çiftinde, her görüntü ve her başlık arasındaki benzerliği (kosinüs benzerliği aracılığıyla) hesaplar, ardından kodlayıcıları doğru çiftler için puanları maksimuma çıkaracak ve tüm yanlış kombinasyonlar için puanları en aza indirecek şekilde ayarlar. Görüntü kodlayıcı tipik olarak bir resmi parçalara bölen bir Görüntü Transformatörüdür; metin kodlayıcı, belirteçler üzerinde bir Transformer'dır. Her ikisi de karşılaştırılabilir vektörler ürettiğinden, herhangi bir görüntüyü herhangi bir metinle anında eşleştirebilirsiniz.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

CLIP ve Vizyon-Dil Modellerinin Geleceği

CLIP tarzı hizalama artık daha büyük çok modlu modellerin içinde aynı zamanda sohbet edebilen, akıl yürütebilen ve görüntülerle ilgili soruları yanıtlayabilen bir yapı taşıdır. Daha büyük ve daha net eğitim setleri, birçok dil desteği ve video ile sesin genişletilmesini bekleyebilirsiniz. Araştırmacılar, CLIP'in web verilerinden emdiği sosyal ve demografik önyargıları azaltmak ve karşılaştırmalı modellerin zayıf kaldığı ince taneli anlayışı (nesneleri saymak, metni okumak, mekansal ilişkiler) geliştirmek için çalışıyorlar. OpenCLIP gibi açık sürümler olgunlaştıkça, bu resim-metin yapıştırıcısı arama, robotik ve erişilebilirlik araçlarına yayılmaya devam edecek.

Gerçek Dünya Uygulaması

Dosya adı etiketleri yerine "dağların üzerinden gün batımı" gibi doğal ifadelerle fotoğraf kitaplığında arama yapma

Çıktıların istenen istemle eşleşmesi için metin-görüntü oluşturucularına rehberlik etme

Güvenli olmayan veya politika dışı görselleri, yasaklı içeriğin metin açıklamalarıyla karşılaştırarak işaretleme

Araştırma veya e-ticaret için büyük etiketlenmemiş görüntü veri kümelerini otomatik olarak organize etme veya altyazı ekleme

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Robotik İçin Vizyon-Dil-Eylem Modelleri

Sık sorulan sorular

What is CLIP and Vision-Language Models?

CLIP, görselleri ve metni aynı matematiksel uzaya yerleştirerek bağlamayı öğrenen OpenAI modelinin bir modelidir. Görsel arama, içerik denetimi ve birçok metin-görüntü oluşturucunun arkasındaki sessiz çalışma gücüdür.

CLIP'in arkasındaki temel fikir nedir?

CLIP, hem görüntüleri hem de metni tek bir paylaşılan vektör uzayına eşler, böylece benzerlikleri doğrudan ölçülebilir.

CLIP hangi eğitim yaklaşımını kullanıyor?

CLIP karşılaştırmalı bir amaç kullanır: doğru resim yazısı çiftleri yakına çekilirken uyumsuz çiftler birbirinden uzaklaştırılır.

CLIP ile 'sıfır atış sınıflandırması' ne anlama geliyor?

CLIP, sınıflandırmak için hiçbir zaman özel olarak eğitilmediği görüntüleri, aday kategorilerin metin açıklamalarıyla karşılaştırarak etiketleyebilir.

CLIP bir görsel ile altyazının eşleşip eşleşmediğini nasıl ölçer?

CLIP her birini bir vektör halinde kodlar ve kosinüs benzerliğini hesaplar; Daha yüksek benzerlik, daha yakın bir anlamsal eşleşme anlamına gelir.

CLIP yaklaşık olarak ne kadar veri üzerinde eğitildi?

CLIP, internetten toplanan yaklaşık 400 milyon resim yazısı çiftinden bilgi edinerek ona geniş bir görsel dil bilgisi kazandırdı.