CLIP dan Model Bahasa Visi
CLIP adalah model dari OpenAI yang belajar menghubungkan gambar dan teks dengan menempatkan keduanya dalam ruang matematika yang sama.
Ikhtisar
It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.
Menyelam Lebih Dalam
Dirilis pada tahun 2021, CLIP (Contrastive Language-Image Pre-training) melatih sekitar 400 juta pasangan teks gambar yang diambil dari web. Ini menggunakan dua encoder: satu mengubah gambar menjadi vektor, yang lain mengubah teks menjadi vektor, dan keduanya mendarat di ruang penyematan bersama. Model belajar agar foto seekor anjing dan tulisan "foto anjing" diletakkan berdekatan, sedangkan pasangan yang tidak cocok duduk berjauhan. Ini membuka klasifikasi zero-shot: untuk memberi label pada gambar, Anda membandingkannya dengan deskripsi teks dari kategori kandidat dan memilih yang terdekat, tanpa melatih pengklasifikasi khusus. CLIP menjadi infrastruktur dasar, memandu generator gambar, mendukung penelusuran gambar semantik, memfilter kumpulan data, dan menyemai model bahasa visi yang lebih besar saat ini seperti Flamingo, LLaVA, dan GPT-4V.
Wawasan Teknis
CLIP dilatih dengan tujuan yang kontras. Dalam kumpulan pasangan gambar-teks, ia menghitung kesamaan (melalui kesamaan kosinus) antara setiap gambar dan setiap keterangan, lalu menyesuaikan encoder untuk memaksimalkan skor untuk pasangan yang benar dan meminimalkan skor untuk semua kombinasi yang salah. Encoder gambar biasanya berupa Vision Transformer yang membagi gambar menjadi beberapa bagian; pembuat enkode teks adalah Transformer atas token. Karena keduanya menghasilkan vektor yang sebanding, Anda dapat mencocokkan gambar apa pun dengan teks apa pun dengan cepat.
Dampak Strategis
Kecepatan dan skala
Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.
Build choices
Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.
Team and workflow
Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.
Masa Depan Model CLIP dan Bahasa Visi
Penyelarasan gaya CLIP sekarang menjadi elemen penyusun dalam model multimodal yang lebih besar yang juga dapat mengobrol, bernalar, dan menjawab pertanyaan tentang gambar. Harapkan set pelatihan yang lebih besar dan lebih bersih, dukungan untuk banyak bahasa, dan perluasan ke video dan audio. Para peneliti berupaya mengurangi bias sosial dan demografi yang diserap CLIP dari data web, dan untuk meningkatkan pemahaman yang lebih mendalam (menghitung objek, membaca teks, hubungan spasial) di mana model kontrastif masih lemah. Seiring dengan semakin matangnya versi terbuka seperti OpenCLIP, perekat gambar-teks ini akan terus menyebar ke seluruh alat pencarian, robotika, dan aksesibilitas.
Implementasi Dunia Nyata
Mencari perpustakaan foto dengan frasa alami seperti "matahari terbenam di atas pegunungan" alih-alih tag nama file
Memandu generator teks-ke-gambar sehingga keluarannya sesuai dengan perintah yang diminta
Menandai gambar yang tidak aman atau di luar kebijakan dengan membandingkannya dengan deskripsi teks dari konten yang dilarang
Mengorganisir secara otomatis atau memberi teks pada kumpulan data gambar besar yang tidak berlabel untuk penelitian atau e-niaga
Risiko & Pagar Pembatas
Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.
Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.
Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.
Peta Jalan Implementasi
Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.
Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.
Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.
Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.
Terus Menjelajah
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CLIP and Vision-Language Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Model Visi-Bahasa-Tindakan untuk Robotika
Pertanyaan yang sering diajukan
What is CLIP and Vision-Language Models?
CLIP adalah model dari OpenAI yang belajar menghubungkan gambar dan teks dengan menempatkan keduanya dalam ruang matematika yang sama. Ini adalah pekerja keras di balik pencarian gambar, moderasi konten, dan banyak generator teks-ke-gambar.
Apa ide inti di balik CLIP?
CLIP memetakan gambar dan teks ke dalam satu ruang vektor bersama sehingga kemiripannya dapat diukur secara langsung.
Pendekatan pelatihan apa yang digunakan CLIP?
CLIP menggunakan tujuan yang kontras: pasangan keterangan gambar yang benar ditarik mendekat sementara pasangan yang tidak cocok dipisahkan.
Apa yang dimaksud dengan 'klasifikasi zero-shot' dengan CLIP?
CLIP dapat memberi label pada gambar yang tidak pernah dilatih secara khusus untuk mengklasifikasikannya dengan membandingkannya dengan deskripsi teks dari kategori kandidat.
Bagaimana CLIP mengukur apakah gambar dan keterangan cocok?
CLIP mengkodekan masing-masing ke dalam vektor dan menghitung kesamaan kosinus; kesamaan yang lebih tinggi berarti kecocokan semantik yang lebih dekat.
Kira-kira berapa banyak data yang dilatih CLIP?
CLIP belajar dari sekitar 400 juta pasangan teks gambar yang dikumpulkan dari internet, sehingga memberikan pengetahuan bahasa visual yang luas.