PANDUAN AI Visual

CLIP dan Model Bahasa Visi

CLIP adalah model dari OpenAI yang belajar menghubungkan gambar dan teks dengan menempatkan keduanya dalam ruang matematika yang sama.

2 min readTerakhir diperbarui

Ikhtisar

It is the quiet workhorse behind image search, content moderation, and many text-to-image generators.

Menyelam Lebih Dalam

Dirilis pada tahun 2021, CLIP (Contrastive Language-Image Pre-training) melatih sekitar 400 juta pasangan teks gambar yang diambil dari web. Ini menggunakan dua encoder: satu mengubah gambar menjadi vektor, yang lain mengubah teks menjadi vektor, dan keduanya mendarat di ruang penyematan bersama. Model belajar agar foto seekor anjing dan tulisan "foto anjing" diletakkan berdekatan, sedangkan pasangan yang tidak cocok duduk berjauhan. Ini membuka klasifikasi zero-shot: untuk memberi label pada gambar, Anda membandingkannya dengan deskripsi teks dari kategori kandidat dan memilih yang terdekat, tanpa melatih pengklasifikasi khusus. CLIP menjadi infrastruktur dasar, memandu generator gambar, mendukung penelusuran gambar semantik, memfilter kumpulan data, dan menyemai model bahasa visi yang lebih besar saat ini seperti Flamingo, LLaVA, dan GPT-4V.

Wawasan Teknis

CLIP dilatih dengan tujuan yang kontras. Dalam kumpulan pasangan gambar-teks, ia menghitung kesamaan (melalui kesamaan kosinus) antara setiap gambar dan setiap keterangan, lalu menyesuaikan encoder untuk memaksimalkan skor untuk pasangan yang benar dan meminimalkan skor untuk semua kombinasi yang salah. Encoder gambar biasanya berupa Vision Transformer yang membagi gambar menjadi beberapa bagian; pembuat enkode teks adalah Transformer atas token. Karena keduanya menghasilkan vektor yang sebanding, Anda dapat mencocokkan gambar apa pun dengan teks apa pun dengan cepat.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Model CLIP dan Bahasa Visi

Penyelarasan gaya CLIP sekarang menjadi elemen penyusun dalam model multimodal yang lebih besar yang juga dapat mengobrol, bernalar, dan menjawab pertanyaan tentang gambar. Harapkan set pelatihan yang lebih besar dan lebih bersih, dukungan untuk banyak bahasa, dan perluasan ke video dan audio. Para peneliti berupaya mengurangi bias sosial dan demografi yang diserap CLIP dari data web, dan untuk meningkatkan pemahaman yang lebih mendalam (menghitung objek, membaca teks, hubungan spasial) di mana model kontrastif masih lemah. Seiring dengan semakin matangnya versi terbuka seperti OpenCLIP, perekat gambar-teks ini akan terus menyebar ke seluruh alat pencarian, robotika, dan aksesibilitas.

Implementasi Dunia Nyata

Mencari perpustakaan foto dengan frasa alami seperti "matahari terbenam di atas pegunungan" alih-alih tag nama file

Memandu generator teks-ke-gambar sehingga keluarannya sesuai dengan perintah yang diminta

Menandai gambar yang tidak aman atau di luar kebijakan dengan membandingkannya dengan deskripsi teks dari konten yang dilarang

Mengorganisir secara otomatis atau memberi teks pada kumpulan data gambar besar yang tidak berlabel untuk penelitian atau e-niaga

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the CLIP and Vision-Language Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Model Visi-Bahasa-Tindakan untuk Robotika

Pertanyaan yang sering diajukan

What is CLIP and Vision-Language Models?

CLIP adalah model dari OpenAI yang belajar menghubungkan gambar dan teks dengan menempatkan keduanya dalam ruang matematika yang sama. Ini adalah pekerja keras di balik pencarian gambar, moderasi konten, dan banyak generator teks-ke-gambar.

Apa ide inti di balik CLIP?

CLIP memetakan gambar dan teks ke dalam satu ruang vektor bersama sehingga kemiripannya dapat diukur secara langsung.

Pendekatan pelatihan apa yang digunakan CLIP?

CLIP menggunakan tujuan yang kontras: pasangan keterangan gambar yang benar ditarik mendekat sementara pasangan yang tidak cocok dipisahkan.

Apa yang dimaksud dengan 'klasifikasi zero-shot' dengan CLIP?

CLIP dapat memberi label pada gambar yang tidak pernah dilatih secara khusus untuk mengklasifikasikannya dengan membandingkannya dengan deskripsi teks dari kategori kandidat.

Bagaimana CLIP mengukur apakah gambar dan keterangan cocok?

CLIP mengkodekan masing-masing ke dalam vektor dan menghitung kesamaan kosinus; kesamaan yang lebih tinggi berarti kecocokan semantik yang lebih dekat.

Kira-kira berapa banyak data yang dilatih CLIP?

CLIP belajar dari sekitar 400 juta pasangan teks gambar yang dikumpulkan dari internet, sehingga memberikan pengetahuan bahasa visual yang luas.