PANDUAN AI Visual

Deteksi Objek Kosakata Terbuka

Deteksi objek kosakata terbuka memungkinkan model menemukan dan mengemas objek yang dijelaskan oleh teks arbitrer, termasuk kategori yang tidak pernah diberi label selama pelatihan.

2 min readTerakhir diperbarui

Ikhtisar

It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.

Menyelam Lebih Dalam

Detektor klasik dilatih pada serangkaian kategori tertutup, misalnya 80 kelas COCO, dan tidak dapat mengenali 'benda' di luar daftar itu. Deteksi kosakata terbuka memecahkan batasan tersebut dengan menyelaraskan fitur wilayah visual dengan ruang penyematan bahasa penglihatan bersama, yang biasanya dipelajari dari pasangan gambar-teks yang sangat besar (seperti dalam CLIP). Pada inferensi, Anda menyediakan label teks, model menyematkan label tersebut, dan mencocokkan wilayah yang terdeteksi dengan penyematan teks mana pun yang paling dekat, sehingga kategori baru berfungsi selama Anda dapat mendeskripsikannya. Sistem seperti ViLD, GLIP, OWL-ViT, Detic, dan Grounding DINO mempopulerkan pendekatan ini dengan menggabungkan tulang punggung deteksi dengan landasan bahasa dan dengan melatih kumpulan data yang besar, berlabel lemah, atau landasan.

Wawasan Teknis

Caranya adalah mengganti lapisan pengklasifikasi tetap dengan penyematan teks. Daripada mempelajari satu vektor bobot per kelas yang diketahui, detektor memproyeksikan setiap wilayah ke dalam ruang yang sama dengan pembuat enkode bahasa; klasifikasi menjadi perbandingan kemiripan antara fitur wilayah dan penyematan nama atau frasa kategori yang disediakan pengguna. Karena encoder teks menggeneralisasi kata-kata yang tidak terlihat, menukar string label baru pada waktu pengujian memungkinkan deteksi kategori yang tidak ada dalam data pelatihan kotak pembatas.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Deteksi Objek Kosakata Terbuka

Deteksi kosakata terbuka menyatu dengan landasan dan segmentasi, di mana frasa bentuk bebas (bukan hanya satu kata) melokalisasi objek, dan dengan sistem yang dapat diminta dikombinasikan dengan model seperti SAM untuk masker. Harapkan akurasi zero-shot yang lebih kuat, kueri teks yang lebih panjang dan lebih komposisional ('cangkir merah di belakang laptop'), dan penggabungan yang erat dengan asisten multimodal yang mendeteksi sesuai permintaan. Seiring dengan peningkatan pelatihan gambar-teks skala web, batasan antara deteksi, pengambilan, dan pemahaman bahasa akan semakin kabur menuju landasan visual umum.

Implementasi Dunia Nyata

Mencari gambar untuk objek langka atau khusus dengan mengetikkan namanya tanpa pelatihan ulang

Sistem robotika menemukan item yang diberi nama pengguna dalam bahasa alami sebelum menangkapnya

Memberi label otomatis pada kumpulan data dengan mendeteksi banyak kategori baru dari daftar teks

Moderasi konten yang menandai objek yang dijelaskan tidak ada dalam label pelatihan asli

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Open-Vocabulary Object Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Pertanyaan yang sering diajukan

What is Open-Vocabulary Object Detection?

Deteksi objek kosakata terbuka memungkinkan model menemukan dan mengemas objek yang dijelaskan oleh teks arbitrer, termasuk kategori yang tidak pernah diberi label selama pelatihan. Hal ini penting karena detektor tradisional dikunci pada daftar kelas yang tetap, sementara model kosakata terbuka dapat mendeteksi hampir semua hal yang dapat Anda sebutkan.

Apa kemampuan yang menentukan dari deteksi objek kosakata terbuka?

Deteksi kosakata terbuka dapat melokalisasi kategori yang ditentukan oleh teks pada waktu pengujian, bahkan kategori yang tidak pernah dilihat diberi label dengan kotak pembatas.

Bagaimana model ini mengklasifikasikan wilayah yang terdeteksi?

Mereka memproyeksikan wilayah ke dalam ruang penyematan bahasa visi dan mencocokkan setiap wilayah dengan penyematan label teks terdekat.

Sumber daya prapelatihan apa yang paling memungkinkan deteksi kosakata terbuka?

Data gambar-teks yang besar (seperti yang digunakan oleh model gaya CLIP) membangun ruang penyematan bersama yang memungkinkan teks digeneralisasi ke kategori baru.

Komponen manakah yang diganti dibandingkan dengan detektor set tertutup?

Alih-alih vektor bobot kelas tetap, klasifikasi menggunakan kemiripan dengan penyematan teks, sehingga string label baru dapat ditambahkan pada waktu pengujian.

Manakah dari contoh berikut yang merupakan contoh model deteksi kosakata terbuka atau pentanahan?

Grounding DINO, bersama dengan GLIP, OWL-ViT, ViLD, dan Detic, adalah detektor kosakata terbuka atau grounding yang terkenal.