PANDUAN AI Visual

Menjawab Pertanyaan Visual

Visual Question Answering (VQA) memungkinkan sistem menjawab pertanyaan bahasa alami dalam bentuk bebas tentang suatu gambar, seperti 'Berapa banyak orang yang memakai topi?' Diperlukan pemahaman bersama baik gambar maupun pertanyaan untuk menghasilkan jawaban yang benar.

2 min readTerakhir diperbarui

Menyelam Lebih Dalam

Visual Question Answering menggabungkan visi komputer dan pemrosesan bahasa alami: jika diberikan gambar dan pertanyaan, model akan mengembalikan jawaban, yang mungkin berupa satu kata, frasa pendek, atau respons ya/tidak. Tugas ini dipopulerkan oleh kumpulan data VQA (Antol et al., 2015) dan versi VQA v2.0 yang disempurnakan, yang menyeimbangkan jawaban untuk mencegah model menebak hanya dari teks. Sistem mengkodekan gambar dan pertanyaan, menggabungkan dua representasi, dan kemudian memprediksi jawaban, secara historis dengan mengklasifikasikan kosakata jawaban yang tetap. Saat ini, model bahasa visi besar seperti GPT-4V, LLaVA, dan PaLI menangani VQA terbuka, penalaran tentang objek, atribut, jumlah, hubungan spasial, dan bahkan teks yang ditulis di dalam gambar.

Wawasan Teknis

Model VQA tipikal mengkodekan gambar (CNN atau transformator visi) dan pertanyaan (encoder teks transformator), kemudian menggabungkannya, sering kali dengan perhatian silang sehingga kata-kata pertanyaan masuk ke wilayah gambar. Vektor yang digabungkan memberi pengklasifikasi pada jawaban umum atau dekoder bahasa untuk balasan terbuka. Salah satu kelemahan umum adalah bias bahasa: model dapat mengeksploitasi statistik jawaban dan mengabaikan gambar, yang secara khusus dilawan oleh kumpulan data seimbang seperti VQA v2.0.

Dampak Strategis

Kecepatan dan skala

Visual AI dapat mengotomatiskan tugas inspeksi, deteksi, dan penandaan dalam skala besar.

Build choices

Tim kreatif dapat membuat prototipe konsep lebih cepat dengan lebih sedikit revisi manual.

Team and workflow

Pengoperasiannya dapat menggunakan sinyal gambar dan video yang sebelumnya sulit diproses.

Masa Depan Menjawab Pertanyaan Visual

VQA berkembang dari klasifikasi jawaban singkat menuju penalaran visual multi-langkah terbuka dan disertai penjelasan. Harapkan penanganan yang lebih kuat terhadap penghitungan, bagan, diagram, dan teks dalam gambar (VQA dokumen), ditambah VQA video yang beralasan seiring berjalannya waktu. Mengurangi bias jalan pintas dan halusinasi tetap menjadi prioritas, begitu pula dengan mendasarkan jawaban pada wilayah gambar tertentu untuk mendapatkan kepercayaan. Asisten multimoda yang mumpuni akan semakin banyak menjawab pertanyaan visual melalui telepon, robotika, dan alat aksesibilitas yang membantu pengguna menginterogasi lingkungan sekitar mereka.

Implementasi Dunia Nyata

Membiarkan pengguna tunanetra memotret suatu produk dan bertanya 'Rasa apa ini?' atau 'Berapa tanggal kadaluarsanya?'

Menjawab pertanyaan tentang bagan, formulir, dan dokumen yang dipindai (dokumen VQA) dalam alur kerja bisnis

Mendukung asisten ritel dan e-niaga yang merespons 'Apakah jaket ini memiliki tudung?' dari foto produk

Mendukung tinjauan gambar medis atau ilmiah dengan menjawab pertanyaan yang ditargetkan tentang gambar pindaian atau mikroskop

Risiko & Pagar Pembatas

Hak citra dan persetujuan dapat menjadi risiko hukum jika asal usulnya tidak jelas.

Performa model dapat bervariasi berdasarkan pencahayaan, demografi, dan lingkungan.

Positif palsu mungkin tidak diketahui kecuali ambang batas keyakinan dipantau.

Peta Jalan Implementasi

1

Tentukan kriteria penerimaan untuk biaya presisi, penarikan kembali, dan kesalahan.

2

Uji dengan data yang sesuai dengan kondisi produksi sebenarnya.

3

Tambahkan tinjauan manusia untuk prediksi dengan tingkat keyakinan rendah atau dampak tinggi.

4

Lacak penyimpangan model dan validasi ulang setelah kamera atau kumpulan data berubah.

Terus Menjelajah

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Mulai kuis

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Menjawab Pertanyaan

Pertanyaan yang sering diajukan

What is Visual Question Answering?

Visual Question Answering (VQA) memungkinkan sistem menjawab pertanyaan bahasa alami dalam bentuk bebas tentang suatu gambar, seperti 'Berapa banyak orang yang memakai topi?' Diperlukan pemahaman bersama baik gambar maupun pertanyaan untuk menghasilkan jawaban yang benar.

Apa dua input yang diambil oleh sistem Visual Question Answering?

VQA mengambil gambar dan pertanyaan tentangnya, lalu menghasilkan jawaban berdasarkan gambar tersebut.

Mengapa kumpulan data VQA v2.0 dibuat dengan jawaban 'seimbang'?

VQA v2.0 memasangkan pertanyaan dengan gambar yang memiliki jawaban berbeda, sehingga memaksa model untuk benar-benar menggunakan masukan visual daripada memanfaatkan statistik teks.

Apa itu 'bias bahasa' di VQA?

Bias bahasa terjadi ketika model mengeksploitasi statistik jawaban yang terkait dengan ungkapan pertanyaan, bukan melihat gambar.

Bagaimana banyak model VQA menggabungkan informasi gambar dan pertanyaan?

Model VQA mengkodekan setiap modalitas dan memadukannya, sering kali menggunakan perhatian silang sehingga kata tanya mengarah ke wilayah gambar yang relevan.

Sistem VQA klasik sering kali menghasilkan jawaban dengan melakukan apa?

Banyak model VQA awal memperlakukan tugas tersebut sebagai klasifikasi atas jawaban yang paling sering, meskipun model modern menghasilkan teks terbuka.