Görsel Soru Cevaplama
Görsel Soru Yanıtlama (VQA), bir sistemin bir görüntüyle ilgili 'Kaç kişi şapka takıyor?' gibi serbest biçimli doğal dil sorularını yanıtlamasına olanak tanır. Doğru bir cevap üretmek için hem resmin hem de sorunun ortaklaşa anlaşılması gerekir.
Derin Dalış
Görsel Soru Yanıtlama, bilgisayar görüşünü ve doğal dil işlemeyi birleştirir: bir görüntü ve bir soru verildiğinde, model tek bir kelime, kısa bir ifade veya evet/hayır yanıtı olabilecek bir yanıt döndürür. Görev, VQA veri seti (Antol ve diğerleri, 2015) ve modellerin yalnızca metinden tahmin yürütmesini engellemek için yanıtları dengeleyen geliştirilmiş VQA v2.0 sürümüyle popüler hale getirildi. Sistemler görüntüyü ve soruyu kodlar, iki temsili birleştirir ve ardından sabit bir cevap sözlüğü üzerinden tarihsel olarak sınıflandırma yaparak bir cevabı tahmin eder. Günümüzde GPT-4V, LLaVA ve PaLI gibi büyük görüş dili modelleri, açık uçlu VQA'yı, nesneler, nitelikler, sayımlar, mekansal ilişkiler ve hatta görüntülerin içine yazılan metinler hakkında akıl yürütmeyi ele alıyor.
Teknik Bilgi
Tipik bir VQA modeli, görüntüyü (CNN veya görüntü transformatörü) ve soruyu (transformatör metin kodlayıcısı) kodlar, ardından bunları genellikle çapraz dikkatle birleştirir, böylece soru sözcükleri görüntü bölgelerine katılır. Birleştirilmiş vektör, ortak yanıtlar üzerinden bir sınıflandırıcıyı veya açık uçlu yanıtlar için bir dil kod çözücüyü besler. Bilinen bir tuzak, dil yanlılığıdır: modeller yanıt istatistiklerinden yararlanabilir ve VQA v2.0 gibi dengeli veri kümelerinin özellikle karşı çıktığı görüntüyü göz ardı edebilir.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Görsel Soru Cevaplamanın Geleceği
VQA, kısa cevaplı sınıflandırmadan, açıklamalarla birlikte açık uçlu, çok adımlı görsel akıl yürütmeye doğru evrilmektedir. Sayım, çizelgeler, diyagramlar ve görüntü içinde metin (belge VQA) ile zaman içinde sonuç veren video VQA'nın daha güçlü bir şekilde ele alınmasını bekleyebilirsiniz. Kısayol önyargısını ve halüsinasyonu azaltmak, yanıtların güven için belirli görüntü bölgelerine dayandırılması gibi bir öncelik olmaya devam ediyor. Yetenekli çok modlu asistanlar, telefonlarda, robotikte ve kullanıcıların çevrelerini sorgulamasına yardımcı olan erişilebilirlik araçlarında görsel soruları giderek daha fazla konuşarak yanıtlayacak.
Gerçek Dünya Uygulaması
Görme engelli kullanıcıların bir ürünü fotoğraflayıp 'Bu nasıl bir lezzet?' diye sormalarına olanak sağlamak. veya 'Son kullanma tarihi nedir?'
İş iş akışlarında grafikler, formlar ve taranmış belgeler (belge VQA) hakkındaki soruları yanıtlama
'Bu ceketin kapüşonu var mı?' sorusuna yanıt veren perakende ve e-ticaret asistanlarına destek sağlıyoruz. bir ürün fotoğrafından
Taramalar veya mikroskopi görüntüleri hakkında hedefe yönelik soruları yanıtlayarak tıbbi veya bilimsel görüntü incelemesini desteklemek
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Visual Question Answering quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Soru Cevaplama
Sık sorulan sorular
What is Visual Question Answering?
Görsel Soru Yanıtlama (VQA), bir sistemin bir görüntüyle ilgili 'Kaç kişi şapka takıyor?' gibi serbest biçimli doğal dil sorularını yanıtlamasına olanak tanır. Doğru bir cevap üretmek için hem resmin hem de sorunun ortaklaşa anlaşılması gerekir.
Görsel Soru Yanıtlama sistemi hangi iki girdiyi alır?
VQA hem görüntüyü hem de onunla ilgili soruyu alır ve ardından görüntüye dayalı bir yanıt üretir.
VQA v2.0 veri kümesi neden 'dengeli' yanıtlarla oluşturuldu?
VQA v2.0, soruları farklı yanıtlara sahip görsellerle eşleştirerek modelleri metin istatistiklerinden yararlanmak yerine görsel girişi kullanmaya zorluyor.
MYK'da 'dil yanlılığı' nedir?
Dil yanlılığı, bir modelin resme bakmak yerine soru ifadelerine bağlı yanıt istatistiklerinden yararlanmasıdır.
Birçok MYK modeli görsel ve soru bilgisini nasıl birleştirir?
VQA modelleri her bir yöntemi kodlar ve bunları birleştirir; sıklıkla çapraz dikkat kullanarak soru sözcüklerinin ilgili görüntü bölgelerine yönelmesini sağlar.
Klasik MYK sistemleri genellikle ne yaparak yanıtlar üretiyordu?
İlk VQA modellerinin çoğu, görevi en sık verilen yanıtlar üzerinden sınıflandırma olarak ele alıyordu, ancak modern modeller açık uçlu metinler oluşturuyordu.