Görsel Yapay Zeka KILAVUZU

Resim Altyazısı

Görüntü altyazısı, bir resimde ne olduğunu açıklayan doğal dilde bir cümleyi otomatik olarak oluşturma görevidir.

2 min readSon güncelleme

Genel Bakış

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

Derin Dalış

Resim yazısı ekleme sistemleri bir resim alır ve 'çimenlerin üzerinde frizbi yakalayan kahverengi bir köpek' gibi akıcı bir açıklama üretir. İlk sistemler, görsel özellikleri çıkaran bir evrişimli ağı, kelimeleri teker teker üreten, genellikle dikkatle yönlendirilen ve modelin her kelime için ilgili bölgelere 'bakmasını' sağlayan tekrarlayan bir ağla (bir LSTM) eşleştiriyordu. Modern sistemler, görüntü için transformatör kodlayıcıları ve dil için dönüştürücü kod çözücüleri kullanır ve BLIP-2 ve GPT-4V gibi büyük görüntü dili modelleri, görüntülere olağanüstü akıcılıkla altyazı yazabilir. Eğitim, her görüntünün insan tarafından yazılan birden fazla altyazıya sahip olduğu MS COCO gibi veri kümelerine dayanır. Kalite, CIDEr, BLEU ve yerleştirme tabanlı CLIPScore gibi ölçümlerle ölçülür.

Teknik Bilgi

Çoğu altyazı oluşturucu bir kodlayıcı-kod çözücü modelini izler. Kodlayıcı, görüntüyü bir dizi özellik vektörüne dönüştürür; kod çözücü, görüntüye ve önceden oluşturulmuş sözcüklere koşullandırılan her bir jetonu tahmin ederek, sözcükleri otoregresif olarak üretir. Dikkat, kod çözücünün kelime başına farklı görüntü bölgelerini ağırlıklandırmasını sağlayarak topraklamayı iyileştirir. Eğitim, gerçekçi altyazılarda çapraz entropi kullanır ve bazen bunu, maruz kalma yanlılığını azaltmak için doğrudan CIDEr gibi altyazı kalitesi ölçümünü optimize eden takviyeli öğrenme takip eder.

Stratejik Etki

Speed and scale

Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.

Build choices

Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.

Ekip ve iş akışı

Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.

Resim Altyazısının Geleceği

Altyazı oluşturma, yalnızca açıklamakla kalmayıp aynı zamanda soruları, akıl yürütmeyi ve görüntülerle ilgili talimatları takip eden genel görüş dili modelleriyle birleşiyor. Daha yoğun, daha kontrol edilebilir altyazılar (ayarlanabilir uzunluk, stil veya odak), halüsinasyonlu nesneleri engellemek için daha iyi gerçeklere dayalı temeller ve görsel dünyayı gerçek zamanlı olarak anlatan daha güçlü erişilebilirlik araçları bekleyin. Çok dilli ve video altyazıları genişleyecek ve cihaz üstü modeller, görme engelli ve az gören kullanıcılar için telefonlara ve giyilebilir cihazlara özel, anında açıklamalar getirecek.

Gerçek Dünya Uygulaması

Ekran okuyucuların kör ve az gören kullanıcılara yardımcı olabilmesi için fotoğrafların alternatif metin açıklamalarını oluşturma

Büyük fotoğraf kitaplıkları ve stok görsel platformları için otomatik olarak altyazı önerme ve aranabilir etiketler

Microsoft Seeing AI veya Be My Eyes gibi uygulamalar aracılığıyla çevreyi yüksek sesle açıklama

Geniş ölçekte içerik arama ve denetlemeyi etkinleştirmek için video karelerini metin açıklamalarıyla dizine ekleme

Riskler ve Korkuluklar

Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.

Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.

Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.

Uygulama Yol Haritası

1

Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.

2

Gerçek üretim koşullarıyla eşleşen verilerle test edin.

3

Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.

4

Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.

Keşfetmeye Devam Edin

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Testi başlat

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

FLUX Görüntü Modelleri

Sık sorulan sorular

What is Image Captioning?

Görüntü altyazısı, bir resimde ne olduğunu açıklayan doğal dilde bir cümleyi otomatik olarak oluşturma görevidir. Pikselleri içeriği, nesneleri ve eylemleri açıklayan kelimelere dönüştürerek görüş ve dil arasında köprü kurar.

Bir görüntü altyazı sistemi çıktı olarak ne üretir?

Görüntü altyazısı, bir resmin içeriğini açıklayan bir metin cümlesi oluşturur.

Klasik altyazı oluşturma hattında görsel kodlayıcının rolü nedir?

Kodlayıcı (genellikle bir CNN veya görüntü transformatörü), görüntüyü daha sonra dil kod çözücünün kullandığı özellik vektörlerine dönüştürür.

Resim altyazısında dikkat neden faydalıdır?

Dikkat, kod çözücünün her bir kelimeyi oluştururken görüntünün en ilgili kısımlarına 'bakmasına' yardımcı olarak temellendirmeyi geliştirir.

Görüntü altyazısını eğitmek ve değerlendirmek için yaygın olarak hangi veri kümesi kullanılır?

MS COCO, her biri insan tarafından yazılmış birden fazla altyazıyla eşleştirilmiş görüntüler sağlar ve bu da onu standart bir altyazı kriteri haline getirir.

Bir altyazı kod çözücünün kelimeleri 'otoregresif olarak' üretmesi ne anlama gelir?

Otoregresif nesil, her biri önceki belirteçlere ve görüntüye göre koşullandırılan belirteçleri birer birer üretir.