Resim Altyazısı
Görüntü altyazısı, bir resimde ne olduğunu açıklayan doğal dilde bir cümleyi otomatik olarak oluşturma görevidir.
Genel Bakış
It bridges vision and language, turning pixels into words that explain content, objects, and actions.
Derin Dalış
Resim yazısı ekleme sistemleri bir resim alır ve 'çimenlerin üzerinde frizbi yakalayan kahverengi bir köpek' gibi akıcı bir açıklama üretir. İlk sistemler, görsel özellikleri çıkaran bir evrişimli ağı, kelimeleri teker teker üreten, genellikle dikkatle yönlendirilen ve modelin her kelime için ilgili bölgelere 'bakmasını' sağlayan tekrarlayan bir ağla (bir LSTM) eşleştiriyordu. Modern sistemler, görüntü için transformatör kodlayıcıları ve dil için dönüştürücü kod çözücüleri kullanır ve BLIP-2 ve GPT-4V gibi büyük görüntü dili modelleri, görüntülere olağanüstü akıcılıkla altyazı yazabilir. Eğitim, her görüntünün insan tarafından yazılan birden fazla altyazıya sahip olduğu MS COCO gibi veri kümelerine dayanır. Kalite, CIDEr, BLEU ve yerleştirme tabanlı CLIPScore gibi ölçümlerle ölçülür.
Teknik Bilgi
Çoğu altyazı oluşturucu bir kodlayıcı-kod çözücü modelini izler. Kodlayıcı, görüntüyü bir dizi özellik vektörüne dönüştürür; kod çözücü, görüntüye ve önceden oluşturulmuş sözcüklere koşullandırılan her bir jetonu tahmin ederek, sözcükleri otoregresif olarak üretir. Dikkat, kod çözücünün kelime başına farklı görüntü bölgelerini ağırlıklandırmasını sağlayarak topraklamayı iyileştirir. Eğitim, gerçekçi altyazılarda çapraz entropi kullanır ve bazen bunu, maruz kalma yanlılığını azaltmak için doğrudan CIDEr gibi altyazı kalitesi ölçümünü optimize eden takviyeli öğrenme takip eder.
Stratejik Etki
Speed and scale
Visual AI, inceleme, algılama ve etiketleme görevlerini geniş ölçekte otomatikleştirebilir.
Build choices
Yaratıcı ekipler, daha az manuel revizyonla konseptleri daha hızlı prototipleyebilir.
Ekip ve iş akışı
Operasyonlar, daha önce işlenmesi zor olan görüntü ve video sinyallerini kullanabilir.
Resim Altyazısının Geleceği
Altyazı oluşturma, yalnızca açıklamakla kalmayıp aynı zamanda soruları, akıl yürütmeyi ve görüntülerle ilgili talimatları takip eden genel görüş dili modelleriyle birleşiyor. Daha yoğun, daha kontrol edilebilir altyazılar (ayarlanabilir uzunluk, stil veya odak), halüsinasyonlu nesneleri engellemek için daha iyi gerçeklere dayalı temeller ve görsel dünyayı gerçek zamanlı olarak anlatan daha güçlü erişilebilirlik araçları bekleyin. Çok dilli ve video altyazıları genişleyecek ve cihaz üstü modeller, görme engelli ve az gören kullanıcılar için telefonlara ve giyilebilir cihazlara özel, anında açıklamalar getirecek.
Gerçek Dünya Uygulaması
Ekran okuyucuların kör ve az gören kullanıcılara yardımcı olabilmesi için fotoğrafların alternatif metin açıklamalarını oluşturma
Büyük fotoğraf kitaplıkları ve stok görsel platformları için otomatik olarak altyazı önerme ve aranabilir etiketler
Microsoft Seeing AI veya Be My Eyes gibi uygulamalar aracılığıyla çevreyi yüksek sesle açıklama
Geniş ölçekte içerik arama ve denetlemeyi etkinleştirmek için video karelerini metin açıklamalarıyla dizine ekleme
Riskler ve Korkuluklar
Kaynağın belirsiz olması durumunda görüntü hakları ve rıza yasal risk haline gelebilir.
Model performansı aydınlatma, demografik özellikler ve ortamlara göre değişiklik gösterebilir.
Güven eşikleri izlenmediği sürece yanlış pozitifler fark edilmeyebilir.
Uygulama Yol Haritası
Kesinlik, geri çağırma ve hata maliyetlerine ilişkin kabul kriterlerini tanımlayın.
Gerçek üretim koşullarıyla eşleşen verilerle test edin.
Düşük güvenirliğe sahip veya yüksek etkili tahminler için gerçek kişi tarafından yapılan incelemeyi ekleyin.
Model kaymasını izleyin ve kamera veya veri kümesi değişikliklerinden sonra yeniden doğrulayın.
Keşfetmeye Devam Edin
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Image Captioning quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
FLUX Görüntü Modelleri
Sık sorulan sorular
What is Image Captioning?
Görüntü altyazısı, bir resimde ne olduğunu açıklayan doğal dilde bir cümleyi otomatik olarak oluşturma görevidir. Pikselleri içeriği, nesneleri ve eylemleri açıklayan kelimelere dönüştürerek görüş ve dil arasında köprü kurar.
Bir görüntü altyazı sistemi çıktı olarak ne üretir?
Görüntü altyazısı, bir resmin içeriğini açıklayan bir metin cümlesi oluşturur.
Klasik altyazı oluşturma hattında görsel kodlayıcının rolü nedir?
Kodlayıcı (genellikle bir CNN veya görüntü transformatörü), görüntüyü daha sonra dil kod çözücünün kullandığı özellik vektörlerine dönüştürür.
Resim altyazısında dikkat neden faydalıdır?
Dikkat, kod çözücünün her bir kelimeyi oluştururken görüntünün en ilgili kısımlarına 'bakmasına' yardımcı olarak temellendirmeyi geliştirir.
Görüntü altyazısını eğitmek ve değerlendirmek için yaygın olarak hangi veri kümesi kullanılır?
MS COCO, her biri insan tarafından yazılmış birden fazla altyazıyla eşleştirilmiş görüntüler sağlar ve bu da onu standart bir altyazı kriteri haline getirir.
Bir altyazı kod çözücünün kelimeleri 'otoregresif olarak' üretmesi ne anlama gelir?
Otoregresif nesil, her biri önceki belirteçlere ve görüntüye göre koşullandırılan belirteçleri birer birer üretir.