PRZEWODNIK Wizualnej AI

Podpisy obrazów

Podpisy do obrazów to zadanie polegające na automatycznym wygenerowaniu zdania w języku naturalnym opisującego to, co znajduje się na obrazku.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It bridges vision and language, turning pixels into words that explain content, objects, and actions.

Głębokie nurkowanie

Systemy podpisów do obrazów pobierają obraz i wyświetlają płynny opis, na przykład „brązowy pies łapiący frisbee na trawie”. Wczesne systemy łączyły sieć splotową, która wyodrębniała cechy wizualne, z siecią rekurencyjną (LSTM), która generowała słowa pojedynczo, często kierując się uwagą, dzięki czemu model „patrzył” na odpowiednie regiony dla każdego słowa. Nowoczesne systemy wykorzystują kodery transformatorowe do wizji i dekodery transformatorowe do języka, a duże modele wizyjno-językowe, takie jak BLIP-2 i GPT-4V, mogą podpisywać obrazy z niezwykłą płynnością. Szkolenie opiera się na zbiorach danych, takich jak MS COCO, gdzie każdy obraz ma wiele napisów pisanych przez człowieka. Jakość mierzy się za pomocą wskaźników takich jak CIDEr, BLEU i CLIPScore oparty na osadzaniu.

Wgląd techniczny

Większość twórców napisów postępuje zgodnie ze schematem koder-dekoder. Koder konwertuje obraz na zbiór wektorów cech; dekoder generuje słowa autoregresywnie, przewidując każdy token uwarunkowany obrazem i wcześniej wygenerowanymi słowami. Uwaga pozwala dekoderowi ważyć różne obszary obrazu na słowo, poprawiając uziemienie. Szkolenie wykorzystuje entropię krzyżową w podpisach opartych na faktach, po czym czasami następuje uczenie się przez wzmacnianie, które optymalizuje bezpośrednio metrykę jakości podpisu, taką jak CIDEr, w celu zmniejszenia błędu ekspozycji.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość podpisów obrazów

Napisy łączą się w ogólne modele języka wizyjnego, które nie tylko opisują, ale także odpowiadają na pytania, uzasadniają i wykonują instrukcje dotyczące obrazów. Spodziewaj się gęstszych, łatwiejszych do kontrolowania napisów (z możliwością regulacji długości, stylu lub ostrości), lepszego uzasadnienia merytorycznego, aby ograniczyć halucynacje, oraz silniejszych narzędzi ułatwień dostępu, które opowiadają świat wizualny w czasie rzeczywistym. Rozszerzy się wielojęzyczność i napisy do filmów, a modele na urządzenia zapewnią prywatne, natychmiastowe opisy na telefonach i urządzeniach do noszenia dla użytkowników niewidomych i słabowidzących.

Implementacja w świecie rzeczywistym

Generowanie opisów zdjęć w formacie alternatywnym, aby czytniki ekranu mogły pomóc użytkownikom niewidomym i słabowidzącym

Automatyczne sugerowanie podpisów i przeszukiwalnych tagów dla dużych bibliotek zdjęć i platform obrazów stockowych

Głośne opisywanie otoczenia za pomocą aplikacji takich jak Microsoft Seeing AI lub Be My Eyes

Indeksowanie klatek wideo z opisami tekstowymi w celu umożliwienia wyszukiwania i moderowania treści na dużą skalę

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Image Captioning quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Często zadawane pytania

What is Image Captioning?

Podpisy do obrazów to zadanie polegające na automatycznym wygenerowaniu zdania w języku naturalnym opisującego to, co znajduje się na obrazku. Łączy wizję i język, zamieniając piksele w słowa wyjaśniające treść, obiekty i działania.

Co system napisów do obrazów generuje jako wynik?

Podpisy obrazów generują zdanie tekstowe opisujące zawartość obrazu.

Jaką rolę odgrywa koder wizualny w klasycznym procesie tworzenia napisów?

Koder (często CNN lub transformator wizyjny) przekształca obraz w wektory cech, których następnie używa dekoder języka.

Dlaczego uwaga jest przydatna w podpisach obrazów?

Uwaga pomaga dekoderowi „patrzeć” na najbardziej istotne części obrazu podczas generowania każdego słowa, poprawiając uziemienie.

Który zbiór danych jest powszechnie używany do uczenia i oceniania podpisów obrazów?

MS COCO udostępnia obrazy w połączeniu z wieloma napisami pisanymi przez człowieka, co czyni je standardowym punktem odniesienia dla napisów.

Co oznacza, że dekoder napisów generuje słowa „autoregresywnie”?

Generowanie autoregresyjne tworzy tokeny pojedynczo, każdy uwarunkowany na podstawie wcześniejszych tokenów i obrazu.