Визуальное руководство по искусственному интеллекту

Визуальный ответ на вопрос

Визуальный ответ на вопросы (VQA) позволяет системе отвечать на вопросы об изображении в свободной форме на естественном языке, например: «Сколько людей носят шляпы?» Для получения правильного ответа требуется совместное понимание и картинки, и вопроса.

2 минуты чтенияПоследнее обновление

Глубокое погружение

Визуальный ответ на вопросы сочетает в себе компьютерное зрение и обработку естественного языка: учитывая изображение и вопрос, модель возвращает ответ, который может представлять собой одно слово, короткую фразу или ответ да/нет. Задача была популяризирована набором данных VQA (Antol et al., 2015) и его усовершенствованной версией VQA v2.0, в которой были сбалансированы ответы, чтобы модели не могли гадать только на основе текста. Системы кодируют изображение и вопрос, объединяют два представления, а затем предсказывают ответ, исторически проводя классификацию по фиксированному словарю ответов. Сегодня большие модели языка видения, такие как GPT-4V, LLaVA и PaLI, обрабатывают открытый VQA, рассуждая об объектах, атрибутах, счетчиках, пространственных отношениях и даже тексте, написанном внутри изображений.

Техническая информация

Типичная модель VQA кодирует изображение (CNN или преобразователь изображения) и вопрос (кодер текста преобразователя), а затем объединяет их, часто с перекрестным вниманием, поэтому вопросительные слова обращаются к областям изображения. Объединенный вектор передает классификатору общие ответы или языковому декодеру открытых ответов. Известная ошибка — языковая предвзятость: модели могут использовать статистику ответов и игнорировать изображение, чему специально противодействуют сбалансированные наборы данных, такие как VQA v2.0.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее визуальных ответов на вопросы

VQA развивается от классификации с краткими ответами к открытому, многоэтапному визуальному рассуждению с пояснениями. Ожидайте более четкой обработки подсчета, графиков, диаграмм и текста в изображении (VQA документа), а также VQA видео, которое будет учитываться с течением времени. Снижение предвзятости и галлюцинаций остается приоритетом, равно как и обоснование ответов в определенных областях изображения для обеспечения доверия. Способные мультимодальные помощники будут все чаще отвечать на визуальные вопросы в разговорной форме на телефонах, в робототехнике и в инструментах доступности, которые помогают пользователям опрашивать свое окружение.

Реальная реализация

Разрешить слепым пользователям сфотографировать продукт и спросить: «Какой это вкус?» или «Каков срок годности?»

Отвечаем на вопросы о диаграммах, формах и отсканированных документах (документ VQA) в рабочих процессах бизнеса.

Поддержка помощников в сфере розничной торговли и электронной коммерции, которые отвечают на вопрос: «Есть ли у этой куртки капюшон?» с фотографии товара

Поддержка рассмотрения медицинских или научных изображений путем ответов на целевые вопросы о сканах или изображениях, полученных при микроскопии.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Visual Question Answering quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Часто задаваемые вопросы

What is Visual Question Answering?

Визуальный ответ на вопросы (VQA) позволяет системе отвечать на вопросы об изображении в свободной форме на естественном языке, например: «Сколько людей носят шляпы?» Для получения правильного ответа требуется совместное понимание и картинки, и вопроса.

Какие два входных сигнала принимает система визуальных ответов на вопросы?

VQA берет и изображение, и вопрос о нем, а затем дает ответ, основанный на изображении.

Почему набор данных VQA v2.0 был создан со «сбалансированными» ответами?

VQA v2.0 сочетает вопросы с изображениями, которые имеют разные ответы, заставляя модели фактически использовать визуальный ввод, а не использовать текстовую статистику.

Что такое «языковая предвзятость» в VQA?

Языковая предвзятость — это когда модель использует статистику ответов, связанную с формулировкой вопроса, вместо того, чтобы смотреть на изображение.

Как многие модели VQA объединяют изображение и информацию о вопросах?

Модели VQA кодируют каждую модальность и объединяют их, часто используя перекрестное внимание, поэтому вопросительные слова обращаются к соответствующим областям изображения.

Классические системы VQA часто давали ответы, делая что?

Многие ранние модели VQA рассматривали задачу как классификацию наиболее частых ответов, хотя современные модели генерируют открытый текст.