Обнаружение объектов с открытым словарем
Обнаружение объектов с открытым словарем позволяет модели находить и упаковывать объекты, описанные произвольным текстом, включая категории, которые она никогда не видела помеченными во время обучения.
Обзор
It matters because traditional detectors are locked to a fixed list of classes, while open-vocabulary models can detect almost anything you can name.
Глубокое погружение
Классические детекторы обучаются на закрытом наборе категорий, скажем, на 80 классах COCO, и не могут распознавать «вещи» за пределами этого списка. Обнаружение открытого словаря нарушает правила, которые ограничиваются выравниванием функций визуальной области с общим пространством внедрения визуального языка, обычно извлекаемым из массивных пар изображение-текст (как в CLIP). При выводе вы предоставляете текстовые метки, модель встраивает эти метки и сопоставляет обнаруженные области с ближайшим к ним встраиванием текста, поэтому новые категории работают до тех пор, пока вы можете их описать. Такие системы, как ViLD, GLIP, OWL-ViT, Detic и Grounding DINO, популяризировали этот подход, сочетая магистрали обнаружения с языковым обучением и обучая на больших, слабо размеченных или заземляющих наборах данных.
Техническая информация
Хитрость заключается в замене фиксированного слоя классификатора встраиванием текста. Вместо изучения одного весового вектора для каждого известного класса детектор проецирует каждую область в то же пространство, что и языковой кодер; Классификация становится сравнением сходства между особенностями региона и встраиванием названий или фраз категорий, предоставленных пользователем. Поскольку кодировщик текста обобщает невидимые слова, замена новых строк меток во время тестирования позволяет обнаруживать категории, отсутствующие в обучающих данных ограничительной рамки.
Стратегическое воздействие
Скорость и масштаб
Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.
Выбор сборки
Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.
Команда и рабочий процесс
Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.
Будущее обнаружения объектов с открытым словарем
Обнаружение открытого словарного запаса сходится с заземлением и сегментацией, когда фразы в свободной форме (а не просто отдельные слова) локализуют объекты, а также с системами подсказок в сочетании с такими моделями, как SAM для масок. Ожидайте более высокой точности с нуля, более длинных и составных текстовых запросов («красная кружка за ноутбуком») и тесной связи с мультимодальными помощниками, которые обнаруживают по требованию. По мере совершенствования обучения изображений и текста в веб-масштабе грань между обнаружением, извлечением информации и пониманием языка будет стираться в сторону общего визуального обучения.
Реальная реализация
Поиск изображений редких или нестандартных объектов путем ввода их названий без переобучения
Робототехнические системы, определяющие местонахождение предмета, который пользователь называет на естественном языке, прежде чем схватить его.
Автоматическая маркировка наборов данных путем обнаружения множества новых категорий из текстового списка.
Модерация контента, которая помечает описанные объекты, отсутствующие в исходных обучающих метках.
Риски и ограничения
Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.
Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.
Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.
Дорожная карта реализации
Определите критерии приемки точности, стоимости отзыва и ошибок.
Тестируйте с данными, которые соответствуют реальным производственным условиям.
Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.
Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Open-Vocabulary Object Detection quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Обнаружение объектов
Часто задаваемые вопросы
What is Open-Vocabulary Object Detection?
Обнаружение объектов с открытым словарем позволяет модели находить и упаковывать объекты, описанные произвольным текстом, включая категории, которые она никогда не видела помеченными во время обучения. Это важно, поскольку традиционные детекторы привязаны к фиксированному списку классов, в то время как модели с открытым словарем могут обнаружить практически все, что вы можете назвать.
Какова определяющая способность обнаружения объектов с открытым словарем?
Обнаружение открытого словаря может локализовать категории, указанные в тексте во время тестирования, даже те, которые никогда не были отмечены ограничивающими рамками.
Как эти модели классифицируют обнаруженный регион?
Они проецируют регионы в пространство встраивания визуального языка и сопоставляют каждый регион с ближайшим встраиванием текстовой метки.
Какой ресурс предварительной подготовки наиболее способствует обнаружению открытого словарного запаса?
Массивные данные изображения и текста (используемые моделями в стиле CLIP) создают общее пространство встраивания, которое позволяет обобщать текст по новым категориям.
Какой компонент заменяется по сравнению с детектором закрытого типа?
Вместо фиксированных весовых векторов классов классификация использует сходство с встраиванием текста, поэтому во время тестирования можно добавлять новые строки меток.
Что из этого является примером модели обнаружения открытого словаря или заземления?
Заземление DINO, наряду с GLIP, OWL-ViT, ViLD и Detic, являются хорошо известными детекторами открытого словаря или заземления.