Сверточные нейронные сети
Сверточные нейронные сети (CNN) — это рабочая лошадка для понимания изображений.
Обзор
They learn visual patterns by sliding small filters across a picture, which is why they power everything from face unlock to medical scan analysis.
Глубокое погружение
CNN обрабатывает изображение, перемещая по пикселям небольшие сетки весов, называемые фильтрами или ядрами. Каждый фильтр сканирует один шаблон, например край, цветное пятно или угол. Ранние слои обнаруживают простые функции; более глубокие слои объединяют их в глаза, колеса или текст. Поскольку один и тот же фильтр повторно используется в каждой позиции (распределение веса), CNN требуется гораздо меньше параметров, чем полностью подключенной сети, и она может обнаружить кошку независимо от того, появляется ли она в верхнем левом или нижнем правом углу. Слои пула сжимают изображение между этапами, делая сеть быстрее и более терпимой к небольшим изменениям. Такие знаковые разработки, как LeNet, AlexNet (2012) и ResNet, привели к буму глубокого обучения, а победа AlexNet в ImageNet положила начало современной эре в этой области.
Техническая информация
Основная операция — это свертка: фильтр (скажем, веса 3x3) накладывается на участок пикселей, каждый вес умножается на соответствующий пиксель, а результаты суммируются в одно выходное число. При перемещении фильтра создается карта объектов. Две идеи делают это эффективным: распределение веса (один фильтр используется повсюду) и локальная связность (каждый нейрон видит только небольшую область). Объединение свертки, нелинейности, такой как ReLU, и объединение в пулы позволяют сети строить иерархию все более абстрактных визуальных функций.
Стратегическое воздействие
Более четкие решения
Это поможет вам отделить четкие технические заявления от маркетингового языка.
Стоимость и бюджет
Вы можете задать более эффективные вопросы по реализации, прежде чем тратить деньги или время.
Команда и рабочий процесс
Команды с общим пониманием принимают более эффективные решения по продуктам, политике и обучению.
Будущее сверточных нейронных сетей
CNN остаются доминирующими в сфере видения в реальном времени и с ограниченными ресурсами, например, телефонные камеры и восприятие беспилотных автомобилей, потому что они быстры и эффективны в отношении данных. Vision Transformers теперь конкурируют с ними или превосходят их в больших наборах данных, поэтому область сближается к гибридным конструкциям, которые сочетают в себе эффективность свертки с глобальным мышлением внимания. Ожидается, что CNN сохранятся во встроенных и периферийных устройствах, в медицинской визуализации, где данных недостаточно, а также в качестве эффективных экстракторов функций, питающих более крупные мультимодальные системы на долгие годы.
Реальная реализация
Обнаружение опухолей, переломов и диабетической ретинопатии с помощью рентгенографии, компьютерной томографии и фотографий сетчатки.
Поддержка распознавания лиц для разблокировки телефона и пометки фотографий в таких приложениях, как Google Photos.
Чтение уличных знаков, разметки полос движения и пешеходов в системах восприятия беспилотных автомобилей.
Автоматическая маркировка дефектной продукции на заводских сборочных линиях с помощью камеры проверки
Риски и ограничения
Разные команды могут использовать один и тот же термин по-разному, поэтому заранее определите масштаб.
Тесты могут выглядеть сильными, в то время как реальная производительность неравномерна.
Игнорирование качества данных и планов оценки часто приводит к нестабильным результатам.
Дорожная карта реализации
Начните с простого определения желаемого результата.
Перед тестированием выберите один показатель успеха и одно условие отказа.
Запустите небольшой пилотный проект с репрезентативными данными, а не отточенный демонстрационный набор.
Документируйте, где помогают сверточные нейронные сети и где более простые методы лучше.
Продолжайте исследовать
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Convolutional Neural Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Следующее руководство
Графовые нейронные сети
Часто задаваемые вопросы
What is Convolutional Neural Networks?
Сверточные нейронные сети (CNN) — это рабочая лошадка для понимания изображений. Они изучают визуальные закономерности, перемещая небольшие фильтры по изображению, поэтому они обеспечивают все: от разблокировки по лицу до анализа медицинского сканирования.
Какова основная задача фильтра (ядра) в CNN?
Фильтр представляет собой небольшую сетку весов, которая скользит по изображению и активируется, когда обнаруживает изученный шаблон, например край или текстуру.
Почему CNN требуется гораздо меньше параметров, чем полностью подключенной сети для изображений?
Распределение весов означает, что повсюду на изображении применяется один небольшой фильтр, поэтому сеть повторно использует одни и те же веса вместо того, чтобы изучать отдельные веса для каждого местоположения пикселя.
Что обычно делает слой объединения?
Объединение в пулы (например, максимальное объединение) уменьшает выборку карты объектов, сокращая объем вычислений и делая сеть менее чувствительной к тому, где именно появляется объект.
Как в глубокой CNN обычно меняются функции от ранних слоев к более поздним?
Ранние слои обнаруживают низкоуровневые функции, такие как края и цвета; более глубокие слои объединяют их в концепции более высокого уровня, такие как лица или части объектов.
Какому событию многие приписывают начало современного бума глубокого обучения в сфере видения?
Впечатляющая победа AlexNet ImageNet в 2012 году с использованием глубокой CNN на графических процессорах убедила исследователей в том, что глубокое обучение может превзойти старые методы, что вызвало быстрый рост этой области.