Згорткові нейронні мережі
Згорткові нейронні мережі (CNN) — це робоча конячка архітектури для розуміння зображень.
Огляд
They learn visual patterns by sliding small filters across a picture, which is why they power everything from face unlock to medical scan analysis.
Глибоке занурення
CNN обробляє зображення, розміщуючи невеликі сітки ваг, які називаються фільтрами або ядрами, по пікселях. Кожен фільтр сканує один візерунок, наприклад край, кольорову пляму або кут. Ранні шари виявляють прості особливості; більш глибокі шари поєднують їх в очі, колеса або текст. Оскільки той самий фільтр повторно використовується в кожній позиції (розподіл ваги), CNN потребує набагато менше параметрів, ніж повністю підключена мережа, і може помітити кота незалежно від того, з’являється він у верхньому лівому чи нижньому правому куті. Шари об’єднання зменшують зображення між кроками, роблячи мережу швидшою та толерантнішою до невеликих зрушень. Такі визначні розробки, як LeNet, AlexNet (2012) і ResNet, сприяли буму глибокого навчання, а перемога AlexNet у ImageNet поклала початок сучасній епосі цієї галузі.
Технічне розуміння
Основною операцією є згортка: фільтр (скажімо, вагові коефіцієнти 3x3) накладається на фрагмент пікселів, кожен ваговий коефіцієнт множиться на свій піксель, а результати підсумовуються в одне вихідне число. Пересуваючи фільтр, ви отримаєте карту функцій. Дві ідеї роблять це ефективним: розподіл ваги (один фільтр використовується всюди) і локальне підключення (кожен нейрон бачить лише невелику область). Згортка стекування, нелінійність, як ReLU, і об’єднання дозволяють мережі будувати ієрархію все більш абстрактних візуальних функцій.
Стратегічний вплив
Чіткіші рішення
Це допоможе вам відокремити чіткі технічні заяви від маркетингової мови.
Вартість і бюджет
Перш ніж витрачати гроші чи час, ви можете задати питання про кращу реалізацію.
Команда та робочий процес
Команди зі спільним розумінням приймають кращі рішення щодо продуктів, політики та навчання.
Майбутнє згорткових нейронних мереж
CNN залишаються домінуючими в баченні в реальному часі та з обмеженими ресурсами, як-от камери телефону та сприйняття самостійного водіння, оскільки вони швидкі та ефективні з використанням даних. Тепер Vision Transformers конкурують або перемагають їх у великих наборах даних, тож поле зближується до гібридних проектів, які поєднують ефективність згортки з глобальним мисленням уваги. Очікуйте, що CNN збережуться у вбудованих і периферійних пристроях, у медичній візуалізації, де даних мало, і як ефективні екстрактори функцій, що живлять великі мультимодальні системи протягом багатьох років.
Реалізація в реальному світі
Виявлення пухлин, переломів і діабетичної ретинопатії на рентгенівських променях, КТ і фотографіях сітківки
Розпізнавання обличчя для розблокування телефону та позначення фотографій у таких програмах, як Google Photos
Зчитування вуличних знаків, розмітки смуг руху та пішоходів у системах сприйняття безпілотних автомобілів
Автоматичне позначення дефектних продуктів на заводських конвеєрах за допомогою камерального огляду
Ризики та огорожі
Різні команди можуть використовувати той самий термін по-різному, тому визначте обсяг завчасно.
Порівняльні показники можуть виглядати сильними, тоді як продуктивність у реальному світі нерівномірна.
Ігнорування якості даних і планів оцінки часто призводить до нестабільних результатів.
Дорожня карта впровадження
Почніть із простого визначення необхідного результату.
Перед тестуванням виберіть одну метрику успіху та одну умову невдачі.
Запустіть невеликий пілот із репрезентативними даними, а не відшліфованим демонстраційним набором.
Задокументуйте, де згорткові нейронні мережі допомагають, а де простіші методи кращі.
Продовжуйте досліджувати
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Convolutional Neural Networks quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Наступний посібник
Графічні нейронні мережі
Часті запитання
What is Convolutional Neural Networks?
Згорткові нейронні мережі (CNN) — це робоча конячка архітектури для розуміння зображень. Вони вивчають візуальні шаблони, пересуваючи невеликі фільтри по зображенню, тому вони використовують все, від розблокування обличчя до аналізу медичного сканування.
Яка основна робота фільтра (ядра) у CNN?
Фільтр — це невелика сітка ваг, яка ковзає по зображенню, активуючись, коли знаходить вивчений візерунок, наприклад край або текстуру.
Чому CNN потребує набагато менше параметрів, ніж повноцінна мережа для зображень?
Розподіл ваги означає, що один невеликий фільтр застосовується всюди на зображенні, тож мережа повторно використовує однакові ваги замість того, щоб вивчати окремі для кожного пікселя.
Що зазвичай робить рівень об’єднання?
Об’єднання (наприклад, максимальне об’єднання) зменшує дискретизацію карти функцій, зменшуючи обчислення та роблячи мережу менш чутливою до того, де саме з’являється функція.
У глибокому CNN, як функції зазвичай змінюються від ранніх рівнів до наступних?
Ранні шари виявляють низькорівневі функції, такі як краї та кольори; глибші шари поєднують їх у концепції вищого рівня, такі як обличчя чи частини об’єкта.
Яку подію вважають початком сучасного буму глибокого навчання в бачення?
Драматична перемога AlexNet у ImageNet у 2012 році з використанням глибокого CNN на графічних процесорах переконала дослідників, що глибоке навчання може перевершити старі методи, викликавши швидке зростання галузі.