Візуальний AI GUIDE

Виявлення в реальному часі YOLO

YOLO (You Only Look Once) — це сімейство моделей виявлення об’єктів, які знаходять і позначають кожен об’єкт на зображенні за допомогою одного проходу нейронної мережі, досить швидко для живого відео.

2 хвилини читанняОстаннє оновлення

Огляд

Its speed unlocked real-time vision on everything from drones to self-checkout kiosks.

Глибоке занурення

До YOLO такі детектори, як R-CNN, запускали класифікатор тисячі разів у регіонах зображення, що було повільно. YOLO, представлений Джозефом Редмоном у 2015 році, переформулював виявлення як одну проблему регресії: розділіть зображення на сітку та передбачте для кожної комірки обмежувальні рамки, оцінку об’єктності та ймовірності класу за один прохід вперед. Завдяки такій конструкції «подивіться один раз» він значно швидший за двоступеневі детектори, залишаючись точним. Сімейство швидко еволюціонувало через багато версій (YOLOv2 через YOLOv8 і далі), додаючи анкерні коробки, кращі магістралі та головки без анкерів. Сучасні варіанти працюють зі швидкістю понад 100 кадрів на секунду на GPU, що робить YOLO вибором за замовчуванням, коли затримка важлива не менше за точність.

Технічне розуміння

YOLO розбиває зображення на сітку S на S. Кожна комірка передбачає фіксований набір обмежувальних прямокутників із (x, y, шириною, висотою), оцінкою достовірності та ймовірностями класу за один прохід. Повторювані поля, що перекриваються, відсікаються за допомогою немаксимального придушення, яке зберігає поле з найвищою достовірністю та відкидає інші, що перевищують порогове значення IoU. Втрата спільно оптимізує координати коробки, об’єктність і класифікацію, тому весь детектор тренується від кінця до кінця.

Стратегічний вплив

Швидкість і масштаб

Візуальний штучний інтелект може автоматизувати масштабні завдання перевірки, виявлення та позначення тегами.

Створіть вибір

Творчі групи можуть створювати прототипи концепцій швидше з меншою кількістю переглядів вручну.

Команда та робочий процес

Операції можуть використовувати зображення та відеосигнали, які раніше було важко обробити.

Майбутнє виявлення в реальному часі YOLO

YOLO зберігає тенденцію до периферійного розгортання з меншими квантованими моделями, які працюють на телефонах, мікроконтролерах і вбудованих камерах без підключення до хмари. У нових випусках поєднуються компоненти трансформатора та конструкції без анкерів для забезпечення точності без шкоди для швидкості. Очікуйте тіснішої інтеграції з відстеженням і сегментацією, виявлення відкритого словника, що розпізнає об’єкти за текстовими підказками, а не за фіксованими мітками, і постійної уваги до ефективної роботи на дешевому апаратному забезпеченні з низьким енергоспоживанням на краю.

Реалізація в реальному світі

Системи самообслуговування та магазини без каси виявляють товари, коли покупці їх забирають

Безпілотники та сільськогосподарські роботи виявляють посіви, бур’яни чи худобу в реальному часі

Камери дорожнього руху та відеоспостереження, які підраховують транспортні засоби та виявляють пішоходів для аналітики розумних міст

Виробничі лінії, що відмічають дефектні деталі на швидкоплинному конвеєрі

Ризики та огорожі

Права на зображення та згода можуть стати юридичними ризиками, якщо походження невідоме.

Продуктивність моделі може відрізнятися залежно від освітлення, демографічних показників і середовища.

Помилкові спрацьовування можуть залишитися непоміченими, якщо не відстежувати пороги довіри.

Дорожня карта впровадження

1

Визначте критерії прийнятності для точності, відкликання та вартості помилок.

2

Тестуйте з даними, які відповідають реальним умовам виробництва.

3

Додайте перевірку людиною для прогнозів із низьким рівнем достовірності або високого впливу.

4

Відстежуйте дрейф моделі та повторно перевіряйте після зміни камери або набору даних.

Продовжуйте досліджувати

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YOLO Real-Time Detection quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Розпочати вікторину

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Наступний посібник

Голосові агенти в реальному часі

Часті запитання

What is YOLO Real-Time Detection?

YOLO (You Only Look Once) — це сімейство моделей виявлення об’єктів, які знаходять і позначають кожен об’єкт на зображенні за допомогою одного проходу нейронної мережі, досить швидко для живого відео. Його швидкість розблокувала бачення в режимі реального часу на будь-якому пристрої: від дронів до кіосків самообслуговування.

Що в цьому контексті означає абревіатура YOLO?

YOLO розшифровується як «You Only Look Once», що означає, що він виявляє всі об’єкти в одній нейронній мережі, що проходить по зображенню.

Яке ключове нововведення зробило YOLO швидшим за попередні детектори, такі як R-CNN?

YOLO переформулював виявлення як одну задачу регресії над сіткою зображення, замінивши повільну класифікацію двоступеневих детекторів по регіонах.

Яка техніка видаляє повторювані обмежувальні рамки, що перекриваються, у виводі YOLO?

Немаксимальне придушення зберігає поле з найвищою достовірністю та відкидає блоки, що перекриваються, вище порогового значення перетину над об’єднанням.

У оригінальному дизайні YOLO, як розділяється вхідне зображення для передбачення?

YOLO розбиває зображення на сітку S на S, і кожна комірка відповідає за передбачення прямокутників і ймовірностей класів для об’єктів, розташованих у ній.

Яку величину передбачає кожна клітинка сітки разом із координатами обмежувальної рамки?

Кожна комірка прогнозує координати коробки, оцінку достовірності об’єктності та ймовірності класів, усе разом за один прохід вперед.