Визуальное руководство по искусственному интеллекту

Архитектура U-Net

U-Net — это сверточная нейронная сеть в форме буквы «U», которая превосходно выдает выходные данные с точностью до пикселя, первоначально предназначенные для сегментации биомедицинских изображений.

2 минуты чтенияПоследнее обновление

Обзор

Its encoder-decoder design with skip connections makes it the backbone of modern image diffusion models.

Глубокое погружение

Представленный Роннебергером, Фишером и Броксом в 2015 году для биомедицинской сегментации, U-Net имеет сжимающий путь (кодер), который преобразует изображение в компактные высокоуровневые функции, и симметричный расширяющий путь (декодер), который повышает дискретизацию до полного разрешения. Его характерной особенностью является пропуск соединений: карты объектов с каждого уровня кодера объединяются в соответствующий уровень декодера. Это позволяет декодеру повторно использовать мелкие пространственные детали (края, точные местоположения), которые в противном случае были бы потеряны при понижающей дискретизации, поэтому выходные данные являются как семантически богатыми, так и пространственно точными. U-Net хорошо обучался на очень небольшом количестве аннотированных изображений с использованием интенсивной аугментации. Сегодня он используется в стабильной диффузии и подобных моделях, в которых U-Net прогнозирует шум, который необходимо удалить на каждом этапе шумоподавления, часто дополняя его вниманием и обработкой временных шагов.

Техническая информация

Магия заключается в пропуске соединений. Когда кодер выполняет понижающую дискретизацию, он абстрагирует «что» присутствует, но размывает «где» это находится. Декодер повышает дискретизацию для восстановления разрешения, но ему не хватает четкой детализации. Объединяя каждую карту функций кодера с декодером в том же масштабе, U-Net передает точную пространственную информацию непосредственно через узкое место, позволяя объединить глубокие семантические функции и точную локализацию. Вот почему маски сегментации плотно прилегают к границам объекта.

Стратегическое воздействие

Скорость и масштаб

Визуальный ИИ может автоматизировать задачи проверки, обнаружения и маркировки в любом масштабе.

Выбор сборки

Творческие группы могут быстрее создавать прототипы концепций с меньшим количеством доработок вручную.

Команда и рабочий процесс

Операции могут использовать изображения и видеосигналы, которые раньше было трудно обрабатывать.

Будущее архитектуры U-Net

U-Net остается рабочей лошадкой, но развивается. При генерации изображений диффузионные магистрали на основе трансформаторов (DiT) бросают вызов сверточной сети U-Net в больших масштабах, в то время как гибриды добавляют уровни внимания внутри U-Net. В сегментации преобразовательные кодеры и базовые модели, такие как SAM, основаны на идеях U-Net. Ожидается, что принцип пропуска соединений U-Net сохранится даже тогда, когда строительные блоки перейдут от чистых извилин к архитектурам, основанным на внимании, и гибридным архитектурам.

Реальная реализация

Сегментация опухолей, клеток или органов на изображениях МРТ и микроскопии — оригинальное и до сих пор широко распространенное применение U-Net.

Служит сетью шумоподавления в Stable Diffusion, прогнозируя вычитание шума на каждом этапе генерации изображения.

Анализ спутниковых и аэрофотоснимков, например попиксельное картирование дорог, зданий или вырубки лесов.

Задачи преобразования изображения в изображение, такие как удаление фона, закрашивание и суперразрешение, когда выходные данные должны соответствовать входным пикселям.

Риски и ограничения

Права на изображение и согласие могут стать юридическими рисками, если происхождение неясно.

Производительность модели может варьироваться в зависимости от освещения, демографии и окружающей среды.

Ложноположительные результаты могут остаться незамеченными, если не контролировать пороговые значения достоверности.

Дорожная карта реализации

1

Определите критерии приемки точности, стоимости отзыва и ошибок.

2

Тестируйте с данными, которые соответствуют реальным производственным условиям.

3

Добавьте человеческую проверку для прогнозов с низкой достоверностью или высокой эффективностью.

4

Отслеживайте дрейф модели и выполняйте ее повторную проверку после изменений камеры или набора данных.

Продолжайте исследовать

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the U-Net Architecture quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Начать тест

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Следующее руководство

СтильГАН Архитектура

Часто задаваемые вопросы

What is U-Net Architecture?

U-Net — это сверточная нейронная сеть в форме буквы «U», которая превосходно выдает выходные данные с точностью до пикселя, первоначально предназначенные для сегментации биомедицинских изображений. Его конструкция кодера-декодера с пропускными соединениями делает его основой современных моделей диффузии изображений.

Что придает U-Net такую ​​U-образную форму?

Сжимающий кодер и симметричный расширяющий декодер образуют два плеча буквы «U».

Какова цель пропуска соединений U-Net?

Пропускные соединения объединяют карты функций кодера в декодер, восстанавливая точные пространственные детали, потерянные во время понижающей дискретизации.

Для чего изначально был разработан U-Net?

Роннебергер и его коллеги представили U-Net в 2015 году для сегментации биомедицинских изображений, которая хорошо зарекомендовала себя с небольшим количеством помеченных изображений.

Что предсказывает U-Net на каждом этапе в стабильной диффузии?

Диффузионная сеть U-Net обучена прогнозировать шум, добавляемый к скрытому, чтобы его можно было вычесть, постепенно уменьшая шум в сторону изображения.

Что происходит с пространственной информацией, когда кодер выполняет понижающую дискретизацию?

Понижение дискретизации создает семантические функции высокого уровня, одновременно размывая точную пространственную локализацию, что позволяет впоследствии пропустить соединения и помочь восстановить.