U-Net архитектура
U-Net е конволюционна невронна мрежа, оформена като „U“, която се отличава с извеждането на точни до пиксели резултати, първоначално за сегментиране на биомедицински изображения.
Преглед
Its encoder-decoder design with skip connections makes it the backbone of modern image diffusion models.
Дълбоко гмуркане
Въведен от Ronneberger, Fischer и Brox през 2015 г. за биомедицинско сегментиране, U-Net има свиващ се път (енкодер), който намалява изображението в компактни функции на високо ниво, и симетричен разширяващ се път (декодер), който увеличава семплирането обратно до пълна разделителна способност. Неговата характерна характеристика е пропускане на връзки: картите на характеристиките от всяко ниво на енкодер се свързват в нивото на съответстващия декодер. Това позволява на декодера да използва повторно фини пространствени детайли (ръбове, точни местоположения), които иначе би загубил намаляването на дискретизацията, така че резултатите са както семантично богати, така и пространствено прецизни. U-Net тренира добре от много малко анотирани изображения, използвайки тежко увеличение. Днес той захранва Stable Diffusion и подобни модели, където U-Net прогнозира шума, който трябва да се премахне при всяка стъпка на премахване на шума, често подсилен с внимание и кондициониране на времева стъпка.
Техническа информация
Магията е в прескачащите връзки. Докато енкодерът намалява дискретизацията, той абстрахира „какво“ е налице, но замъглява „къде“ е то. Декодерът повишава дискретизацията, за да възстанови разделителната способност, но му липсват ясни детайли. Чрез свързване на всяка карта на характеристиките на енкодера към декодера в същия мащаб, U-Net предава прецизна пространствена информация директно през тясното място, позволявайки дълбоки семантични характеристики и фина локализация да се комбинират. Ето защо маските за сегментиране се подравняват плътно към границите на обекта.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на U-Net архитектурата
U-Net остава работен кон, но се развива. При генерирането на изображения базираните на трансформатори дифузионни гръбнаци (DiTs) предизвикват конволюционната U-Net в голям мащаб, докато хибридите добавят слоеве за внимание вътре в U-Net. При сегментирането трансформаторните енкодери и базовите модели като SAM се основават на идеите на U-Net. Очаквайте принципът на прескачане на връзката на U-Net да се запази, дори когато градивните елементи се изместят от чисти конволюции към базирани на вниманието и хибридни архитектури.
Внедряване в реалния свят
Сегментиране на тумори, клетки или органи в MRI и микроскопски изображения, оригиналната и все още често срещана употреба на U-Net.
Служи като мрежа за премахване на шума в Stable Diffusion, предвиждаща шума за изваждане на всяка стъпка от генерирането на изображение.
Анализ на сателитни и въздушни изображения, като картографиране на пътища, сгради или обезлесяване пиксел по пиксел.
Задачи от изображение към изображение като премахване на фона, рисуване и супер разделителна способност, където изходът трябва да се изравни с входните пиксели.
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the U-Net Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Архитектура StyleGAN
Frequently asked questions
What is U-Net Architecture?
U-Net е конволюционна невронна мрежа, оформена като „U“, която се отличава с извеждането на точни до пиксели резултати, първоначално за сегментиране на биомедицински изображения. Неговият дизайн на енкодер-декодер с прескачащи връзки го прави гръбнакът на съвременните модели за дифузия на изображения.
Какво придава на U-Net неговата U-образна форма?
Свиващият се енкодер и симетричният разширяващ се декодер образуват двете рамена на 'U'.
Каква е целта на прескачащите връзки на U-Net?
Прескачащите връзки обединяват картите на функциите на енкодера в декодера, възстановявайки прецизни пространствени детайли, загубени по време на понижаване на дискретизацията.
За какво първоначално е проектиран U-Net?
Ronneberger и колегите му представиха U-Net през 2015 г. за сегментиране на биомедицински изображения, представяйки се добре с малко етикетирани изображения.
При Stable Diffusion какво прогнозира U-Net на всяка стъпка?
Дифузионната U-Net е обучена да предсказва шума, добавен към латентния, така че да може да бъде изваден, постепенно намалявайки шума към изображение.
Какво се случва с пространствената информация, докато енкодерът намалява дискретизацията?
Намаляването на дискретизацията изгражда семантични характеристики на високо ниво, като същевременно замъглява точната пространствена локализация, която пропуска връзките по-късно помага за възстановяването.