Architektura U-Net
U-Net to splotowa sieć neuronowa w kształcie litery „U”, która doskonale nadaje się do tworzenia wyników precyzyjnych co do piksela, pierwotnie przeznaczonych do segmentacji obrazu biomedycznego.
Przegląd
Its encoder-decoder design with skip connections makes it the backbone of modern image diffusion models.
Głębokie nurkowanie
Wprowadzony przez Ronnebergera, Fischera i Broxa w 2015 roku do segmentacji biomedycznej, U-Net ma ścieżkę zawężającą (koder), która próbkuje obraz w dół do kompaktowych funkcji wysokiego poziomu, oraz symetryczną ścieżkę rozszerzającą (dekoder), która zwiększa próbkowanie z powrotem do pełnej rozdzielczości. Jego charakterystyczną cechą jest pomijanie połączeń: mapy funkcji z każdego poziomu kodera są łączone w pasujący poziom dekodera. Umożliwia to dekoderowi ponowne wykorzystanie drobnych szczegółów przestrzennych (krawędzie, dokładne lokalizacje), które w przeciwnym razie zostałyby utracone podczas próbkowania w dół, dzięki czemu dane wyjściowe są zarówno bogate semantycznie, jak i przestrzennie precyzyjne. U-Net dobrze trenował na podstawie bardzo niewielu obrazów z adnotacjami i przy dużym wzmocnieniu. Obecnie obsługuje modele Stable Diffusion i podobne, w których sieć U-Net przewiduje usunięcie szumu na każdym etapie odszumiania, często wspomaganego uwagą i warunkowaniem krokowym.
Wgląd techniczny
Magia tkwi w pomijaniu połączeń. Gdy koder zmniejsza próbkowanie, abstrahuje „co” jest obecne, ale zamazuje „gdzie” to jest. Dekoder dokonuje upsamplingu w celu odzyskania rozdzielczości, ale brakuje mu wyraźnych szczegółów. Łącząc mapę funkcji każdego kodera z dekoderem w tej samej skali, U-Net przekazuje precyzyjne informacje przestrzenne bezpośrednio przez wąskie gardło, umożliwiając połączenie głębokich funkcji semantycznych i dokładnej lokalizacji. Dlatego maski segmentacji są ściśle dopasowywane do granic obiektów.
Wpływ strategiczny
Szybkość i skala
Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.
Buduj wybory
Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.
Zespół i przepływ pracy
Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.
Przyszłość architektury U-Net
U-Net pozostaje koniem pociągowym, ale ewoluuje. W generowaniu obrazu szkielety dyfuzyjne oparte na transformatorach (DiT) stanowią wyzwanie dla splotowej sieci U-Net na dużą skalę, podczas gdy hybrydy dodają warstwy uwagi wewnątrz sieci U-Net. Jeśli chodzi o segmentację, kodery transformatorowe i modele podstawowe, takie jak SAM, opierają się na pomysłach U-Net. Można się spodziewać, że zasada pomijania połączeń stosowana w U-Net będzie obowiązywać nawet wtedy, gdy elementy składowe przesuną się z czystych splotów w kierunku architektur opartych na uwadze i hybrydowych.
Implementacja w świecie rzeczywistym
Segmentacja guzów, komórek lub narządów w obrazach MRI i mikroskopowych, oryginalne i wciąż powszechne zastosowanie U-Net.
Pełni funkcję sieci odszumiającej w trybie Stable Diffusion i przewiduje, że szum będzie odejmowany na każdym etapie generowania obrazu.
Analiza zdjęć satelitarnych i lotniczych, np. mapowanie dróg, budynków lub wylesianie piksel po pikselu.
Zadania przetwarzania obrazu na obraz, takie jak usuwanie tła, malowanie i superrozdzielczość, w przypadku których dane wyjściowe muszą być wyrównane z pikselami wejściowymi.
Zagrożenia i poręcze
Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.
Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.
Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.
Plan wdrożenia
Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.
Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.
Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.
Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.
Odkrywaj dalej
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the U-Net Architecture quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Następny poradnik
Architektura StyleGAN
Często zadawane pytania
What is U-Net Architecture?
U-Net to splotowa sieć neuronowa w kształcie litery „U”, która doskonale nadaje się do tworzenia wyników precyzyjnych co do piksela, pierwotnie przeznaczonych do segmentacji obrazu biomedycznego. Konstrukcja kodera-dekodera z połączeniami pomijanymi sprawia, że jest to szkielet nowoczesnych modeli dyfuzji obrazu.
Co nadaje U-Net kształt litery „U”?
Koder kurczący i symetryczny dekoder rozszerzający tworzą dwa ramiona litery „U”.
Jaki jest cel połączeń pomijanych w U-Net?
Pomiń połączenia, które łączą mapy funkcji kodera z dekoderem, przywracając precyzyjne szczegóły przestrzenne utracone podczas próbkowania w dół.
Do czego pierwotnie zaprojektowano U-Net?
Ronneberger i współpracownicy wprowadzili U-Net w 2015 r. do segmentacji obrazów biomedycznych, dobrze radząc sobie z kilkoma oznaczonymi obrazami.
Co w przypadku Stable Diffusion przewiduje U-Net na każdym kroku?
Sieć dyfuzyjna U-Net jest przeszkolona do przewidywania szumu dodanego do szumu ukrytego, aby można go było odjąć, stopniowo usuwając szum w kierunku obrazu.
Co dzieje się z informacją przestrzenną, gdy koder zmniejsza próbkowanie?
Próbkowanie w dół buduje funkcje semantyczne wysokiego poziomu, jednocześnie zacierając dokładną lokalizację przestrzenną, co pozwala później pominąć połączenia i pomóc w ich przywróceniu.