PRZEWODNIK Wizualnej AI

Rozdzielczość LaMa - Solidne malowanie

LaMa (Large Mask inpainting) to szybka i lekka sieć neuronowa, która wypełnia brakujące lub usunięte obszary obrazu, nawet jeśli dziura jest ogromna.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It matters because it produces convincing fills at resolutions far higher than it was trained on, making professional object removal accessible to anyone.

Głębokie nurkowanie

LaMa, wprowadzona przez badaczy sztucznej inteligencji firmy Samsung w 2021 r., rozwiązuje długotrwały problem: większość malowanych modeli rozmazuje się lub rozmazuje, gdy wymagane jest wypełnienie dużych masek lub powtarzalnych tekstur, takich jak ceglane ściany i płytki podłogowe. Przełomem jest zastosowanie szybkich splotów Fouriera (FFC), które zapewniają sieci globalne pole recepcyjne w jednej warstwie, zamiast wymagać dziesiątek nałożonych na siebie splotów. Dzięki temu LaMa „widzi” cały obraz na raz i spójnie kontynuuje struktury okresowe. Jest trenowany poprzez kombinację straty kontradyktoryjnej i utraty percepcyjnej w oparciu o sieć, która sama wykorzystuje szerokie pola recepcyjne. Wynik pozwala na wyjątkowo dobre uogólnienie, często po przeszkoleniu na mniejszych obrazach, wyświetlając czyste obrazy 2K.

Wgląd techniczny

Kluczowym elementem jest szybki splot Fouriera. Normalny splot dotyczy tylko małej lokalnej łatki, więc przechwytywanie struktury dalekiego zasięgu wymaga bardzo głębokiej sieci. FFC przekształca część mapy obiektów w dziedzinę częstotliwości, stosuje tam splot, a następnie przekształca z powrotem. Ponieważ operacje w dziedzinie częstotliwości mają z natury charakter globalny, pojedyncza warstwa FFC miesza informacje na całym obrazie, pomagając LaMa powtarzać tekstury i szanować globalną geometrię, taką jak krawędzie ścian.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość LaMa-Solidne malowanie

LaMa pozostaje silną, wydajną podstawą i jest szeroko osadzona w bezpłatnych narzędziach i edytorach zdjęć typu open source, ponieważ działa szybko na skromnym sprzęcie bez gigantycznego modelu dyfuzji. Trendem są rurociągi hybrydowe: użyj LaMa do natychmiastowych wypełnień konstrukcyjnych i zgrubnych przeciągów, a następnie opcjonalnie dopracuj szczegóły za pomocą modelu dyfuzyjnego. Można się spodziewać, że pomysł splotu Fouriera będzie nadal pojawiał się w zastosowaniach związanych z edycją w czasie rzeczywistym, naprawą klatek wideo i czyszczeniem zdjęć na urządzeniu mobilnym, gdzie najważniejsza jest szybkość i mała ilość pamięci.

Implementacja w świecie rzeczywistym

Usuwanie turystów lub fotobombowców ze zdjęć z podróży, przy jednoczesnym zachowaniu płynnej ściany tła lub nieba

Usuwanie znaków wodnych, znaczników czasu i logo z obrazów w celu legalnych prac konserwatorskich

Usuwanie linii energetycznych i znaków drogowych ze zdjęć z ogłoszeń nieruchomości

Przywracanie starych lub uszkodzonych zeskanowanych fotografii poprzez uzupełnianie zadrapań, rozdarć i brakujących rogów

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the LaMa Resolution-Robust Inpainting quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

CodeFormer Solidne odzyskiwanie twarzy

Często zadawane pytania

What is LaMa Resolution-Robust Inpainting?

LaMa (Large Mask inpainting) to szybka i lekka sieć neuronowa, która wypełnia brakujące lub usunięte obszary obrazu, nawet jeśli dziura jest ogromna. Ma to znaczenie, ponieważ zapewnia przekonujące wypełnienia w rozdzielczościach znacznie wyższych niż te, na których był trenowany, dzięki czemu profesjonalne usuwanie obiektów jest dostępne dla każdego.

Jaki jest charakterystyczny element architektoniczny, który nadaje LaMa globalny obraz obrazu?

LaMa wykorzystuje szybkie sploty Fouriera (FFC), które działają częściowo w dziedzinie częstotliwości, aby zapewnić globalne pole recepcyjne w jednej warstwie.

Dlaczego LaMa radzi sobie lepiej z dużymi maskami niż wiele wcześniejszych modeli do malowania?

Ponieważ FFC widzą cały obraz na raz, LaMa może spójnie kontynuować tekstury i geometrię nawet w przypadku bardzo dużych brakujących obszarów.

Godną uwagi zaletą LaMa jest możliwość malowania obrazów w jakiej rozdzielczości?

LaMa dobrze uogólnia na rozdzielczości wyższe niż te obserwowane podczas treningu, dlatego nazywa się ją odporną na rozdzielczość.

Z jakimi teksturami LaMa radzi sobie szczególnie dobrze dzięki przetwarzaniu w dziedzinie częstotliwości?

Sploty w domenie częstotliwości dobrze pasują do wzorców okresowych, więc LaMa w czysty sposób kontynuuje powtarzanie tekstur, takich jak ceglane ściany i podłogi wyłożone kafelkami.

Która strata pomaga LaMa tworzyć realistycznie wyglądające wypełnienia zamiast rozmazanych średnich?

LaMa łączy straty kontradyktoryjne i percepcyjne, zachęcając do ostrych, wiarygodnych tekstur zamiast rozmytych uśrednionych pikseli.