PRZEWODNIK Wizualnej AI

Edycja instrukcji InstructPix2Pix

InstructPix2Pix umożliwia edycję zdjęcia poprzez wpisanie zwykłego polecenia, takiego jak „przyrządź zimę” lub „zamień kota w psa”, bez konieczności stosowania masek ani narzędzi zaznaczania.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It taught a diffusion model to follow editing instructions directly.

Głębokie nurkowanie

InstructPix2Pix (Brooks i in., 2023) to model dyfuzyjny dostosowany do pobierania obrazu wejściowego wraz z instrukcją tekstową i wysyłania edytowanego obrazu w jednym przejściu do przodu. Sprytną sztuczką są dane szkoleniowe: autorzy wykorzystali GPT-3 do wygenerowania par napisów przed i po, a następnie wykorzystali funkcję Prompt-to-Prompt ze stabilnym rozproszeniem do syntezy pasujących par obrazów przed i po. To dało im duży zbiór danych (oryginalny obraz, instrukcja, edytowany obraz) trójek do trenowania, a wszystko to bez ręcznego etykietowania. Ponieważ instrukcje opisują zmianę, a nie całą scenę, model zachowuje niewymienione części obrazu. Wykorzystuje dwie skale wskazówek, jedną określającą, jak ściśle przestrzega instrukcji, a drugą określającą, jak wiernie trzyma się oryginalnego obrazu, umożliwiając użytkownikom kompromis między siłą edycji a wiernością.

Wgląd techniczny

Warunki modelu opierają się zarówno na obrazie źródłowym, jak i na instrukcji, stosując prowadzenie bez klasyfikatorów wzdłuż dwóch osi. Jedna skala waży instrukcję tekstową, druga waży obraz wejściowy. Zwiększenie skali obrazu pozwala zachować większą część oryginału w nienaruszonym stanie, natomiast zwiększenie skali tekstu sprawia, że ​​edycja jest bardziej agresywna. Dzięki temu podwójnemu prowadzeniu pojedyncza ogólna instrukcja niezawodnie zmienia jeden aspekt, pozostawiając resztę zdjęcia rozpoznawalną.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość edycji instrukcji InstructPix2Pix

Edycja oparta na instrukcjach staje się domyślnym interfejsem narzędzi graficznych, teraz wbudowanym w popularne aplikacje i ich następców, takich jak MagicBrush i powstające edytory wieloobrotowe. Oczekuj lepszego zachowania drobnych szczegółów, niezawodnej obsługi instrukcji przestrzennych, takich jak „przesuń lampę w lewo”, oraz płynnego rozszerzenia wideo, gdzie jednym poleceniem edytujesz cały klip. Połączenie tych modeli z agentami językowymi może umożliwić konwersacyjne opisanie pełnej sesji edycyjnej.

Implementacja w świecie rzeczywistym

Bloger pisze „dodaj jesienne liście”, aby zmienić wygląd letniego zdjęcia krajobrazu na post sezonowy.

Sprzedawca e-commerce poleca „zmienić kolor koszuli na granatowy”, aby w jednym ujęciu wygenerować warianty kolorystyczne produktu.

Nauczyciel edytuje zdjęcie historyczne za pomocą opcji „pokoloruj to”, aby ożywić czarno-biały obraz archiwalny na lekcji.

Twórca memów nakazuje „założyć psu okulary przeciwsłoneczne” bez ręcznego maskowania pyska psa.

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the InstructPix2Pix Instruction Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Interaktywna edycja DragGAN

Często zadawane pytania

What is InstructPix2Pix Instruction Editing?

InstructPix2Pix umożliwia edycję zdjęcia poprzez wpisanie zwykłego polecenia, takiego jak „przyrządź zimę” lub „zamień kota w psa”, bez konieczności stosowania masek ani narzędzi zaznaczania. Nauczyło to model dyfuzji, aby bezpośrednio postępować zgodnie z instrukcjami edycji.

Jak powiedzieć InstructPix2Pix, co ma zmienić?

Po prostu wpisz instrukcję, np. „przyrządź zimę”; nie są potrzebne żadne maski ani wybór regionu.

Jak powstały dane szkoleniowe InstructPix2Pix?

Autorzy połączyli pary podpisów wygenerowane w formacie GPT-3 z syntezą obrazów typu Prompt-to-Prompt, aby automatycznie utworzyć trójki.

Co kontrolują dwie skale prowadzące InstructPix2Pix?

Jedna skala określa, jak mocno edycja jest zgodna z instrukcją; drugi określa, jaka część obrazu źródłowego zostanie zachowana.

Dlaczego modelka ma tendencję do pozostawiania niewymienionych części obrazu w spokoju?

Instrukcja ma na celu konkretną zmianę, więc model zachowuje regiony, o których instrukcja nie wspomina.

Ile przejść do przodu potrzebuje InstructPix2Pix, aby stworzyć edycję?

Jest to pojedynczy model dyfuzji warunkowej, który łączy obraz i instrukcję i generuje edycję.