PRZEWODNIK Wizualnej AI

Inwersja tekstu zerowego

Inwersja tekstu zerowego to technika, która pozwala edytować prawdziwe zdjęcie za pomocą modelu dyfuzji opartego na tekście, takiego jak Stable Diffusion, zachowując przy tym wszystko, o co nie prosiłeś, w nienaruszonym stanie.

2 minuty czytaniaOstatnia aktualizacja

Przegląd

It bridges the gap between generating fresh images and faithfully reconstructing and re-editing ones you already have.

Głębokie nurkowanie

Aby edytować prawdziwy obraz za pomocą modelu dyfuzyjnego, należy najpierw uruchomić proces generowania wstecz, aby znaleźć szum, który mógłby go odtworzyć. Robi to szybka metoda zwana inwersją DDIM, ale dryfuje, więc rekonstrukcja wygląda nieco błędnie. Naprowadzanie wolne od klasyfikatorów, które zwiększa siłę podpowiedzi tekstowych sterujących obrazem, mocno wzmacnia to dryfowanie. Inwersja tekstu zerowego, wprowadzona przez badaczy Google w 2022 r., rozwiązuje ten problem, pozostawiając model zamrożony i zamiast tego optymalizując osadzanie tekstu „zerowego” (pustego) stosowanego w wytycznych, po jednym na krok odszumiania. Spowoduje to przypięcie rekonstrukcji z powrotem do oryginalnego obrazu, dzięki czemu późniejsze modyfikacje, takie jak zamiana „psa” w „kota”, zmieniają jedynie zamierzoną treść.

Wgląd techniczny

Naprowadzanie bez klasyfikatorów ekstrapoluje przewidywanie warunkowe (z podpowiedzią) i bezwarunkowe (z osadzeniem pustego podpowiedzi). Inwersja tekstu zerowego utrzymuje rzeczywisty monit i wagi na stałym poziomie, a gradient optymalizuje tylko puste osadzanie na każdym z około 50 etapów dyfuzji, dzięki czemu prowadzona trajektoria śledzi wstępnie obliczoną ścieżkę DDIM. Rezultatem jest rekonstrukcja z dokładnością do niemal pikseli i pełną siłą prowadzenia, pozwalającą na precyzyjną edycję.

Wpływ strategiczny

Szybkość i skala

Wizualna sztuczna inteligencja może automatyzować zadania inspekcji, wykrywania i znakowania na dużą skalę.

Buduj wybory

Zespoły kreatywne mogą szybciej prototypować koncepcje przy mniejszej liczbie ręcznych poprawek.

Zespół i przepływ pracy

Operacje mogą wykorzystywać sygnały obrazu i wideo, które wcześniej były trudne do przetworzenia.

Przyszłość inwersji tekstu zerowego

Inwersja tekstu zerowego była powolna, ponieważ optymalizuje każdy obraz, więc nowsze prace zmierzają w stronę natychmiastowej inwersji bez optymalizacji. Metody takie jak inwersja z podpowiedzią negatywną, inwersja bezpośrednia i podejścia oparte na szybszej spójności i modelach kilkuetapowych mają na celu tę samą wierność w jednym przejściu do przodu. Można się spodziewać, że inwersja stanie się cichym, wbudowanym krokiem w edytorach zdjęć konsumenckich, umożliwiającym niezawodną edycję rzeczywistych obrazów bez konieczności zaglądania przez użytkownika do matematyki.

Implementacja w świecie rzeczywistym

Edycja prawdziwego zdjęcia z wakacji, tak aby zaparkowany samochód nabrał innego koloru, a ulica, ludzie i oświetlenie pozostały nietknięte

Zamiana rasy prawdziwego zwierzaka na portrecie rodzinnym bez zmiany tła lub pozy

Zmiana pory roku na zdjęciu krajobrazowym (liście letnie na jesienne) poprzez edycję tylko słowa podpowiedzi

Możliwość wprowadzania lokalnych zmian w stylu „od monitu do monitu” w obrazach przesłanych przez użytkowników w prezentacjach badawczych i aplikacjach do edycji

Zagrożenia i poręcze

Prawa do wizerunku i zgoda mogą stanowić ryzyko prawne, jeśli pochodzenie jest niejasne.

Wydajność modelu może się różnić w zależności od oświetlenia, demografii i środowiska.

Fałszywie pozytywne wyniki mogą pozostać niezauważone, chyba że monitorowane są progi ufności.

Plan wdrożenia

1

Zdefiniuj kryteria akceptacji dotyczące kosztów precyzji, wycofania i błędów.

2

Przetestuj na danych odpowiadających rzeczywistym warunkom produkcyjnym.

3

Dodaj weryfikację manualną, aby prognozy były mało pewne lub miały duży wpływ.

4

Śledź dryf modelu i przeprowadzaj ponowną weryfikację po zmianie kamery lub zbioru danych.

Odkrywaj dalej

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Null-Text Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Rozpocznij quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Następny poradnik

Utwórz wideo z tekstu na wideo

Często zadawane pytania

What is Null-Text Inversion?

Inwersja tekstu zerowego to technika, która pozwala edytować prawdziwe zdjęcie za pomocą modelu dyfuzji opartego na tekście, takiego jak Stable Diffusion, zachowując przy tym wszystko, o co nie prosiłeś, w nienaruszonym stanie. Wypełnia lukę pomiędzy generowaniem świeżych obrazów a wiernym rekonstruowaniem i ponownym edytowaniem tych, które już masz.

Co tak naprawdę optymalizuje inwersja tekstu zerowego?

Utrzymuje model i rzeczywisty monit w stanie zamrożenia i optymalizuje jedynie osadzanie tekstu bezwarunkowego/null w każdym kroku czasowym, co jest szybkie i nieniszczące.

Dlaczego zwykła inwersja DDIM staje się zawodna, gdy jest używana do edycji?

Inwersja DDIM kumuluje małe błędy, a mocne wskazówki potrzebne do dobrych edycji powiększają ten dryf, pogarszając rekonstrukcję.

Jaki jest główny cel odwracania prawdziwego obrazu przed jego edycją?

Edycja wymaga zarodka szumu i trajektorii, która rekonstruuje oryginał, więc szybkie zmiany zmieniają tylko zamierzoną treść.

W przybliżeniu, jak inwersja tekstu zerowego radzi sobie z optymalizacją w procesie dyfuzji?

Odrębne osadzanie tekstu zerowego jest dostrajane w każdym kroku czasowym, więc prowadzona ścieżka ściśle śledzi wcześniej obliczoną trajektorię inwersji.

Z jakim podejściem do edycji najczęściej łączy się inwersję tekstu zerowego?

Gdy prawdziwy obraz zostanie wiernie odwrócony, metody oparte na podpowiedziach, takie jak monit po monitie, mogą wprowadzać ukierunkowane, zlokalizowane zmiany.