РЪКОВОДСТВО за визуален AI

DragGAN Интерактивно редактиране

DragGAN ви позволява да редактирате изображение чрез буквално плъзгане на точки: вземете място и го плъзнете към целта и картината се деформира реалистично, променяйки позата, формата или изражението.

2 min readПоследна актуализация

Преглед

It matters because it makes precise, intuitive image manipulation possible without sliders, masks, or text prompts.

Дълбоко гмуркане

DragGAN, от Pan, Tewari, Leimkuhler и колеги от Max Planck и партньори (SIGGRAPH 2023), представи точково интерактивно редактиране на изображения, генерирани от GAN. Потребителят поставя една или повече точки „дръжка“ върху изображение и съответните „целеви“ точки, където те трябва да се движат. След това DragGAN итеративно избутва латентния код, така че съдържанието под всяка дръжка да се плъзга към целта си, докато останалата част от изображението остава кохерентна. Можете да удължите краката на животно, да накарате човек да се усмихне, да завъртите кола или да промените контурите на пейзаж, всичко това чрез плъзгане. Най-важното е, че редакциите зачитат наученото изображение, така че резултатите остават реалистични, вместо да размазват пикселите. Опционална маска ограничава кои региони могат да се движат, като дава фин локализиран контрол.

Техническа информация

DragGAN работи в предварително обучено латентно и функционално пространство на GAN. Той използва две редуващи се стъпки: наблюдение на движението, което измества латентния код, така че елементите близо до всяка ръкохватка да се движат към целевата посока, и проследяване на точки, което премества дръжката, за да следва функцията, към която е била закотвена, използвайки търсене на най-близък съсед в картите на характеристиките. Повтарянето на тези стъпки обхожда изображението по колектора GAN, създавайки плавни, реалистични деформации.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на интерактивното редактиране на DragGAN

DragGAN предизвика бърза последваща работа, като внесе контрол, базиран на плъзгане, към дифузионни модели (като DragDiffusion и FreeDrag), които обработват реални снимки и произволно съдържание по-стабилно, отколкото само GAN. Очаквайте редактирането с плъзгане да се превърне в стандартен инструмент в креативния софтуер, съчетано с контроли за текст и региони и разширено до видео и 3D, така че потребителите да могат да поставят обекти в рамки или да променят формата на мрежата интерактивно, като същевременно запазват фотореализма.

Внедряване в реалния свят

Коригиране на изражението на портрета, посоката на погледа или прическата чрез плъзгане на точки на лицето

Промяна на позата и ориентацията на животно или превозно средство, като завъртане на кола или препозициониране на глава на лъв

Преоформяне на снимки на продукти (удължаване, разширяване или повторно позициониране на обекти) за дизайнерски макети

Фина настройка на пейзаж или модни изображения чрез плъзгане на контури, като промяна на планински форми или кройка на облеклото

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DragGAN Interactive Editing quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Tune-A-Video Еднократно редактиране

Frequently asked questions

What is DragGAN Interactive Editing?

DragGAN ви позволява да редактирате изображение чрез буквално плъзгане на точки: вземете място и го плъзнете към целта и картината се деформира реалистично, променяйки позата, формата или изражението. Има значение, защото прави възможна прецизна, интуитивна манипулация на изображения без плъзгачи, маски или текстови подкани.

Как потребителят редактира изображение в DragGAN?

DragGAN редактира работата, като поставя точки на манипулатори и ги плъзга към целевите места, деформирайки съответно изображението.

Какви са двете редуващи се основни стъпки на DragGAN?

DragGAN редува наблюдение на движението (преместване на функции към цели) и проследяване на точки (преместване на дръжки), повтаряйки, докато приключи.

Защо редакциите на DragGAN изглеждат реалистични, а не размазани?

Тъй като манипулацията се случва в латентното пространство на предварително обучен GAN, резултатите остават върху колектора от реалистични изображения.

Какво контролира незадължителната маска в DragGAN?

Маската позволява на потребителите да ограничават редакциите до избрани региони, така че останалата част от изображението да остане фиксирана.

DragGAN беше представен по-специално на кое място през 2023 г.?

DragGAN беше публикуван на SIGGRAPH 2023, водеща конференция за компютърна графика.