DragGAN Интерактивно редактиране
DragGAN ви позволява да редактирате изображение чрез буквално плъзгане на точки: вземете място и го плъзнете към целта и картината се деформира реалистично, променяйки позата, формата или изражението.
Преглед
It matters because it makes precise, intuitive image manipulation possible without sliders, masks, or text prompts.
Дълбоко гмуркане
DragGAN, от Pan, Tewari, Leimkuhler и колеги от Max Planck и партньори (SIGGRAPH 2023), представи точково интерактивно редактиране на изображения, генерирани от GAN. Потребителят поставя една или повече точки „дръжка“ върху изображение и съответните „целеви“ точки, където те трябва да се движат. След това DragGAN итеративно избутва латентния код, така че съдържанието под всяка дръжка да се плъзга към целта си, докато останалата част от изображението остава кохерентна. Можете да удължите краката на животно, да накарате човек да се усмихне, да завъртите кола или да промените контурите на пейзаж, всичко това чрез плъзгане. Най-важното е, че редакциите зачитат наученото изображение, така че резултатите остават реалистични, вместо да размазват пикселите. Опционална маска ограничава кои региони могат да се движат, като дава фин локализиран контрол.
Техническа информация
DragGAN работи в предварително обучено латентно и функционално пространство на GAN. Той използва две редуващи се стъпки: наблюдение на движението, което измества латентния код, така че елементите близо до всяка ръкохватка да се движат към целевата посока, и проследяване на точки, което премества дръжката, за да следва функцията, към която е била закотвена, използвайки търсене на най-близък съсед в картите на характеристиките. Повтарянето на тези стъпки обхожда изображението по колектора GAN, създавайки плавни, реалистични деформации.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на интерактивното редактиране на DragGAN
DragGAN предизвика бърза последваща работа, като внесе контрол, базиран на плъзгане, към дифузионни модели (като DragDiffusion и FreeDrag), които обработват реални снимки и произволно съдържание по-стабилно, отколкото само GAN. Очаквайте редактирането с плъзгане да се превърне в стандартен инструмент в креативния софтуер, съчетано с контроли за текст и региони и разширено до видео и 3D, така че потребителите да могат да поставят обекти в рамки или да променят формата на мрежата интерактивно, като същевременно запазват фотореализма.
Внедряване в реалния свят
Коригиране на изражението на портрета, посоката на погледа или прическата чрез плъзгане на точки на лицето
Промяна на позата и ориентацията на животно или превозно средство, като завъртане на кола или препозициониране на глава на лъв
Преоформяне на снимки на продукти (удължаване, разширяване или повторно позициониране на обекти) за дизайнерски макети
Фина настройка на пейзаж или модни изображения чрез плъзгане на контури, като промяна на планински форми или кройка на облеклото
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DragGAN Interactive Editing quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Tune-A-Video Еднократно редактиране
Frequently asked questions
What is DragGAN Interactive Editing?
DragGAN ви позволява да редактирате изображение чрез буквално плъзгане на точки: вземете място и го плъзнете към целта и картината се деформира реалистично, променяйки позата, формата или изражението. Има значение, защото прави възможна прецизна, интуитивна манипулация на изображения без плъзгачи, маски или текстови подкани.
Как потребителят редактира изображение в DragGAN?
DragGAN редактира работата, като поставя точки на манипулатори и ги плъзга към целевите места, деформирайки съответно изображението.
Какви са двете редуващи се основни стъпки на DragGAN?
DragGAN редува наблюдение на движението (преместване на функции към цели) и проследяване на точки (преместване на дръжки), повтаряйки, докато приключи.
Защо редакциите на DragGAN изглеждат реалистични, а не размазани?
Тъй като манипулацията се случва в латентното пространство на предварително обучен GAN, резултатите остават върху колектора от реалистични изображения.
Какво контролира незадължителната маска в DragGAN?
Маската позволява на потребителите да ограничават редакциите до избрани региони, така че останалата част от изображението да остане фиксирана.
DragGAN беше представен по-специално на кое място през 2023 г.?
DragGAN беше публикуван на SIGGRAPH 2023, водеща конференция за компютърна графика.