Несдвоен превод на CycleGAN
CycleGAN се научава да превежда изображения между два визуални домейна (като коне към зебри или снимки към картини), без изобщо да се налага съпоставяне на примерни двойки преди и след.
Преглед
It matters because collecting paired training data is often impossible, and CycleGAN unlocks style transfer for messy real-world datasets.
Дълбоко гмуркане
Въведен през 2017 г. от Zhu, Park, Isola и Efros, CycleGAN се занимава с несдвоен превод от изображение към изображение. Повечето по-ранни методи (като pix2pix) се нуждаеха от точни двойки: една и съща сцена като снимка и като скица. CycleGAN премахва това изискване с помощта на два генератора (G преобразува домейн A в B, F преобразува B обратно в A) и два дискриминатора, които оценяват реализма във всеки домейн. Пробивът е загубата на последователност на цикъла: ако преведете снимка на кон в зебра и я преведете обратно, трябва да възстановите оригиналния кон. Това ограничение спира генератора да измисля произволни изходи и принуждава смислени съпоставяния, запазващи съдържанието. Известно е, че превръща летните пейзажи в зимни, картините на Моне в снимки и ябълките в портокали, всички научени от две несвързани купчини изображения.
Техническа информация
CycleGAN съчетава конкурентна загуба със загуба на последователност на цикъла. Всеки генератор е изправен пред PatchGAN дискриминатор, който класифицира припокриващите се изображения като истински или фалшиви, вместо да преценява цялото изображение. Загубата на цикъл налага F(G(x)) около x и G(F(y)) около y, използвайки L1 наказание за реконструкция. Незадължителната загуба на самоличност запазва цвета, когато дадено изображение вече принадлежи към целевия домейн. И двата генератора се обучават едновременно, научавайки обратни преобразувания, които запазват структурата непокътната.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на несдвоения превод на CycleGAN
Основната идея на CycleGAN, последователността на цикъла, продължава да живее в съвременната несдвоена преводаческа работа, включително базирани на дифузия методи, които разменят гръбнака на GAN за модели за премахване на шума с по-отчетливи и разнообразни изходи. Изследователите сега прилагат несдвоен превод към медицински образи (синтезиращи модалности на сканиране), адаптиране на домейн за симулация на самостоятелно управление към реален трансфер и увеличаване на данните. Очаквайте по-строг контрол върху това какво се променя в сравнение с това какво остава фиксирано, плюс хибридни подходи, смесващи ограничения на цикъла с редактиране на дифузия, обусловено от текст.
Внедряване в реалния свят
Превръщане на снимки в стила на рисуване на Моне, Ван Гог или Сезан без сдвоени примери за фоторисуване
Преобразуване на летни пейзажни снимки в зимни сцени (и обратно) за създаване на активи за филми и игри
Превеждане на MRI сканирания в CT-подобни изображения в медицински изследвания, където не са налични сдвоени сканирания на пациенти
Адаптиране на кадри от синтетичен симулатор на шофиране, за да изглеждат фотореалистични за трениране на възприемането на автономно превозно средство
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the CycleGAN Unpaired Translation quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Pix2Pix Превод от изображение към изображение
Frequently asked questions
What is CycleGAN Unpaired Translation?
CycleGAN се научава да превежда изображения между два визуални домейна (като коне към зебри или снимки към картини), без изобщо да се налага съпоставяне на примерни двойки преди и след. Има значение, защото събирането на сдвоени тренировъчни данни често е невъзможно, а CycleGAN отключва трансфер на стил за объркани набори от данни в реалния свят.
Какъв ключов проблем решава CycleGAN, който по-ранните методи като pix2pix не могат?
Основният принос на CycleGAN е несдвоен превод, изучаване на съпоставяния между домейни от две несвързани колекции от изображения, а не точни двойки.
Какво налага загубата на последователност на цикъла?
Съгласуваността на цикъла означава, че F(G(x)) трябва да е равно на x: кон, превърнат в зебра и обратно, трябва да изглежда като оригиналния кон.
Колко генератора използва стандартният CycleGAN?
CycleGAN използва два генератора, по един за всяка посока на транслация (A към B и B към A), плюс два дискриминатора.
Какъв тип дискриминатор обикновено използва CycleGAN?
CycleGAN използва PatchGAN дискриминатор, който оценява припокриващите се пачове като истински или фалшиви, насърчавайки местния реализъм.
Защо загубата на самоличност понякога се добавя в CycleGAN?
Загубата на идентичност санкционира ненужните промени, когато изображението вече е в целевия домейн, помагайки за запазване на цветовете и нюанса.