РЪКОВОДСТВО по основи

Дифузионни модели

Дифузионните модели генерират изображения, като се научават да обръщат процес на шум, превръщайки произволни статики в детайлни картини стъпка по стъпка.

2 min readПоследна актуализация

Преглед

They power today's leading text-to-image tools like Stable Diffusion, DALL-E, and Midjourney.

Дълбоко гмуркане

Дифузионният модел се обучава в две посоки. В напредващия процес чистото изображение постепенно се разваля чрез добавяне на малки количества произволен шум, докато стане чисто статично. След това моделът научава обратното: започвайки от шума, той предвижда и премахва малко шум на всяка стъпка, повтаряйки десетки или стотици пъти, докато се появи рязко изображение. За да стане това контролируемо, текстова подкана насочва всяка стъпка за премахване на шума, така че „астронавт, яздейки кон“ насочва статиката към тази картина. Модерни системи като Stable Diffusion изпълняват този процес в компресирано латентно пространство, а не върху необработени пиксели, което го прави много по-бърз. В сравнение с GAN, дифузионните модели се обучават по-стабилно и произвеждат по-голямо разнообразие, поради което те изпревариха GAN като доминиращ подход за генериране на висококачествени изображения около 2022 г.

Техническа информация

Ключовият трик е, че мрежата никога не трябва да генерира изображение в един кадър; той само се научава да предвижда шума, добавен на дадена стъпка. По време на обучение известно количество шум се добавя към реално изображение и моделът се иска да оцени този шум; разликата е грешката в обучението. По време на генериране моделът многократно изважда своя прогнозиран шум, като постепенно разкрива структурата. Кондиционирането на текста се инжектира чрез кръстосано внимание, а насоките без класификатор усилват колко силно подканата управлява изхода.

Стратегическо въздействие

Clearer decisions

Помага ви да отделите ясните технически твърдения от маркетинговия език.

Cost and budget

Можете да задавате въпроси за по-добро внедряване, преди да харчите пари или време.

Team and workflow

Екипи със споделено разбиране вземат по-добри решения за продукти, политики и обучение.

Бъдещето на дифузионните модели

Дифузията е текущото състояние на техниката за генериране на изображения и все по-често видео и аудио, с инструменти като Sora, които го разширяват до движение. Големият тласък е скоростта: техники като модели за дестилация и консистенция имат за цел да намалят стотици стъпки за премахване на шум до няколко или дори една, позволявайки генериране в реално време. Очаквайте разпространението да се разшири в 3D активи, научен дизайн като молекули и протеини и строго контролируемо редактиране, като същевременно стане достатъчно евтино, за да работи на телефони.

Внедряване в реалния свят

Създаване на оригинални произведения на изкуството и изображения от текстови подкани в Stable Diffusion, DALL-E и Midjourney

Прерисуване и надрисуване, безпроблемно попълване или разширяване на части от снимка

Генериране на видео от текст в инструменти като Sora на OpenAI

Проектиране на нови молекули и протеинови структури за изследване на откриването на лекарства

Рискове и предпазни огради

Различните екипи могат да използват един и същи термин по различен начин, така че дефинирайте обхвата рано.

Бенчмарковете могат да изглеждат силни, докато производителността в реалния свят е неравномерна.

Пренебрегването на качеството на данните и плановете за оценка често създава крехки резултати.

Пътна карта за изпълнение

1

Започнете с дефиниция на обикновен език за резултата, от който се нуждаете.

2

Изберете един показател за успех и едно условие за неуспех преди тестване.

3

Изпълнете малък пилотен проект с представителни данни, а не изпипан демонстрационен набор.

4

Документирайте къде дифузионните модели помагат и къде по-простите методи са по-добри.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Дифузионен модел GLIDE

Frequently asked questions

What is Diffusion Models?

Дифузионните модели генерират изображения, като се научават да обръщат процес на шум, превръщайки произволни статики в детайлни картини стъпка по стъпка. Те захранват днешните водещи инструменти за текст към изображение като Stable Diffusion, DALL-E и Midjourney.

Каква е основната идея зад това как моделът на дифузия генерира изображение?

Дифузионният модел се научава да обръща процес на шум, започвайки от чист шум и премахвайки шума стъпка по стъпка, докато се появи ясно изображение.

По време на обучението, какво всъщност моделът се научава да прогнозира на всяка стъпка?

Моделът получава шумно изображение и се научава да оценява шума, който е добавен, така че по-късно да може да извади шума по време на генерирането.

Как текстовата подкана влияе върху генерираното изображение?

Кондиционирането на текста (чрез кръстосано внимание и насоки) подтиква всяка стъпка за премахване на шума, така че появяващото се изображение да съответства на подканата.

Защо Stable Diffusion изпълнява процеса в „латентно пространство“?

Работата в компресирано латентно пространство вместо пиксели с пълна разделителна способност драстично намалява изчисленията, като същевременно запазва качеството.

Кое е едно от ключовите предимства на дифузионните модели пред GAN?

Дифузионните модели избягват нестабилната състезателна игра и колапса на режима на GAN, осигурявайки по-надеждно обучение и по-голямо разнообразие на изхода.