Модели на латентна консистенция
Моделите на латентна консистенция (LCM) са техника, която позволява на генераторите на дифузионни изображения да произвеждат висококачествени картини само в една до четири стъпки вместо обичайните десетки.
Преглед
They make near-real-time, interactive image generation practical even on modest hardware.
Дълбоко гмуркане
Стандартните модели на латентна дифузия като Stable Diffusion започват от шум и обезшумяване итеративно, като често са необходими 20 до 50 мрежови оценки, за да се направи едно изображение, което е бавно. LCM, въведени от Luo и колеги през 2023 г., прилагат дестилация на консистенция в латентното пространство на предварително обучен модел на дифузия. Ключовата идея: обучете студентска мрежа да скача директно към чистия резултат от всяка точка по траекторията на премахване на шума, така че същият отговор да бъде постигнат в една голяма стъпка, която преди това е отнела много малки. Резултатът е резки изображения в приблизително 1 до 4 стъпки. Придружаваща техника, LCM-LoRA, пакетира това ускорение като малък плъгин адаптер, който може да бъде пуснат върху съществуващи фино настроени модели Stable Diffusion, без да се преквалифицира цялата мрежа.
Техническа информация
Моделите на съгласуваност налагат свойство „самосъгласуваност“: всеки две точки на една и съща траектория на премахване на шума (траекторията на ODE на вероятностния поток) трябва да се съпостави с едно и също окончателно чисто изображение. Ученикът се дестилира от дифузионен модел на учител, за да удовлетвори това, като се научава да предсказва директно крайната точка на траекторията. Работата в компресираното латентно пространство, а не в пикселите, прави дестилацията евтина. Тъй като една оценка може да прескочи траекторията, тежкото итеративно вземане на проби се срива в няколко стъпки.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на моделите за латентна последователност
Генерирането с няколко стъпки вече е масово, с наследници като SDXL-Turbo, усъвършенствания на LCM и методи на конкурентна дестилация, които изтласкват качеството на една до две стъпки. Очаквайте това да задвижи редактиране на изображения на живо, безпроблемно редактиране, генериране на видео кадри в реално време и генериране на устройството на телефони. Границата затваря малката празнина в качеството с пълна многоетапна дифузия и разширяване на дестилацията на консистенция до видео и 3D, където спестяванията от намаляване на броя на стъпките са още по-драматични.
Внедряване в реалния свят
Инструменти за платно в реално време, които актуализират генерираното изображение, докато пишете или скицирате, с почти нулево забавяне
Изпълнение на стабилно дифузно генериране на изображения на GPU на лаптоп или телефон за част от секундата
Пускане на LCM-LoRA адаптер върху съществуващ фино настроен модел, за да го ускорите незабавно без повторно обучение
Евтино генериране на големи партиди изображения за проучване на дизайна чрез намаляване на стъпки от ~30 до ~4
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Latent Consistency Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Модели на латентна дифузия
Frequently asked questions
What is Latent Consistency Models?
Моделите на латентна консистенция (LCM) са техника, която позволява на генераторите на дифузионни изображения да произвеждат висококачествени картини само в една до четири стъпки вместо обичайните десетки. Те правят интерактивното генериране на изображения в почти реално време практично дори на скромен хардуер.
Какво е основното предимство на моделите на латентна консистенция пред стандартната латентна дифузия?
LCM свиват многото стъпки за обезшумяване на стандартната дифузия в приблизително една до четири, което позволява генериране в почти реално време.
Какво свойство на „самосъгласуваност“ налагат моделите на съгласуваност?
Съгласуваност означава, че точките по една и съща ODE траектория на потока на вероятността се картографират към един и същ краен чист резултат.
В какво пространство LCM извършват своята дестилация?
Работата в латентното пространство, както прави Stable Diffusion, прави дестилацията на консистенция ефективна.
Какво ви позволява да правите LCM-LoRA?
LCM-LoRA пакетира ускоряването като лек адаптер, който се поставя върху съществуващи фино настроени модели Stable Diffusion.
Как моделът на последователност постига генериране с няколко стъпки?
Студентската мрежа е дестилирана, за да предвиди крайната точка на траекторията на премахване на шума с един скок, а не с много малки стъпки.