РЪКОВОДСТВО за визуален AI

Текстова инверсия

Текстовата инверсия учи генератора на изображения на чисто нова концепция - като конкретна котка, стил на изкуство или продукт - като научава една нова дума за него, без да променя самия модел.

2 min readПоследна актуализация

Преглед

It lets you put your own subject into AI art using just 3-5 example photos.

Дълбоко гмуркане

Текстовата инверсия, въведена от изследователи през 2022 г., решава проблем с персонализирането: как да кажете на модел като Stable Diffusion да нарисува *вашето* куче, когато само „куче“ няма да го улови? Вместо да преквалифицира гигантската невронна мрежа, тя замразява целия модел и научава едно нещо: вграждане на нова „псевдодума“ – един вектор в речника на текстовия енкодер, често написан като S*. Подавате му 3-5 изображения на концепцията и оптимизацията избутва този един вектор, докато моделът надеждно възпроизведе обекта, когато въвеждате новата дума. Тъй като се научава само вектор (няколко килобайта), резултатите са малки и могат да се споделят. След това можете да пишете подкани като „S* каране на скейтборд, рисуване с маслени бои“ и концепцията се появява в нов контекст.

Техническа информация

Номерът е, че моделите от текст към изображение преобразуват всяка дума във вектор за вграждане преди генериране. Текстовата инверсия добавя нов вектор към тази таблица за вграждане и оптимизира само нея, като използва същата загуба на шум при дифузия на вашите примерни изображения. Градиентите се връщат обратно към вграждането, докато всички тегла на модела остават замразени. Резултатът е компактен вектор (няколко KB), който живее в съществуващото речниково пространство на модела - без промяна на теглата, така че основният модел запазва всичките си предишни знания.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на текстовата инверсия

Текстовата инверсия остава популярна заради малкия си размер на файла и възможността за споделяне, а общността с отворен код търгува с хиляди от тези вграждания. Бъдещите насоки го смесват с други методи - подреждане на множество научени думи за по-богати сцени, комбиниране с LoRA или DreamBooth за по-голяма точност и разширяване на идеята към видео и 3D генератори. Очаквайте „библиотеки с концепции“, където потребителите смесват и съпоставят научени токени, плюс по-бърза, почти мигновена инверсия, така че персонализирането да става за секунди, а не за минути.

Внедряване в реалния свят

Художник научава знак за своя характерен стил на илюстрация, след което го подсказва в десетки нови сцени за последователно портфолио.

Собственик на домашен любимец качва пет снимки на кучето си, за да го генерира като астронавт, ренесансова картина или карикатура.

Малка марка за електронна търговия научава дума за продукта си, за да може да го представи в много маркетингови среди без фотосесия.

Студио за игри улавя изгледа на повтарящ се герой като токен за многократна употреба, за да поддържа концептуалното изкуство последователно в целия екип.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Textual Inversion quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Обръщане на нулев текст

Frequently asked questions

What is Textual Inversion?

Текстовата инверсия учи генератора на изображения на чисто нова концепция - като конкретна котка, стил на изкуство или продукт - като научава една нова дума за него, без да променя самия модел. Позволява ви да поставите свой собствен обект в AI изкуство, като използвате само 3-5 примерни снимки.

Какво точно научава Textual Inversion по време на обучението?

Той оптимизира само един нов вектор за вграждане на псевдо думи, като същевременно запазва целия модел замразен.

Приблизително от колко примерни изображения обикновено се нуждае текстовата инверсия?

Малка шепа, обикновено 3-5 изображения на концепцията, е достатъчна, за да научите използваем токен.

Защо файловете с текстова инверсия са толкова малки (често няколко килобайта)?

Записва се само един вектор за вграждане, така че файлът е малък и лесен за споделяне.

Какво остава непроменено по време на обучението за инверсия на текст?

Базовият модел е замразен; само новото вграждане се актуализира, така че предишните знания се запазват.

Как използвате научена концепция след текстова инверсия?

Вие просто включвате новия токен (като S*) в нормална текстова подкана, за да извикате концепцията.