РЪКОВОДСТВО за визуален AI

DALL-E

DALL-E е семейството на OpenAI от модели текст към изображение, които превръщат писмено описание в оригинална картина.

2 min readПоследна актуализация

Преглед

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

Дълбоко гмуркане

DALL-E стартира през януари 2021 г., генерирайки изображения от текст чрез предвиждане на токени на изображения един по един, като езиков модел за пиксели. DALL-E 2 (2022) премина към подход на дифузия, ръководен от вграждания на CLIP, произвеждайки по-отчетливи и по-фотореалистични резултати. DALL-E 3 (октомври 2023) затегна следването на подкани и е вградено в ChatGPT, така че чатботът може да пренапише вашата груба заявка в подкана с богати подробности, преди да генерира. Забележително подобрение е изобразяването на четим текст в изображенията, като знаци и етикети, които по-ранните модели са изкривени. DALL-E също поддържа рисуване (редактиране на част от изображение) и рисуване (разширяване отвъд оригиналните му граници). Той създава множество варианти от една подкана, като помага на потребителите да изследват бързо творческите опции.

Техническа информация

DALL-E 3 е дифузионен модел: той започва от произволен шум и го премахва стъпка по стъпка, управляван на всяка стъпка от кодиране на вашата текстова подкана, докато се появи кохерентно изображение. Той се обучава на огромни набори от двойки изображение-надпис, научавайки как думите се съпоставят с визуални характеристики, пространствени подредби и стилове. Ключов трик са подобрените надписи по време на обучение плюс езиков модел, който разширява кратката ви подкана в подробна, поради което DALL-E 3 следва инструкциите много по-вярно от своите предшественици.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на DALL-E

Линията на DALL-E се сгъва в по-широки, мултимодални системи, където един модел обработва текст, изображения и редакции заедно, а не като отделен инструмент. Очаквайте по-строго разговорно редактиране („направете небето оранжево, запазете всичко останало“), по-добро изобразяване на текст и по-висока разделителна способност. Сигнали за произход като C2PA метаданни и водни знаци ще станат стандартни за маркиране на генерирани от AI изображения. Конкуренцията от Midjourney, Stable Diffusion и моделите на Google води до бързо повишаване на качеството, докато дебатите относно данните за обучението, съгласието на артиста и авторските права ще продължат да оформят това, от което тези системи могат да се учат.

Внедряване в реалния свят

Блогър генерира персонализирана илюстрация на заглавка за статия, вместо да търси библиотеки със стокови снимки

Учител създава прости диаграми с надписи, за да обясни научна концепция на младите ученици

Малък бизнес измисля няколко концепции за лого и опаковка, преди да наеме дизайнер, който да прецизира една

Дизайнерът на игри бързо създава концептуално изкуство за герои и среди, за да предложи идея

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Невронни радиационни полета

Frequently asked questions

What is DALL-E?

DALL-E е семейството на OpenAI от модели текст към изображение, които превръщат писмено описание в оригинална картина. Това направи „напишете изречение, получете изображение“ основна идея и избута генерирането на изображения от изследователски демонстрации в ежедневни инструменти.

Какво основно прави DALL-E 3?

DALL-E е система от текст към изображение: вие описвате сцена с думи и тя създава нова картина, съответстваща на това описание.

Каква основна техника използва DALL-E 3 за създаване на изображение?

DALL-E 3 е дифузионен модел, който започва от произволен шум и го прецизира стъпка по стъпка, управляван от вашата подкана, в кохерентно изображение.

Защо DALL-E 3 следва по-добре подканите, когато се използва в ChatGPT?

В ChatGPT езиковият модел пренаписва кратка заявка в по-богата, по-конкретна подкана, подобрявайки доколко вярно изображението съвпада с това, което искате.

Какво е забележителното подобрение, направено от DALL-E 3 спрямо по-ранните версии?

По-ранните модели изкривяваха текста в изображението, но DALL-E 3 може да изобрази четливи думи върху знаци, етикети и плакати много по-надеждно.

Какво ви позволява да правите „inpainting“ с DALL-E изображение?

Inpainting редактира избрана част от изображение (например размяна на обект), като оставя непокътната околната област.