DALL-E
DALL-E е семейството на OpenAI от модели текст към изображение, които превръщат писмено описание в оригинална картина.
Преглед
It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.
Дълбоко гмуркане
DALL-E стартира през януари 2021 г., генерирайки изображения от текст чрез предвиждане на токени на изображения един по един, като езиков модел за пиксели. DALL-E 2 (2022) премина към подход на дифузия, ръководен от вграждания на CLIP, произвеждайки по-отчетливи и по-фотореалистични резултати. DALL-E 3 (октомври 2023) затегна следването на подкани и е вградено в ChatGPT, така че чатботът може да пренапише вашата груба заявка в подкана с богати подробности, преди да генерира. Забележително подобрение е изобразяването на четим текст в изображенията, като знаци и етикети, които по-ранните модели са изкривени. DALL-E също поддържа рисуване (редактиране на част от изображение) и рисуване (разширяване отвъд оригиналните му граници). Той създава множество варианти от една подкана, като помага на потребителите да изследват бързо творческите опции.
Техническа информация
DALL-E 3 е дифузионен модел: той започва от произволен шум и го премахва стъпка по стъпка, управляван на всяка стъпка от кодиране на вашата текстова подкана, докато се появи кохерентно изображение. Той се обучава на огромни набори от двойки изображение-надпис, научавайки как думите се съпоставят с визуални характеристики, пространствени подредби и стилове. Ключов трик са подобрените надписи по време на обучение плюс езиков модел, който разширява кратката ви подкана в подробна, поради което DALL-E 3 следва инструкциите много по-вярно от своите предшественици.
Стратегическо въздействие
Speed and scale
Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.
Build choices
Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.
Team and workflow
Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.
Бъдещето на DALL-E
Линията на DALL-E се сгъва в по-широки, мултимодални системи, където един модел обработва текст, изображения и редакции заедно, а не като отделен инструмент. Очаквайте по-строго разговорно редактиране („направете небето оранжево, запазете всичко останало“), по-добро изобразяване на текст и по-висока разделителна способност. Сигнали за произход като C2PA метаданни и водни знаци ще станат стандартни за маркиране на генерирани от AI изображения. Конкуренцията от Midjourney, Stable Diffusion и моделите на Google води до бързо повишаване на качеството, докато дебатите относно данните за обучението, съгласието на артиста и авторските права ще продължат да оформят това, от което тези системи могат да се учат.
Внедряване в реалния свят
Блогър генерира персонализирана илюстрация на заглавка за статия, вместо да търси библиотеки със стокови снимки
Учител създава прости диаграми с надписи, за да обясни научна концепция на младите ученици
Малък бизнес измисля няколко концепции за лого и опаковка, преди да наеме дизайнер, който да прецизира една
Дизайнерът на игри бързо създава концептуално изкуство за герои и среди, за да предложи идея
Рискове и предпазни огради
Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.
Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.
Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.
Пътна карта за изпълнение
Определете критерии за приемане за прецизност, извикване и разходи за грешки.
Тествайте с данни, които съответстват на реалните производствени условия.
Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.
Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.
Продължете да изследвате
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DALL-E quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
Next guide
Невронни радиационни полета
Frequently asked questions
What is DALL-E?
DALL-E е семейството на OpenAI от модели текст към изображение, които превръщат писмено описание в оригинална картина. Това направи „напишете изречение, получете изображение“ основна идея и избута генерирането на изображения от изследователски демонстрации в ежедневни инструменти.
Какво основно прави DALL-E 3?
DALL-E е система от текст към изображение: вие описвате сцена с думи и тя създава нова картина, съответстваща на това описание.
Каква основна техника използва DALL-E 3 за създаване на изображение?
DALL-E 3 е дифузионен модел, който започва от произволен шум и го прецизира стъпка по стъпка, управляван от вашата подкана, в кохерентно изображение.
Защо DALL-E 3 следва по-добре подканите, когато се използва в ChatGPT?
В ChatGPT езиковият модел пренаписва кратка заявка в по-богата, по-конкретна подкана, подобрявайки доколко вярно изображението съвпада с това, което искате.
Какво е забележителното подобрение, направено от DALL-E 3 спрямо по-ранните версии?
По-ранните модели изкривяваха текста в изображението, но DALL-E 3 може да изобрази четливи думи върху знаци, етикети и плакати много по-надеждно.
Какво ви позволява да правите „inpainting“ с DALL-E изображение?
Inpainting редактира избрана част от изображение (например размяна на обект), като оставя непокътната околната област.