РЪКОВОДСТВО за визуален AI

Генериране на текст към 3D

Генерирането на текст към 3D превръща писмена подкана като „ретро кожено кресло“ в пълен 3D модел, който можете да завъртите, осветите и пуснете в игра или сцена.

2 min readПоследна актуализация

Преглед

It promises to do for 3D assets what image generators did for pictures.

Дълбоко гмуркане

Системите за преобразуване на текст в 3D създават 3D представяне (мрежа, облак от точки или поле на излъчване) от изречение. Ранните постижения като DreamFusion (2022) на Google използваха вземане на проби от дестилация на резултати: вместо обучение върху 3D данни, те оптимизираха NeRF, така че всеки изобразен 2D изглед да изглежда правдоподобен за модел на дифузия на замразено 2D изображение. Това стартиране на 3D форми от предишни 2D, но беше бавно, отнемаше часове на обект и често създаваше „проблема с Янус“, при който едно същество израства с множество лица. По-нови модели за подаване напред (Point-E и Shap-E на OpenAI, плюс модели с разпръскване на Гаус и големи модели за реконструкция) генерират активи за секунди до минути. Качеството, последователността на множество изгледи, чистата топология и използваемите текстури остават активни предизвикателства.

Техническа информация

Основният трик на DreamFusion, Score Destillation Sampling (SDS), не се нуждае от 3D данни за обучение. Той изобразява произволни изгледи на NeRF, добавя шум и пита предварително обучен 2D дифузионен модел как да обезшуми към текстовата подкана. Този сигнал за премахване на шума се превръща в градиент, който избутва параметрите на NeRF, така че всяка гледна точка да съответства на подканата. 2D моделът действа като критик, който дестилира знанията си за изображения в последователен 3D обект.

Стратегическо въздействие

Speed and scale

Visual AI може да автоматизира задачи за проверка, откриване и маркиране в мащаб.

Build choices

Творческите екипи могат да създават прототипи на концепции по-бързо с по-малко ръчни ревизии.

Team and workflow

Операциите могат да използват изображения и видео сигнали, които преди са били трудни за обработка.

Бъдещето на генерирането на текст към 3D

Очаквайте преминаване от бавна оптимизация за всеки обект към бързи генератори за подаване напред, които излъчват готови за производство мрежи с чиста топология, разделени материали и UV карти за секунди. 3D Gaussian splatting и големите модели за реконструкция ускоряват това. Интегрирането в игрови двигатели, CAD и AR тръбопроводи, плюс текст-към-4D (анимирани, движещи се обекти), ще направи рутинно създаване на разговорни активи, въпреки че човешкото почистване за монтаж и съответствие със спецификациите на играта ще продължи.

Внедряване в реалния свят

Студио за игри създава прототипи на фонови реквизити (щайги, лампи, зеленина) от текстови подкани, за да запълни нивата, преди артистите да прецизират активите на героя.

Сайт за електронна търговия автоматично генерира въртящи се 3D визуализации на продукти от описания на каталог за функциите на AR „изглед във вашата стая“.

Архитект бързо попълва визуализация с обзавеждане с мебели, като напише „диван от средата на века“, вместо да преглежда библиотеките с активи.

Екип за предварителна визуализация на филм блокира декорацията на сцената от описанието на сценария, за да тества ъглите на камерата, преди да създаде окончателни модели.

Рискове и предпазни огради

Правата върху изображението и съгласието могат да се превърнат в правни рискове, ако произходът е неясен.

Производителността на модела може да варира в зависимост от осветлението, демографските данни и средата.

Фалшивите положителни резултати могат да останат незабелязани, освен ако не се наблюдават праговете на достоверност.

Пътна карта за изпълнение

1

Определете критерии за приемане за прецизност, извикване и разходи за грешки.

2

Тествайте с данни, които съответстват на реалните производствени условия.

3

Добавете преглед от човек за прогнози с ниска степен на сигурност или с голямо въздействие.

4

Проследявайте дрейфа на модела и проверявайте отново след промени в камерата или набора от данни.

Продължете да изследвате

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text-to-3D Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

Start quiz

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

Next guide

Magic3D Text-to-3D Pipeline

Frequently asked questions

What is Text-to-3D Generation?

Генерирането на текст към 3D превръща писмена подкана като „ретро кожено кресло“ в пълен 3D модел, който можете да завъртите, осветите и пуснете в игра или сцена. Обещава да направи за 3D активи това, което генераторите на изображения направиха за снимките.

Коя беше ключовата иновация на DreamFusion (2022)?

DreamFusion оптимизира NeRF, така че всеки изобразен 2D изглед удовлетворява модел на дифузия на замразено 2D изображение, като използва SDS и не изисква данни за 3D обучение.

Какъв е „проблемът с Janus“ в текст към 3D?

Наречен на римския бог с две лица, проблемът с Янус е, когато даден обект има допълнителни лица, тъй като всеки 2D изглед е оптимизиран донякъде независимо.

Коя двойка бяха ранните модели на OpenAI за прехвърляне на текст към 3D?

OpenAI пусна Point-E (облаци от точки) и Shap-E, които генерират 3D активи много по-бързо от методите, базирани на оптимизация.

Защо ранните базирани на оптимизация методи като DreamFusion бяха бавни?

Всеки обект изискваше итеративно оптимизиране на NeRF в много рендове с шум, което често отнемаше часове на актив.

Кой изходен формат НЕ е типично 3D представяне, създадено от тези системи?

Системите за преобразуване на текст към 3D извеждат мрежи, облаци от точки или полета на излъчване; MP3 е аудио формат, а не 3D представяне.