دليل الذكاء الاصطناعي المرئي

إنشاء النص إلى ثلاثي الأبعاد

يحول إنشاء تحويل النص إلى ثلاثي الأبعاد مطالبة مكتوبة مثل "كرسي بذراعين جلدي عتيق" إلى نموذج ثلاثي الأبعاد كامل يمكنك تدويره وإضاءته وإسقاطه في لعبة أو مشهد.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It promises to do for 3D assets what image generators did for pictures.

الغوص العميق

تنتج أنظمة تحويل النص إلى ثلاثية الأبعاد تمثيلاً ثلاثي الأبعاد (شبكة أو سحابة نقطية أو مجال إشعاع) من الجملة. استخدمت الإنجازات المبكرة مثل DreamFusion (2022) الخاص بـ Google، أخذ عينات التقطير: بدلاً من التدريب على البيانات ثلاثية الأبعاد، قاموا بتحسين NeRF بحيث يبدو كل عرض ثنائي الأبعاد معقولاً لنموذج نشر الصور ثنائي الأبعاد المتجمد. تم تمهيد هذه الأشكال ثلاثية الأبعاد من سابقة ثنائية الأبعاد ولكنها كانت بطيئة، حيث استغرقت ساعات لكل كائن وغالبًا ما أنتجت "مشكلة يانوس" حيث ينمو المخلوق وجوهًا متعددة. تعمل نماذج التغذية الأمامية الأحدث (OpenAI's Point-E وShap-E، بالإضافة إلى نماذج Gaussian-splatting ونماذج إعادة الإعمار الكبيرة) على إنشاء الأصول في ثوانٍ إلى دقائق. تظل الجودة والاتساق متعدد العروض والهيكل النظيف والأنسجة القابلة للاستخدام من التحديات النشطة.

البصيرة الفنية

لا تحتاج خدعة DreamFusion الأساسية، وهي أخذ عينات التقطير (SDS)، إلى بيانات تدريب ثلاثية الأبعاد. إنه يعرض عروضًا عشوائية لـ NeRF، ويضيف ضوضاء، ويسأل نموذج نشر ثنائي الأبعاد تم تدريبه مسبقًا عن كيفية تقليل الضوضاء تجاه موجه النص. تصبح إشارة تقليل الضوضاء هذه بمثابة تدرج يدفع معلمات NeRF بحيث تتطابق كل وجهة نظر مع الموجه. يعمل النموذج ثنائي الأبعاد كناقد يقوم بتقطير معرفته بالصورة إلى كائن ثلاثي الأبعاد ثابت.

التأثير الاستراتيجي

السرعة والحجم

يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.

خيارات البناء

يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.

الفريق وسير العمل

يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.

مستقبل جيل تحويل النص إلى ثلاثي الأبعاد

توقع التحول من التحسين البطيء لكل كائن إلى مولدات التغذية السريعة التي تصدر شبكات جاهزة للإنتاج مع هيكل نظيف، ومواد منفصلة، ​​وخرائط للأشعة فوق البنفسجية في ثوانٍ. يعمل الرش الغاوسي ثلاثي الأبعاد ونماذج إعادة الإعمار الكبيرة على تسريع هذا الأمر. سيؤدي التكامل في محركات الألعاب وخطوط CAD وAR، بالإضافة إلى تحويل النص إلى 4D (الكائنات المتحركة والمتحركة)، إلى جعل إنشاء الأصول التحادثية أمرًا روتينيًا، على الرغم من استمرار التنظيف البشري للتزوير والامتثال لمواصفات اللعبة.

التنفيذ في العالم الحقيقي

يقوم استوديو الألعاب بتصميم نماذج أولية لدعائم الخلفية (الصناديق والمصابيح وأوراق الشجر) من النص يطالب بملء المستويات قبل أن يقوم الفنانون بتحسين أصول البطل.

يقوم موقع التجارة الإلكترونية بإنشاء معاينات منتج ثلاثية الأبعاد قابلة للتدوير تلقائيًا من أوصاف الكتالوج لميزات AR "العرض في غرفتك".

يقوم المهندس المعماري بسرعة بملء عرض تفصيلي بالأثاث عن طريق كتابة "أريكة منتصف القرن" بدلاً من تصفح مكتبات الأصول.

يقوم فريق ما قبل الفيلم بحجب مجموعة ملابس المشهد من وصف النص لاختبار زوايا الكاميرا قبل بناء النماذج النهائية.

المخاطر والدرابزين

يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.

يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.

قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.

خارطة طريق التنفيذ

1

تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.

2

اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.

3

أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.

4

تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Text-to-3D Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

خط أنابيب Magic3D لتحويل النص إلى ثلاثي الأبعاد

الأسئلة المتداولة

What is Text-to-3D Generation?

يحول إنشاء تحويل النص إلى ثلاثي الأبعاد مطالبة مكتوبة مثل "كرسي بذراعين جلدي عتيق" إلى نموذج ثلاثي الأبعاد كامل يمكنك تدويره وإضاءته وإسقاطه في لعبة أو مشهد. يعد بأن يفعل للأصول ثلاثية الأبعاد ما فعلته مولدات الصور للصور.

ما هو الابتكار الرئيسي في DreamFusion (2022)؟

قام DreamFusion بتحسين NeRF بحيث يرضي كل عرض ثنائي الأبعاد نموذج نشر صور ثنائي الأبعاد مجمّد، باستخدام SDS ولا يتطلب بيانات تدريب ثلاثية الأبعاد.

ما هي "مشكلة يانوس" في تحويل النص إلى ثلاثي الأبعاد؟

سُميت على اسم الإله الروماني ذي الوجهين، مشكلة يانوس هي عندما ينمو كائن ما وجوهًا إضافية لأن كل عرض ثنائي الأبعاد يتم تحسينه بشكل مستقل إلى حد ما.

أي زوج كان من نماذج OpenAI المبكرة لتحويل النص إلى ثلاثية الأبعاد؟

OpenAI أصدرت Point-E (السحب النقطية) وShap-E، اللذين ينشئان أصولًا ثلاثية الأبعاد بشكل أسرع بكثير من الأساليب القائمة على التحسين.

لماذا كانت الأساليب المبكرة القائمة على التحسين مثل DreamFusion بطيئة؟

يتطلب كل كائن تحسين NeRF بشكل متكرر عبر العديد من العروض المزعجة، وغالبًا ما يستغرق ساعات لكل أصل.

ما هو تنسيق الإخراج الذي لا يمثل تمثيلاً ثلاثي الأبعاد نموذجيًا تنتجه هذه الأنظمة؟

تعمل أنظمة تحويل النص إلى ثلاثية الأبعاد على إخراج شبكات أو سحب نقطية أو حقول إشعاع؛ MP3 هو تنسيق صوتي، وليس تمثيلاً ثلاثي الأبعاد.