DreamFusion وأخذ عينات التقطير
يقوم DreamFusion بإنشاء كائنات ثلاثية الأبعاد من النص باستخدام نموذج نشر الصور ثنائي الأبعاد كناقد، ولا يتدرب مطلقًا على أي بيانات ثلاثية الأبعاد.
نظرة عامة
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
الغوص العميق
تساءل DreamFusion، من Google في عام 2022: هل يمكن لنموذج تحويل النص إلى صورة ثنائي الأبعاد تعليم مشهد ثلاثي الأبعاد أن يبدو صحيحًا من كل زاوية؟ إنه يعمل على تحسين NeRF (مجال الإشعاع العصبي) بحيث يتم تسجيل العروض من وجهات نظر الكاميرا العشوائية، عند التشويش وعرضها لنموذج الانتشار المجمد (Imagen)، كصور معقولة للمطالبة النصية. والأهم من ذلك أنه لا يستخدم أي بيانات تدريب ثلاثية الأبعاد. الإنجاز هو أخذ عينات التقطير (SDS): بدلاً من الانتشار العكسي من خلال شبكة U-Net الباهظة الثمن لنموذج الانتشار، يستخدم SDS الضوضاء المتوقعة للنموذج كإشارة متدرجة مباشرة على وحدات البكسل المعروضة. يؤدي تكرار ذلك عبر آلاف وجهات النظر إلى نحت أصل ثلاثي الأبعاد متماسك، مكتمل بالهندسة والمظهر المعتمد على العرض، من جملة واحدة.
البصيرة الفنية
يعامل SDS نموذج الانتشار كوظيفة تسجيل مجمدة. إنه يعرض NeRF، ويضيف ضوضاء، ويطلب من U-Net الانتشار التنبؤ بهذا التشويش، ويحسب التدرج حيث يتم دفع (الضوضاء المتوقعة مطروحًا منها الضوضاء المضافة) مرة أخرى إلى الصورة المقدمة وبالتالي أوزان NeRF. تخطي U-Net Jacobian يجعلها قابلة للتتبع. هناك حاجة إلى إرشادات عالية خالية من التصنيف (حوالي 100) للحصول على نتائج حادة، مما يؤدي إلى ظهور "DreamFusion" المميز المشبع بشكل مفرط، والضبابية في بعض الأحيان.
التأثير الاستراتيجي
السرعة والحجم
يمكن للذكاء الاصطناعي المرئي أتمتة مهام الفحص والكشف ووضع العلامات على نطاق واسع.
خيارات البناء
يمكن للفرق الإبداعية إنشاء نماذج أولية للمفاهيم بشكل أسرع مع عدد أقل من المراجعات اليدوية.
الفريق وسير العمل
يمكن أن تستخدم العمليات إشارات الصور والفيديو التي كان من الصعب معالجتها في السابق.
مستقبل DreamFusion وأخذ عينات التقطير
أنتج SDS خطًا غنيًا من العمل لإصلاح نقاط ضعفه: Magic3D من أجل الدقة والسرعة، وProlificDreamer's Variational Score Distillation من أجل مخرجات أكثر وضوحًا وتنوعًا، وطرق تهاجم قطعة أثرية "Janus" متعددة الوجوه. يقوم هذا المجال بشكل متزايد بإقران SDS مع نشرات العرض المتعددة والتمثيلات ثلاثية الأبعاد السريعة مثل Gaussian Splatting. توقع أن ينمو تحويل النص إلى ثلاثي الأبعاد بشكل أسرع وأكثر دقة هندسيًا، مما يؤدي إلى تضييق الفجوة مع الأصول المصممة يدويًا.
التنفيذ في العالم الحقيقي
إنشاء نموذج ثلاثي الأبعاد لـ "صورة DSLR لسنجاب يرتدي قبعة صغيرة" من النص وحده
إنشاء مسودة اللعبة وأصول الواقع المعزز بدون النحت اليدوي ثلاثي الأبعاد
إنتاج شبكات قابلة للتصدير يقوم الفنانون بتحسينها بدلاً من بنائها من الصفر
ابحث عن خطوط الأساس لتقييم أساليب تحويل النص إلى ثلاثية الأبعاد الأحدث مقابل SDS
المخاطر والدرابزين
يمكن أن تصبح حقوق الصور والموافقة مخاطر قانونية إذا كان المصدر غير واضح.
يمكن أن يختلف أداء النموذج عبر الإضاءة والتركيبة السكانية والبيئات.
قد تمر الإيجابيات الكاذبة دون أن يلاحظها أحد ما لم تتم مراقبة عتبات الثقة.
خارطة طريق التنفيذ
تحديد معايير القبول لتكاليف الدقة والاستدعاء والخطأ.
اختبار مع البيانات التي تتوافق مع ظروف الإنتاج الحقيقية.
أضف مراجعة بشرية للتنبؤات منخفضة الثقة أو عالية التأثير.
تتبع انحراف النموذج وإعادة التحقق من صحته بعد تغيير الكاميرا أو مجموعة البيانات.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
النماذج التوليدية القائمة على النتيجة
الأسئلة المتداولة
What is DreamFusion and Score Distillation Sampling?
يقوم DreamFusion بإنشاء كائنات ثلاثية الأبعاد من النص باستخدام نموذج نشر الصور ثنائي الأبعاد كناقد، ولا يتدرب مطلقًا على أي بيانات ثلاثية الأبعاد. أصبح اختراعها الأساسي، وهو Score Distillation Sampling، الوصفة الأساسية لمجال تحويل النص إلى ثلاثي الأبعاد بأكمله.
ما هو التمثيل ثلاثي الأبعاد الذي يقوم DreamFusion بتحسينه؟
يقوم DreamFusion بتحسين NeRF بحيث تلبي طرق العرض المقدمة حكم نموذج النشر ثنائي الأبعاد لموجه النص.
ما مقدار بيانات التدريب ثلاثية الأبعاد التي يتطلبها DreamFusion؟
يستخدم DreamFusion نموذج نشر مجمد ثنائي الأبعاد من النص إلى الصورة باعتباره الإشراف الوحيد عليه، ولا يتطلب أي بيانات تدريب ثلاثية الأبعاد.
ما هو الاختصار الحسابي الرئيسي في أخذ عينات التقطير؟
يستخدم SDS الضوضاء المضافة المتوقعة كتدرج مباشر على وحدات البكسل المعروضة، مما يتجنب U-Net Jacobian المكلف.
لماذا يستخدم DreamFusion إرشادات عالية جدًا خالية من المصنفات (~100)؟
إن تدرج SDS صاخب وضعيف، لذا هناك حاجة إلى توجيه عالي بشكل غير عادي للحصول على هندسة واضحة وسريعة، على الرغم من أنه يسبب الإفراط في التشبع.
ما هو النموذج ثنائي الأبعاد الذي استخدمه DreamFusion الأصلي كمجمد سابقًا؟
تم بناء DreamFusion على نموذج نشر Imagen من النص إلى الصورة الخاص بـ Google باعتباره وظيفة التسجيل المجمدة.