ڈریم فیوژن اور اسکور ڈسٹلیشن سیمپلنگ
DreamFusion 2D امیج ڈفیوژن ماڈل کو بطور نقاد استعمال کر کے متن سے 3D اشیاء تیار کرتا ہے، کبھی بھی کسی 3D ڈیٹا پر تربیت نہیں دیتا ہے۔
جائزہ
Its core invention, Score Distillation Sampling, became the foundational recipe for the entire text-to-3D field.
گہرا غوطہ
DreamFusion، Google سے 2022 میں، پوچھا: کیا 2D ٹیکسٹ ٹو امیج ماڈل 3D منظر کو ہر زاویے سے درست دیکھنا سکھا سکتا ہے؟ یہ ایک NeRF (Neural Radiance Field) کو بہتر بناتا ہے تاکہ بے ترتیب کیمرے کے نقطہ نظر سے رینڈرنگ، جب شور کیا جائے اور منجمد ڈفیوژن ماڈل (Imagen) کو دکھایا جائے، تو ٹیکسٹ پرامپٹ کے لیے قابل فہم تصاویر کے طور پر اسکور کریں۔ اہم طور پر یہ کوئی 3D ٹریننگ ڈیٹا استعمال نہیں کرتا ہے۔ پیش رفت سکور ڈسٹلیشن سیمپلنگ (SDS): بازی ماڈل کے مہنگے U-Net کے ذریعے بیک پروپیگیٹ کرنے کے بجائے، SDS ماڈل کے پیش گوئی شدہ شور کو براہ راست رینڈر شدہ پکسلز پر گراڈینٹ سگنل کے طور پر استعمال کرتا ہے۔ ہزاروں نقطۂ نظر میں اس کو دہرانا ایک مربوط 3D اثاثہ تیار کرتا ہے، جو جیومیٹری اور منظر پر منحصر ظاہری شکل کے ساتھ مکمل ہوتا ہے، ایک جملے سے۔
تکنیکی بصیرت
SDS ڈفیوژن ماڈل کو منجمد اسکورنگ فنکشن کے طور پر دیکھتا ہے۔ یہ NeRF کو رینڈر کرتا ہے، شور شامل کرتا ہے، ڈفیوژن U-Net سے اس شور کی پیشین گوئی کرنے کے لیے کہتا ہے، اور گریڈینٹ کی گنتی کرتا ہے جیسا کہ (پیش گوئی شدہ شور مائنس شامل شور) کو پیش کردہ امیج پر واپس دھکیل دیا جاتا ہے اور اس طرح NeRF کا وزن ہوتا ہے۔ U-Net Jacobian کو چھوڑنا اسے قابل عمل بنا دیتا ہے۔ تیز نتائج کے لیے اعلی درجہ بندی سے پاک رہنمائی (تقریباً 100) درکار ہے، جس کی وجہ سے خصوصیت زیادہ سیر ہو جاتی ہے، کبھی کبھی دھندلی 'DreamFusion look'۔
اسٹریٹجک اثر
رفتار اور پیمانہ
بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔
Build choices
تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔
Team and workflow
آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔
ڈریم فیوژن اور اسکور ڈسٹلیشن سیمپلنگ کا مستقبل
SDS نے اپنی کمزوریوں کو دور کرنے کے لیے کام کی ایک بھرپور لائن کو جنم دیا: ریزولوشن اور رفتار کے لیے Magic3D، تیز تر، زیادہ متنوع آؤٹ پٹس کے لیے ProlificDreamer کا ویریشنل اسکور ڈسٹلیشن، اور 'Janus' کے کثیر چہرے کے نمونے پر حملہ کرنے کے طریقے۔ فیلڈ تیزی سے ایس ڈی ایس کو ملٹی ویو ڈفیوژن پرائیرز اور گاوسی اسپلٹنگ جیسی تیز 3D نمائندگیوں کے ساتھ جوڑ رہا ہے۔ ہاتھ سے بنائے گئے اثاثوں کے ساتھ خلا کو کم کرتے ہوئے، متن سے 3D تک تیز تر اور ہندسی اعتبار سے زیادہ وفاداری کی توقع کریں۔
حقیقی دنیا کا نفاذ
صرف متن سے 'ایک چھوٹی ٹوپی پہنے گلہری کی DSLR تصویر' کا 3D ماڈل بنانا
دستی 3D مجسمہ سازی کے بغیر ڈرافٹ گیم اور AR اثاثے بنانا
قابل برآمد میش تیار کرنا جسے فنکار شروع سے بنانے کے بجائے بہتر کرتے ہیں۔
ایس ڈی ایس کے خلاف نئے ٹیکسٹ سے تھری ڈی طریقوں کا جائزہ لینے کے لیے تحقیق کی بنیادیں۔
خطرات اور گارڈریلز
تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔
ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔
جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔
نفاذ کا روڈ میپ
درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔
اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔
کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔
کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the DreamFusion and Score Distillation Sampling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
سکور پر مبنی جنریٹو ماڈلز
اکثر پوچھے گئے سوالات
What is DreamFusion and Score Distillation Sampling?
DreamFusion 2D امیج ڈفیوژن ماڈل کو بطور نقاد استعمال کر کے متن سے 3D اشیاء تیار کرتا ہے، کبھی بھی کسی 3D ڈیٹا پر تربیت نہیں دیتا ہے۔ اس کی بنیادی ایجاد، سکور ڈسٹلیشن سیمپلنگ، پورے ٹیکسٹ سے تھری ڈی فیلڈ کے لیے بنیادی نسخہ بن گئی۔
ڈریم فیوژن کس 3D نمائندگی کو بہتر بناتا ہے؟
DreamFusion ایک NeRF کو بہتر بناتا ہے لہذا اس کے پیش کردہ خیالات 2D ڈفیوژن ماڈل کے ٹیکسٹ پرامپٹ کے فیصلے کو پورا کرتے ہیں۔
ڈریم فیوژن کو کتنے 3D ٹریننگ ڈیٹا کی ضرورت ہے؟
DreamFusion ایک منجمد 2D ٹیکسٹ ٹو امیج ڈفیوژن ماڈل کو اپنی واحد نگرانی کے طور پر استعمال کرتا ہے، جس میں 3D ٹریننگ ڈیٹا کی ضرورت نہیں ہوتی ہے۔
سکور ڈسٹلیشن سیمپلنگ میں کلیدی کمپیوٹیشنل شارٹ کٹ کیا ہے؟
SDS مہنگے U-Net Jacobian سے گریز کرتے ہوئے پیش گوئی شدہ-مائنس-ایڈڈ شور کو پیش کردہ پکسلز پر براہ راست میلان کے طور پر استعمال کرتا ہے۔
ڈریم فیوژن انتہائی اعلی درجہ بندی سے پاک رہنمائی (~100) کیوں استعمال کرتا ہے؟
SDS گریڈینٹ شور اور کمزور ہے، اس لیے کرکرا، فوری جیومیٹری کے لیے غیر معمولی طور پر اعلیٰ رہنمائی کی ضرورت ہوتی ہے، حالانکہ یہ حد سے زیادہ سنترپتی کا سبب بنتا ہے۔
اصل ڈریم فیوژن نے اپنے منجمد ہونے سے پہلے کون سا 2D ماڈل استعمال کیا تھا؟
DreamFusion کو Google کے امیجین ٹیکسٹ ٹو امیج ڈفیوژن ماڈل پر منجمد اسکورنگ فنکشن کے طور پر بنایا گیا تھا۔