بصری AI گائیڈ

لیٹنٹ ڈفیوژن ماڈلز

لیٹنٹ ڈفیوژن ماڈلز خام پکسلز کی بجائے ایک کمپریسڈ لیٹنٹ اسپیس میں بازی کے عمل کو چلا کر، کمپیوٹ کے اخراجات میں کمی کرتے ہوئے تصاویر تیار کرتے ہیں۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

They are the engine behind Stable Diffusion and most modern open-source image generators.

گہرا غوطہ

ایک معیاری ڈفیوژن ماڈل شور مچانے کے عمل کو ریورس کرنا سیکھتا ہے: یہ خالص شور سے شروع ہوتا ہے اور دھیرے دھیرے ایک تصویر میں تبدیل ہوتا ہے۔ یہ براہ راست پکسلز پر کرنا مہنگا ہے کیونکہ 512x512 تصویر کی سینکڑوں ہزار اقدار ہوتی ہیں۔ 2022 میں Rombach اور ساتھیوں کے ذریعہ متعارف کرایا گیا اویکت پھیلاؤ، ایک تصویر کو چھوٹے اویکت گرڈ (اکثر 64x64x4، تقریباً 48x چھوٹا) میں کمپریس کرنے کے لیے پہلے سے تربیت یافتہ تغیراتی آٹو اینکوڈر (VAE) کا استعمال کرتا ہے۔ اس کے بعد پھیلاؤ U-Net اس کمپیکٹ لیٹنٹ اسپیس کے اندر انکار کرنا سیکھتا ہے، متن کے ذریعے کراس اٹینشن کے ذریعے رہنمائی کرتا ہے۔ آخر میں VAE ڈیکوڈر مکمل ریزولوشن پکسلز کی تشکیل نو کرتا ہے۔ یہ ادراک کمپریشن غیر محسوس تفصیلات کو مسترد کرتے ہوئے معنوی طور پر معنی خیز معلومات کو برقرار رکھتا ہے، جس سے صارفین کے GPUs پر اعلیٰ معیار کی پیداوار ممکن ہوتی ہے۔

تکنیکی بصیرت

کلیدی چال ادراک کے کمپریشن کو جنریٹو ماڈلنگ سے الگ کرنا ہے۔ VAE اعلی تعدد پکسل کی تفصیل کو ایک بار ہینڈل کرتا ہے، اور U-Net صرف نچلی جہتی اویکت تقسیم کا ماڈل بناتا ہے۔ ٹیکسٹ کنڈیشنگ کو کراس اٹینشن لیئرز کے ذریعے انجکشن کیا جاتا ہے، جہاں U-Net کی مقامی خصوصیات CLIP جیسے ٹیکسٹ انکوڈر سے ٹوکن ایمبیڈنگس میں شامل ہوتی ہیں۔ چونکہ لیٹنٹ پکسلز سے تقریباً 48 گنا چھوٹے ہوتے ہیں، اس لیے میموری اور FLOPs دونوں میں ہر ڈینوائزنگ سٹیپ ڈرامائی طور پر سستا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

اویکت بازی کے ماڈلز کا مستقبل

لیٹنٹ ڈفیوژن تصویروں سے آگے ویڈیو (مستحکم ویڈیو ڈفیوژن)، 3D اثاثوں اور آڈیو سپیکٹروگرامس میں پھیل رہا ہے، یہ سب ایک ہی کمپریس پھر ڈینوائز نسخہ استعمال کرتے ہیں۔ تحقیق کشید اور مستقل مزاجی کے ماڈلز کے ذریعے نمونے لینے کے کم اقدامات کی طرف دھکیل رہی ہے، بہتر VAEs جو عمدہ متن اور چہروں کو محفوظ رکھتے ہیں، اور مستحکم ڈفیوژن 3 کی طرح اصلاح شدہ بہاؤ فارمولیشنز جو تیز، تیز نتائج کے لیے نسل کی رفتار کو سیدھا کرتے ہیں۔

حقیقی دنیا کا نفاذ

ایک صارف GPU پر متن کے اشارے سے آرٹ ورک اور تصوراتی ڈیزائن تیار کرنے والا مستحکم بازی

ایڈوب اور کینوا ٹیکسٹ ٹو امیج اور جنریٹیو فل فیچرز کو طاقت فراہم کرتے ہیں جو لیٹنٹ ڈفیوژن بیک بونز پر بنائے گئے ہیں۔

پری پروڈکشن کو تیز کرنے کے لیے ٹیکسچر میپس، اسپرائٹس، اور ماحولیاتی تصور آرٹ تیار کرنے والے گیم اسٹوڈیوز

سٹاک امیج اور مارکیٹنگ ٹیمیں بغیر کسی فوٹو شوٹ کے آن برانڈ پروڈکٹ ماک اپس اور اشتہاری تصویریں بناتی ہیں

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Latent Diffusion Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Latent Diffusion Models?

لیٹنٹ ڈفیوژن ماڈلز خام پکسلز کی بجائے ایک کمپریسڈ لیٹنٹ اسپیس میں بازی کے عمل کو چلا کر، کمپیوٹ کے اخراجات میں کمی کرتے ہوئے تصاویر تیار کرتے ہیں۔ وہ اسٹیبل ڈفیوژن اور جدید ترین اوپن سورس امیج جنریٹرز کے پیچھے انجن ہیں۔

پکسل-اسپیس ڈفیوژن کے مقابلے میں اویکت بازی کے ماڈلز کی اہم اختراع کیا ہے؟

اویکت پھیلاؤ VAE کا استعمال کرتے ہوئے تصاویر کو ایک چھوٹی اویکت جگہ میں کمپریس کرتا ہے، لہذا مہنگی ڈینوائزنگ مکمل پکسلز سے کہیں کم اقدار پر ہوتی ہے۔

کون سا جز کسی تصویر کو پوشیدہ جگہ میں کمپریس کرتا ہے اور بعد میں اس کی تشکیل نو کرتا ہے؟

ایک پہلے سے تربیت یافتہ VAE تصویر کو ایک کمپیکٹ لیٹنٹ گرڈ میں انکوڈ کرتا ہے اور اس کا ڈیکوڈر آخر میں مکمل ریزولوشن پکسلز کو دوبارہ تشکیل دیتا ہے۔

اویکت پھیلاؤ میں متن کو عام طور پر denoising U-Net میں کیسے داخل کیا جاتا ہے؟

ٹیکسٹ انکوڈر سے ٹوکن ایمبیڈنگز کو کراس اٹینشن لیئرز میں فیڈ کیا جاتا ہے، جس سے مقامی خصوصیات کو پرامپٹ میں شامل کیا جاتا ہے۔

اویکت جگہ میں کام کرنے سے کمپیوٹیشنل لاگت کیوں کم ہوتی ہے؟

انتظار کریں — صحیح وجہ یہ ہے کہ اویکت گرڈ پکسل امیج سے بہت چھوٹا ہے (اکثر ~48x)، اس لیے ہر رد کرنے والے قدم کو بہت کم FLOPs اور میموری کی ضرورت ہوتی ہے۔

وسیع پیمانے پر استعمال ہونے والے اوپن سورس ماڈل نے اویکت بازی کو مقبول بنایا؟

مستحکم بازی، جو 2022 میں جاری ہوئی، صارفین کے ہارڈ ویئر اور بڑے پیمانے پر اپنانے کے لیے اویکت پھیلاؤ کو لے کر آئی۔