بصری AI گائیڈ

خود بخود تصویری جنریشن

آٹوریگریسو امیج جنریشن تصویروں کو ایک وقت میں ایک ٹکڑا بناتی ہے، اس سے پہلے پیدا ہونے والی ہر چیز سے ہر ٹوکن کی پیش گوئی کرتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because the same next-token machinery powering language models can produce coherent, controllable images.

گہرا غوطہ

خود بخود امیج جنریشن ایک تصویر کو ایک ترتیب کے طور پر دیکھتی ہے اور اس کے عنصر کی طرف سے عنصر کی پیشین گوئی کرتی ہے، جہاں ہر نیا عنصر پچھلے تمام عناصر پر مشروط ہوتا ہے۔ ابتدائی کام جیسے PixelRNN اور PixelCNN نے ایک وقت میں ایک خام پکسل کی تصاویر کی پیش گوئی کی، قطار در قطار اسکیننگ، جو سست تھی لیکن نظریاتی طور پر صاف تھی۔ اس کے بجائے جدید نظام پہلے VQ-VAE طرز کے انکوڈر کا استعمال کرتے ہوئے ایک تصویر کو مجرد ٹوکن کے گرڈ میں کمپریس کرتے ہیں، پھر ایک ٹرانسفارمر ان ٹوکنز کی بائیں سے دائیں پیش گوئی کرتا ہے۔ OpenAI کی DALL-E 1 اور Google کی پارٹی نے اس نسخے کی پیروی کی، تصویری ٹوکنز بنائے جو انہیں دوبارہ پکسلز پر ڈی کوڈ کرنے سے پہلے ٹیکسٹ پرامپٹ پر مشروط تھے۔ بڑا فائدہ عین امکان ماڈلنگ اور زبان کے ساتھ مشترکہ فن تعمیر ہے۔ لاگت ترتیب وار، سست نمونے لینے والی ہے۔

تکنیکی بصیرت

ماڈل تمام ٹوکنز کے مشترکہ امکان کو مشروط کی پیداوار میں فیکٹرائز کرتا ہے: p(x) = p(x_i دی گئی x_1...x_{i-1}) کی پیداوار۔ کازل (نقاب پوش) توجہ کے ساتھ ایک ٹرانسفارمر اس بات کو نافذ کرتا ہے کہ ہر پوزیشن صرف پہلے والے ٹوکن دیکھتی ہے۔ تربیت کے دوران یہ اساتذہ کو زبردستی استعمال کرتے ہوئے متوازی طور پر ہر ٹوکن کی پیشن گوئی کرتا ہے، لیکن اندازہ کے مطابق اسے ایک وقت میں ایک ٹوکن کا نمونہ لینا چاہیے، ہر ایک کو واپس کھلانا۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

آٹوریگریسو امیج جنریشن کا مستقبل

رفتار مرکزی میدان جنگ ہے۔ متوازی اور ماسکڈ ٹوکن ڈیکوڈنگ (MaskGIT، Muse) جیسی تکنیکیں ایک ساتھ بہت سے ٹوکن تیار کرتی ہیں، اور زبان کے ماڈلز سے لیے گئے قیاس آرائی پر مبنی ضابطہ کشائی کو امیجز میں ڈھال لیا جا رہا ہے۔ محققین متن اور تصویری ٹوکنز کو ایک ہی آٹوریگریسو بیک بون میں یکجا کر رہے ہیں تاکہ ایک ماڈل پڑھ اور ڈرا کر سکے، جیسا کہ ملٹی موڈل سسٹمز میں دیکھا جاتا ہے۔ ہائبرڈ ماڈلز ٹوکنز کی کنٹرولیبلٹی اور بازی کے معیار کو حاصل کرنے کے ساتھ، خود بخود اور پھیلاؤ کے خیالات کو ملاتے رہنے کی توقع کریں۔

حقیقی دنیا کا نفاذ

DALL-E 1 نے ٹیکسٹ کیپشن سے مجرد امیج ٹوکنز کے گرڈ کی خود بخود پیش گوئی کرتے ہوئے تصاویر تیار کیں۔

Google کی پارٹی نے تفصیلی، فوری طور پر وفادار مناظر کے لیے ایک خودکار ٹیکسٹ ٹو امیج ٹرانسفارمر کو 20 بلین پیرامیٹرز تک پھیلا دیا۔

PixelCNN اور PixelRNN نے خام پکسل بائی پکسل جنریشن کا مظاہرہ کیا اور اب بھی امکانات پر مبنی ماڈلز کی تعلیم کی بنیاد کے طور پر استعمال ہوتے ہیں۔

MaskGIT اور Muse متوازی ماسکڈ ٹوکن ڈی کوڈنگ کا استعمال کرتے ہیں تاکہ ٹوکن پر مبنی تصویر کی ترکیب کو تیز کیا جا سکے جبکہ آٹوریگریسو طرز کی تربیت کو برقرار رکھا جا سکے۔

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Autoregressive Image Generation quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Autoregressive Image Generation?

آٹوریگریسو امیج جنریشن تصویروں کو ایک وقت میں ایک ٹکڑا بناتی ہے، اس سے پہلے پیدا ہونے والی ہر چیز سے ہر ٹوکن کی پیش گوئی کرتی ہے۔ یہ اہمیت رکھتا ہے کیونکہ وہی اگلی ٹوکن مشینری پاورنگ لینگوئج ماڈل مربوط، قابل کنٹرول تصاویر تیار کر سکتے ہیں۔

تصویر کی تخلیق کے تناظر میں 'خودکارانہ' کا کیا مطلب ہے؟

خود بخود ماڈل تصویر کو ترتیب کے طور پر فیکٹرائز کرتے ہیں، ہر ٹوکن یا پکسل کی پیشین گوئی اس سے پہلے پیدا ہونے والے تمام عناصر کی بنیاد پر کرتے ہیں۔

DALL-E 1 جیسے جدید خودکار تصویری ماڈلز عام طور پر کسی تصویر کی پیشین گوئی کرنے سے پہلے اس کی نمائندگی کیسے کرتے ہیں؟

جدید نظام تصویر کو مجرد ٹوکن (اکثر VQ-VAE طرز کے انکوڈر کے ذریعے) میں کمپریس کرتے ہیں، پھر ٹرانسفارمر کے ساتھ اس ٹوکن کی ترتیب کی پیش گوئی کرتے ہیں۔

کون سے ابتدائی ماڈلز نے ایک وقت میں ایک خام پکسل کی تصاویر تیار کیں؟

PixelRNN اور PixelCNN آٹو ریگریسیو ماڈل تھے جو پکسل کے حساب سے تصاویر کو اسکین اور پیشین گوئی کرتے تھے۔

کون سا طریقہ کار اس بات کو یقینی بناتا ہے کہ ٹرانسفارمر خود بخود پیدا کرنے کے دوران صرف پہلے والے ٹوکن پر ہی حاضر ہو؟

کازل ماسکنگ ہر پوزیشن کو مستقبل کے ٹوکنز میں شرکت سے روکتا ہے، بائیں سے دائیں فیکٹرائزیشن کو نافذ کرتا ہے۔

آٹوریگریسو امیج سیمپلنگ کی بنیادی عملی خرابی کیا ہے؟

چونکہ ہر ٹوکن کا انحصار پچھلے ٹوکن پر ہوتا ہے، لہٰذا تخمینہ ٹوکن کے حساب سے چلنا چاہیے، جس سے نسل نسبتاً سست ہو جاتی ہے۔