بصری AI گائیڈ

DALL-E

DALL-E OpenAI کا ٹیکسٹ ٹو امیج ماڈلز کا خاندان ہے جو تحریری تفصیل کو اصل تصویر میں بدل دیتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It made "type a sentence, get an image" a mainstream idea and pushed image generation from research demos into everyday tools.

گہرا غوطہ

DALL-E جنوری 2021 میں لانچ کیا گیا، جس میں پکسلز کے لینگویج ماڈل کی طرح ایک وقت میں ایک تصویری ٹوکن کی پیش گوئی کرتے ہوئے متن سے تصاویر تیار کی گئیں۔ DALL-E 2 (2022) نے CLIP ایمبیڈنگز کے ذریعے رہنمائی کرنے والے پھیلاؤ کے نقطہ نظر کو تبدیل کیا، جس سے تیز، زیادہ فوٹو ریئلسٹک نتائج برآمد ہوئے۔ DALL-E 3 (اکتوبر 2023) نے پرامپٹ کی پیروی کو سخت کر دیا ہے اور اسے ChatGPT میں بنایا گیا ہے، لہذا چیٹ بوٹ آپ کی کھردری درخواست کو تخلیق کرنے سے پہلے ایک بھرپور تفصیلی پرامپٹ میں دوبارہ لکھ سکتا ہے۔ اسٹینڈ آؤٹ بہتری تصویروں کے اندر پڑھنے کے قابل متن کو پیش کر رہی ہے، جیسے نشانات اور لیبل، جو پہلے کے ماڈلز نے خراب کر دیے تھے۔ DALL-E ان پینٹنگ (تصویر کے حصے میں ترمیم کرنا) اور آؤٹ پینٹنگ (اس کی اصل سرحدوں سے باہر توسیع) کی بھی حمایت کرتا ہے۔ یہ ایک ہی پرامپٹ سے متعدد تغیرات پیدا کرتا ہے، جس سے صارفین کو تخلیقی اختیارات کو تیزی سے دریافت کرنے میں مدد ملتی ہے۔

تکنیکی بصیرت

DALL-E 3 ایک پھیلاؤ ماڈل ہے: یہ بے ترتیب شور سے شروع ہوتا ہے اور اسے قدم بہ قدم ہٹاتا ہے، ہر قدم پر آپ کے ٹیکسٹ پرامپٹ کی انکوڈنگ کے ذریعے چلتا ہے، یہاں تک کہ ایک مربوط تصویر ابھرتی ہے۔ یہ تصویری کیپشن کے جوڑوں کے بڑے سیٹوں پر تربیت دیتا ہے، یہ سیکھتا ہے کہ الفاظ کس طرح بصری خصوصیات، مقامی انتظامات، اور طرزوں کو نقشہ بناتے ہیں۔ ایک اہم چال تربیت کے دوران کیپشنز کے ساتھ ساتھ ایک لینگویج ماڈل ہے جو آپ کے مختصر پرامپٹ کو ایک تفصیلی شکل میں پھیلاتا ہے، یہی وجہ ہے کہ DALL-E 3 اپنے پیشروؤں سے کہیں زیادہ دیانتداری سے ہدایات پر عمل کرتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

DALL-E کا مستقبل

DALL-E کا سلسلہ وسیع تر، ملٹی موڈل سسٹمز میں جوڑ رہا ہے جہاں ایک ماڈل الگ ٹول کے بجائے متن، تصاویر اور ترمیمات کو ایک ساتھ ہینڈل کرتا ہے۔ سخت گفتگوی ترمیم کی توقع کریں ("آسمان کو نارنجی بنائیں، باقی سب کچھ رکھیں")، بہتر ٹیکسٹ رینڈرنگ، اور اعلی ریزولوشن۔ پرووینس سگنلز جیسے C2PA میٹا ڈیٹا اور واٹر مارکنگ AI سے تیار کردہ تصاویر کے لیے معیاری بن جائیں گے۔ Midjourney، Stable Diffusion، اور Google کے ماڈلز سے مقابلہ تیزی سے معیار میں اضافہ کر رہا ہے، جبکہ تربیتی ڈیٹا، فنکار کی رضامندی، اور کاپی رائٹ پر ہونے والی بحثیں اس کی تشکیل کرتی رہیں گی کہ ان سسٹمز کو کیا سیکھنے کی اجازت ہے۔

حقیقی دنیا کا نفاذ

ایک بلاگر اسٹاک فوٹو لائبریریوں کو تلاش کرنے کے بجائے آرٹیکل کے لیے حسب ضرورت ہیڈر کی مثال تیار کرتا ہے۔

ایک استاد نوجوان طلباء کو سائنس کے تصور کی وضاحت کرنے کے لیے سادہ، سرخی والے خاکے بناتا ہے۔

ایک چھوٹا کاروبار ڈیزائنر کی خدمات حاصل کرنے سے پہلے کئی لوگو اور پیکیجنگ تصورات کا مذاق اڑاتا ہے۔

ایک گیم ڈیزائنر تیزی سے کرداروں اور ماحول کے لیے تصوراتی آرٹ تیار کرتا ہے تاکہ کسی خیال کو پیش کیا جا سکے۔

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the DALL-E quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

نیورل ریڈیئنس فیلڈز

اکثر پوچھے گئے سوالات

What is DALL-E?

DALL-E OpenAI کا ٹیکسٹ ٹو امیج ماڈلز کا خاندان ہے جو تحریری تفصیل کو اصل تصویر میں بدل دیتا ہے۔ اس نے "ایک جملہ ٹائپ کریں، ایک تصویر حاصل کریں" کو مرکزی دھارے کا خیال بنایا اور تحقیقی ڈیمو سے امیج جنریشن کو روزمرہ کے اوزاروں میں دھکیل دیا۔

DALL-E 3 بنیادی طور پر کیا کرتا ہے؟

DALL-E ایک ٹیکسٹ ٹو امیج سسٹم ہے: آپ کسی منظر کو الفاظ میں بیان کرتے ہیں اور یہ اس تفصیل سے مماثل ایک نئی تصویر تیار کرتا ہے۔

DALL-E 3 تصویر بنانے کے لیے کون سی بنیادی تکنیک استعمال کرتا ہے؟

DALL-E 3 ایک پھیلاؤ ماڈل ہے جو بے ترتیب شور سے شروع ہوتا ہے اور اسے قدم بہ قدم بہتر کرتا ہے، آپ کے اشارے کے ذریعے، ایک مربوط تصویر میں۔

ChatGPT کے اندر استعمال ہونے پر DALL-E 3 پرامپٹس کو کیوں بہتر طریقے سے فالو کرتا ہے؟

ChatGPT میں، لینگویج ماڈل ایک مختصر درخواست کو ایک بھرپور، زیادہ مخصوص پرامپٹ میں دوبارہ لکھتا ہے، جس سے یہ بہتر ہوتا ہے کہ تصویر آپ کی خواہش سے کتنی وفاداری سے ملتی ہے۔

DALL-E 3 میں پہلے کے ورژن کے مقابلے میں کیا قابل ذکر بہتری آئی ہے؟

اس سے پہلے کے ماڈلز میں تصویر کے متن کو خراب کیا گیا تھا، لیکن DALL-E 3 نشانیوں، لیبلز اور پوسٹرز پر زیادہ قابل اعتماد طریقے سے پڑھنے کے قابل الفاظ پیش کر سکتا ہے۔

DALL-E امیج کے ساتھ 'انپینٹنگ' آپ کو کیا کرنے دیتی ہے؟

پینٹنگ ایک تصویر کے منتخب حصے میں ترمیم کرتی ہے (مثال کے طور پر، کسی چیز کو تبدیل کرنا) جبکہ ارد گرد کے علاقے کو برقرار رکھا جاتا ہے.