بصری AI گائیڈ

نقاب پوش آٹو اینکوڈرز

ماسکڈ آٹو اینکوڈرز (MAE) ایک خود زیر نگرانی طریقہ ہے جو زیادہ تر تصویر کو چھپائے جانے کے بعد تصویروں کی تشکیل نو کے لیے وژن ماڈل کو سکھاتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

By learning to fill in the blanks, the model builds rich visual understanding without any human labels.

گہرا غوطہ

2021 میں Meta AI میں Kaiming He اور ساتھیوں کے ذریعہ متعارف کرائے گئے ماسکڈ آٹو اینکوڈرز، ایک تصویر لیں، اسے چھوٹے پیچ میں تقسیم کریں، اور تصادفی طور پر ان کا ایک بہت بڑا حصہ چھپا دیں، اکثر 75%۔ ایک ویژن ٹرانسفارمر انکوڈر صرف نظر آنے والے پیچ پر کارروائی کرتا ہے، جبکہ ہلکا پھلکا ڈیکوڈر گمشدہ پکسلز کے اصل پکسلز کو دوبارہ بنانے کی کوشش کرتا ہے۔ چونکہ بہت کچھ پوشیدہ ہے، ماڈل صرف قریبی پکسلز کاپی نہیں کر سکتا اور اسے بامعنی ڈھانچہ سیکھنا چاہیے، جیسا کہ شکلیں اور آبجیکٹ کے پرزے۔ نقاب پوش پیچ کو چھوڑنے والا انکوڈر تربیت کو تیز اور میموری کو موثر بناتا ہے۔ پہلے سے تربیت کے بعد، ڈیکوڈر کو ضائع کر دیا جاتا ہے اور انکوڈر کو درجہ بندی، پتہ لگانے، اور سیگمنٹیشن کے کاموں میں مضبوطی سے منتقل کیا جاتا ہے۔

تکنیکی بصیرت

کلیدی چال غیر متناسب ہے: بھاری انکوڈر صرف بے نقاب 25% پیچ کو دیکھتا ہے، جبکہ ایک چھوٹا ڈیکوڈر باقی کو دوبارہ تشکیل دیتا ہے۔ پیچ چپٹے ہوئے ہیں، لکیری طور پر سرایت کیے گئے ہیں، اور پوزیشنل انکوڈنگز دی گئی ہیں۔ تعمیر نو کے نقصان کا مطلب مربع غلطی ہے جو صرف نقاب پوش پیچ پر شمار کی جاتی ہے، عام طور پر عام پکسل کی اقدار پر۔ ہائی ماسکنگ ریشوز کم سطح کے انٹرپولیشن کے بجائے سیمنٹک سیکھنے پر مجبور کرتے ہیں، اور انکوڈر کٹس میں نقاب پوش ٹوکن کو چھوڑنا مکمل امیج پر کارروائی کرنے کے مقابلے ڈرامائی طور پر کمپیوٹ کرتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

ماسکڈ آٹو اینکوڈرز کا مستقبل

MAE طرز کی نقاب پوش تعمیر نو تمام طریقوں میں پہلے سے طے شدہ تربیتی نسخہ بن رہی ہے۔ محققین اسے ویڈیو (اسپیس ٹائم کیوبز کو چھپانے)، آڈیو سپیکٹروگرام، میڈیکل اسکینز، اور سیٹلائٹ امیجری تک بڑھا رہے ہیں، جہاں لیبل نایاب اور مہنگے ہیں۔ ملٹی موڈل فاؤنڈیشن ماڈلز، زیادہ موثر ڈیکوڈرز، اور انکولی ماسکنگ کے لیے زبان کے ساتھ سخت فیوژن کی توقع کریں جو معلوماتی علاقوں کو نشانہ بناتی ہے۔ جیسے جیسے کمپیوٹ بڑھتا ہے، بڑے بڑے بغیر لیبل والے تصویری مجموعوں پر نقاب پوش پیشگی تربیت کو بہاو کی درستگی کو بہتر بناتے ہوئے مہنگے انسانی تشریح پر انحصار کم کرتے رہنا چاہیے۔

حقیقی دنیا کا نفاذ

بغیر لیبل والی لاکھوں تصاویر پر وژن ٹرانسفارمر کو پہلے سے تربیت دینا، پھر اسے امیج نیٹ کی درجہ بندی کے لیے مضبوط درستگی کے ساتھ ٹھیک کرنا

بغیر لیبل والے میڈیکل اسکینوں (ایکس رے، ایم آر آئی) سے سیکھنے کی خصوصیات جہاں ماہر تشریح مہنگی اور محدود ہے۔

ایکشن ریکگنیشن ماڈلز (ویڈیو ایم اے ای) کو پہلے سے تربیت دینے کے لیے اسپیس ٹائم پیچ کو ماسک کرکے ویڈیو میں طریقہ اپنانا

زمینی استعمال کی نقشہ سازی اور دستی لیبل کے بغیر پتہ لگانے کو تبدیل کرنے کے لیے سیٹلائٹ اور فضائی تصویروں پر پہلے سے تربیت

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Masked Autoencoders quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

میوزک ماسکڈ جنریٹو امیجنگ

اکثر پوچھے گئے سوالات

What is Masked Autoencoders?

ماسکڈ آٹو اینکوڈرز (MAE) ایک خود زیر نگرانی طریقہ ہے جو زیادہ تر تصویر کو چھپائے جانے کے بعد تصویروں کی تشکیل نو کے لیے وژن ماڈل کو سکھاتا ہے۔ خالی جگہوں کو پُر کرنا سیکھ کر، ماڈل بغیر کسی انسانی لیبل کے بھرپور بصری سمجھ پیدا کرتا ہے۔

ماسکڈ آٹو اینکوڈر میں بنیادی خود کی نگرانی کا کام کیا ہے؟

MAE زیادہ تر تصویری پیچ چھپاتا ہے اور ماڈل کو گمشدہ پکسلز کو دوبارہ تشکیل دینے کی تربیت دیتا ہے، جس میں انسانی لیبل کی ضرورت نہیں ہوتی ہے۔

اصل MAE عام طور پر تصویری پیچ کے کس حصے کو ماسک کرتا ہے؟

اصل MAE 75% پیچ کے ارد گرد ماسک کرتا ہے، ایک اعلی تناسب جو ماڈل کو پڑوسیوں کی نقل کرنے کے بجائے بامعنی ساخت سیکھنے پر مجبور کرتا ہے۔

MAE انکوڈر صرف نظر آنے والے (بغیر نقاب شدہ) پیچ پر کارروائی کیوں کرتا ہے؟

انکوڈر میں نقاب پوش ٹوکنز کو چھوڑنا کمپیوٹ اور میموری کو بہت کم کرتا ہے، کیونکہ یہ پیچ کے صرف ایک چھوٹے سے حصے کو ہینڈل کرتا ہے۔

MAE پری ٹریننگ مکمل ہونے کے بعد ڈیکوڈر کا کیا ہوتا ہے؟

ہلکا پھلکا ڈیکوڈر صرف پری ٹریننگ کے دوران تعمیر نو کے لیے ضروری ہے۔ اس کے بعد سیکھا ہوا انکوڈر پتہ لگانے جیسے کاموں میں منتقل ہوتا ہے۔

MAE عام طور پر تعمیر نو کے لیے کون سا نقصان کا فنکشن استعمال کرتا ہے؟

MAE پیش گوئی شدہ اور حقیقی پکسل اقدار کے درمیان درمیانی مربع غلطی کو کم کرتا ہے، صرف نقاب پوش پیچ پر شمار کیا جاتا ہے۔