بصری AI گائیڈ

وژن ٹرانسفارمرز

ویژن ٹرانسفارمرز (ViTs) ٹرانسفارمر فن تعمیر کو لاگو کرتے ہیں جو ChatGPT کو تصاویر پر طاقت دیتا ہے، تصویر کو پکسلز کے گرڈ کے بجائے پیچ کی ترتیب کے طور پر پیش کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

They proved that you do not need convolutions to achieve state-of-the-art image recognition.

گہرا غوطہ

برسوں تک، کنوولیشنل نیورل نیٹ ورکس (CNNs) نے ایک تصویر پر چھوٹے فلٹرز کو اسکین کرکے کمپیوٹر وژن پر غلبہ حاصل کیا۔ Google کے 2020 پیپر 'An Image Is Worth 16x16 Words' نے ایک تصویر کو فکسڈ پیچ، عام طور پر 16x16 پکسلز میں کاٹ کر، ہر ایک کو ویکٹر میں چپٹا کرکے، اور نتیجے کی ترتیب کو معیاری ٹرانسفارمر میں کھلا کر چیلنج کیا۔ ہر پیچ ایک 'ٹوکن' بن جاتا ہے، جیسے کسی جملے میں ایک لفظ۔ اس کے بعد ماڈل خود توجہ کا استعمال کرتا ہے تاکہ ہر پیچ براہ راست ہر دوسرے پیچ سے منسلک ہو سکے، طویل فاصلے کے تعلقات کو پکڑتے ہوئے ایک چھوٹا سا کنولوشنل فلٹر ایک قدم میں نہیں دیکھ سکتا۔ کیچ: ViTs ڈیٹا کے بھوکے ہیں کیونکہ ان میں CNNs کے پہلے سے موجود مفروضوں کی کمی ہے۔ JFT-300M جیسے بہت بڑے ڈیٹاسیٹس پر تربیت یافتہ، انہوں نے بہترین CNNs سے مماثل یا شکست دی، جدید وژن ریسرچ کو نئی شکل دی۔

تکنیکی بصیرت

ایک ViT ایک تصویر کو نان اوورلیپنگ پیچ میں تقسیم کرتا ہے، ہر ایک کو ایک ایمبیڈنگ میں لکیری طور پر پروجیکٹ کرتا ہے، اور پوزیشنل انکوڈنگز شامل کرتا ہے تاکہ ماڈل کو معلوم ہو کہ ہر پیچ اصل تصویر میں کہاں بیٹھا ہے۔ ایک خاص سیکھنے کے قابل 'کلاس ٹوکن' پیش کیا جاتا ہے۔ اس کی حتمی نمائندگی درجہ بندی کو آگے بڑھاتی ہے۔ اسٹیک شدہ خود دھیان کی پرتیں ہر ایک پیچ کو دوسرے تمام لوگوں سے معلومات کا وزن کرنے دیتی ہیں، جس سے پرت ون سے ایک عالمی قابل قبول فیلڈ ملتا ہے۔ چونکہ توجہ کے پیمانے پیچ کی تعداد کے ساتھ چوکور انداز میں ہوتے ہیں، اس لیے ہائی ریزولوشن والی تصاویر مہنگی ہو جاتی ہیں، یہی وجہ ہے کہ پیچ کا سائز اور توجہ کی موثر قسمیں اہم ہیں۔

اسٹریٹجک اثر

رفتار اور پیمانہ

بصری AI پیمانے پر معائنہ، پتہ لگانے، اور ٹیگنگ کے کاموں کو خودکار کر سکتا ہے۔

Build choices

تخلیقی ٹیمیں کم دستی ترمیم کے ساتھ تصورات کو تیزی سے پروٹو ٹائپ کر سکتی ہیں۔

Team and workflow

آپریشنز امیج اور ویڈیو سگنلز کا استعمال کر سکتے ہیں جن پر کارروائی کرنا پہلے مشکل تھا۔

وژن ٹرانسفارمرز کا مستقبل

ViTs اور CNN-ٹرانسفارمر ہائبرڈز اب لیڈنگ ویژن سسٹمز کو طاقت دیتے ہیں، اور فن تعمیر ملٹی موڈل ماڈلز کو زیر کرتا ہے جو تصاویر کو متن کے ساتھ فیوز کرتے ہیں، جیسے CLIP اور جدید وژن لینگویج اسسٹنٹ۔ اعلی ریزولیوشن اور ویڈیو کے لیے توجہ کو سستا بنانے کے لیے جاری کام کی توقع کریں، نیز خود زیر نگرانی پری ٹریننگ (جیسے ماسکڈ امیج ماڈلنگ) جو لیبل والے ڈیٹا کی بے حد بھوک کو کم کرتی ہے۔ جیسے جیسے کمپیوٹ بڑھتا ہے، 'لینگویج ماڈل' اور 'وژن ماڈل' کے درمیان لائن دھندلی ہوتی رہتی ہے، ٹرانسفارمرز الگ الگ مخصوص ڈیزائن کے بجائے طریقوں میں مشترکہ ریڑھ کی ہڈی کے طور پر کام کرتے ہیں۔

حقیقی دنیا کا نفاذ

Google کی تصویر کی درجہ بندی اور تلاش کی درجہ بندی کے نظام جنہوں نے ViT کے CNNs کے ساتھ مسابقتی ثابت ہونے کے بعد ٹرانسفارمر بیک بون کو اپنایا

CLIP اور دیگر امیج ٹیکسٹ ماڈلز جو تصاویر کو انکوڈ کرنے کے لیے ViT کا استعمال کرتے ہیں تاکہ تصاویر اور کیپشنز کو مشترکہ جگہ میں ملایا جا سکے۔

میڈیکل امیجنگ ریسرچ ViTs کا استعمال کرتے ہوئے صرف مقامی ساخت کے بجائے پورے اسکین میں پیٹرن کو تلاش کرتی ہے۔

سیلف ڈرائیونگ اور روبوٹکس پرسیپشن اسٹیکس جو منظر کی تفہیم کے لیے ViT طرز کی توجہ کو یکجا کرتے ہیں

خطرات اور گارڈریلز

تصویر کے حقوق اور رضامندی قانونی خطرات بن سکتے ہیں اگر ثبوت واضح نہ ہو۔

ماڈل کی کارکردگی روشنی، ڈیموگرافکس اور ماحول میں مختلف ہو سکتی ہے۔

جب تک اعتماد کی حدوں کی نگرانی نہ کی جائے غلط مثبتات پر کسی کا دھیان نہیں جا سکتا۔

نفاذ کا روڈ میپ

1

درستگی، یاد کرنے، اور غلطی کے اخراجات کے لیے قبولیت کے معیار کی وضاحت کریں۔

2

اعداد و شمار کے ساتھ ٹیسٹ کریں جو حقیقی پیداوار کے حالات سے میل کھاتا ہے۔

3

کم اعتماد یا زیادہ اثر والی پیشین گوئیوں کے لیے انسانی جائزہ شامل کریں۔

4

کیمرہ یا ڈیٹاسیٹ کی تبدیلیوں کے بعد ماڈل ڈرفٹ کو ٹریک کریں اور دوبارہ تصدیق کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Vision Transformers quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Vision Transformers?

ویژن ٹرانسفارمرز (ViTs) ٹرانسفارمر فن تعمیر کو لاگو کرتے ہیں جو ChatGPT کو تصاویر پر طاقت دیتا ہے، تصویر کو پکسلز کے گرڈ کے بجائے پیچ کی ترتیب کے طور پر پیش کرتا ہے۔ انہوں نے ثابت کیا کہ جدید ترین تصویری شناخت حاصل کرنے کے لیے آپ کو کنولوشنز کی ضرورت نہیں ہے۔

وژن ٹرانسفارمر ابتدائی طور پر ان پٹ امیج پر کیسے عمل کرتا ہے؟

ایک ViT تصویر کو فکسڈ پیچز (اکثر 16x16 پکسلز) میں تقسیم کرتا ہے، ہر پیچ کو بطور ٹوکن سرایت کرتا ہے، اور ترتیب کو ٹرانسفارمر میں فیڈ کرتا ہے۔

کون سا کلیدی طریقہ کار ایک ViT کو ایک تصویر کے دور دراز حصوں کو ایک دوسرے سے منسلک کرنے دیتا ہے؟

خود توجہ ہر پیچ کو ہر دوسرے پیچ سے براہ راست معلومات کا وزن کرنے دیتی ہے، پہلی پرت سے عالمی منظر پیش کرتی ہے۔

سادہ ویژن ٹرانسفارمرز کو عام طور پر ایکسل کے لیے بہت بڑے ٹریننگ ڈیٹا سیٹس کی ضرورت کیوں ہوتی ہے؟

CNNs کے برعکس، ViTs مقامیت یا ترجمے کی تبدیلی کو قبول نہیں کرتے، اس لیے انہیں ان نمونوں کو بڑی مقدار میں ڈیٹا سے سیکھنا چاہیے۔

وژن ٹرانسفارمر میں پوزیشنل انکوڈنگ کا مقصد کیا ہے؟

خود دھیان آرڈر-ایگنوسٹک ہے، لہذا پوزیشنی انکوڈنگز ہر پیچ کے مقامی مقام کو بحال کرتی ہیں۔

کون سا بیان کمپیوٹر ویژن پر ViT کے اثر کو بہتر طور پر ظاہر کرتا ہے؟

ViT نے ثابت کیا کہ ایک خالص ٹرانسفارمر، جس میں کافی ڈیٹا اور پیمانہ موجود ہے، بہترین کنوولوشنل نیٹ ورکس کا مقابلہ یا اس سے آگے نکل سکتا ہے۔