ٹیکنیکل گائیڈ

ٹینسر کور

Tensor Cores جدید NVIDIA GPUs کے اندر خصوصی ہارڈ ویئر یونٹس ہیں جو میٹرکس ضرب اور جمع آپریشن کو انتہائی تیزی سے انجام دیتے ہیں۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

They are the main reason a single GPU can train and run large neural networks orders of magnitude faster than general-purpose compute would allow.

گہرا غوطہ

2017 میں وولٹا آرکیٹیکچر کے ساتھ متعارف کرایا گیا، Tensor Cores مخصوص سرکٹس ہیں جو معیاری CUDA cores پر ایک وقت میں ایک ضرب کرنے کے بجائے، ایک ہی آپریشن میں ایک چھوٹے میٹرکس ضرب کے علاوہ ایک اضافے (D = A x B + C) کی گنتی کرتے ہیں۔ چونکہ نیورل نیٹ ورک کی عملی طور پر ہر پرت میٹرکس ضرب تک کم ہو جاتی ہے، اس لیے یہ ریاضی کے AI سے میل کھاتا ہے۔ ہر GPU جنریشن نے اسے بڑھایا جس کو وہ سنبھالتے ہیں: Volta نے 4x4 FP16 ٹائلیں کیں، جب کہ بعد میں Ampere، Hopper، اور Blackwell architectures نے TF32، BF16، INT8، FP8، اور FP4 جیسے کم درستگی والے فارمیٹس کو شامل کیا۔ کم درستگی کا مطلب ہے کہ فی گھڑی پروسیس کی جانے والی زیادہ تعداد، درستگی کو قابل قبول رکھتے ہوئے تربیت اور تخمینہ کے لیے ڈرامائی طور پر تھرو پٹ کو بڑھانا۔

تکنیکی بصیرت

ایک ٹینسر کور دو چھوٹے میٹرکس کو ضرب دیتا ہے اور نتیجہ کو ایک فیوزڈ مرحلہ میں جمع کرتا ہے، اس حقیقت کا فائدہ اٹھاتے ہوئے کہ ایک ہی ان پٹ ویلیوز کو کئی آؤٹ پٹ عناصر میں دوبارہ استعمال کیا جاتا ہے۔ یہ عام طور پر کم درستگی (FP16, BF16، یا FP8) میں آدانوں کو پڑھتا ہے لیکن راؤنڈنگ کی خرابی کو محدود کرنے کے لیے زیادہ درستگی (اکثر FP32) میں چلتی رقم کو جمع کرتا ہے۔ cuBLAS اور cuDNN جیسی سافٹ ویئر لائبریریاں، اور PyTorch جیسے فریم ورک، بڑے میٹرکس کو ان چھوٹے بلاکس میں خود بخود ٹائل کر دیتے ہیں تاکہ ماڈلز کو مینوئل کوڈنگ کے بغیر اسپیڈ اپ مل جائے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

ٹینسر کور کا مستقبل

ٹینسر کور ہمیشہ کم درستگی کی طرف بڑھتے رہتے ہیں: ہوپر نے FP8 کو شامل کیا اور بلیک ویل نے ہارڈ ویئر کے زیر انتظام اسکیلنگ کے ساتھ 4-bit FP4 متعارف کرایا، جس سے اندازہ لگانے والے بھاری کام کے بوجھ کے لیے ہر قدم کے ذریعے تھرو پٹ کو تقریباً دوگنا کر دیا گیا۔ اسپارسٹی (صفر وزن کو چھوڑنا)، مائیکرو اسکیلنگ فارمیٹس کے لیے سخت سپورٹ کی توقع کریں جو نمبروں کے چھوٹے بلاکس میں پیمانے کے عوامل کو منسلک کرتے ہیں، اور میموری سسٹم کے ساتھ گہرے انضمام کی توقع کریں تاکہ کور فیڈ رہیں۔ جیسے جیسے ماڈلز بڑھتے ہیں، میٹرکس انجن، نہ کہ خام گھڑی کی رفتار، AI ہارڈویئر کی کارکردگی کے لیے مرکزی میدان جنگ بنا ہوا ہے۔

حقیقی دنیا کا نفاذ

GPT طرز کے ٹرانسفارمرز جیسے بڑے زبان کے ماڈلز کو تربیت دینا، جہاں BF16 یا FP8 میں Tensor Cores پر فی قدم اربوں میٹرکس ضربیں چلتی ہیں۔

چیٹ بوٹس اور امیج جنریٹرز کے لیے ریئل ٹائم انفرنس چلانا، فی GPU زیادہ صارفین کی خدمت کے لیے INT8 یا FP8 کوانٹائزیشن کا استعمال۔

ویڈیو گیمز میں NVIDIA DLSS کو تیز کرنا، جہاں ایک نیورل نیٹ ورک ہر فریم کو Tensor Cores کا استعمال کرتے ہوئے نچلے ریزولوشن والے فریموں کو بڑھاتا ہے۔

سائنسی کمپیوٹنگ کو تیز کرنا جیسے کہ پروٹین فولڈنگ (الفا فولڈ) اور موسمی ماڈلز جنہیں میٹرکس ہیوی نیورل ورک بوجھ کے طور پر ریفارم کیا گیا ہے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tensor Cores quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

بڑے ماڈلز کے لیے ٹینسر متوازی

اکثر پوچھے گئے سوالات

What is Tensor Cores?

Tensor Cores جدید NVIDIA GPUs کے اندر خصوصی ہارڈ ویئر یونٹس ہیں جو میٹرکس ضرب اور جمع آپریشن کو انتہائی تیزی سے انجام دیتے ہیں۔ یہ بنیادی وجہ ہیں کہ ایک واحد GPU بڑے عصبی نیٹ ورکس کو تربیت دے سکتا ہے اور چلا سکتا ہے جس کی شدت عام مقصد کے کمپیوٹ کی اجازت دیتا ہے۔

Tensor Cores کو کس بنیادی ریاضیاتی آپریشن کو تیز کرنے کے لیے خاص طور پر ڈیزائن کیا گیا ہے؟

ٹینسر کور ایک قدم میں فیوزڈ میٹرکس ضرب پلس جمع کرتے ہیں، جو بالکل وہی آپریشن ہے جو نیورل نیٹ ورک کی تہوں پر حاوی ہے۔

کس NVIDIA GPU فن تعمیر نے سب سے پہلے ٹینسر کور متعارف کرایا؟

Tensor Cores نے FP16 4x4 میٹرکس آپریشنز کے ساتھ، 2017 میں Volta فن تعمیر کے ساتھ ڈیبیو کیا۔

ٹینسر کور اکثر FP16 یا FP8 کی طرح کم درستگی کیوں استعمال کرتے ہیں؟

فی نمبر کم بٹس استعمال کرنے کا مطلب ہے کہ ہر سائیکل میں ہارڈ ویئر کے ذریعے زیادہ قدریں بہہ جاتی ہیں، صرف ایک چھوٹی، عام طور پر قابل برداشت، درستگی کے نقصان کے ساتھ رفتار میں بہت زیادہ اضافہ ہوتا ہے۔

درستگی کو محفوظ رکھنے کے لیے، Tensor Cores عام طور پر چلنے والی رقم (جمع) کے لیے کون سی درستگی استعمال کرتے ہیں؟

ان پٹ کم درستگی کے حامل ہو سکتے ہیں، لیکن جمع کرنے والا عام طور پر FP32 کی طرح زیادہ درستگی میں چلتا ہے تاکہ راؤنڈنگ کی غلطیوں کو محدود کیا جا سکے۔

روزمرہ کے AI فریم ورک جیسے PyTorch Tensor Cores کا استعمال کیسے کرتے ہیں؟

بنیادی لائبریریاں بڑے میٹرکس آپریشنز کو خود بخود ٹینسر کور سائز کی ٹائلوں میں توڑ دیتی ہیں، اس لیے فریم ورک مینوئل کوڈنگ کے بغیر اسپیڈ اپ حاصل کرتے ہیں۔