ٹیکنیکل گائیڈ

CPU اور NVMe پر آپٹیمائزر اسٹیٹ آف لوڈنگ

میموری کو بچانے کی ایک چال جو CPU RAM میں یا NVMe SSDs پر قلیل GPU میموری کی بجائے ٹریننگ کی بھاری بک کیپنگ (آپٹیمائزر اسٹیٹس، گریڈیئنٹس، بعض اوقات وزن) کو پارک کرتی ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It lets people train far larger models than their GPU's memory would otherwise allow.

گہرا غوطہ

جب آپ ایڈم جیسے آپٹیمائزر کے ساتھ نیورل نیٹ ورک کو تربیت دیتے ہیں، تو ہر پیرامیٹر میں اضافی سامان ہوتا ہے: دو چلنے والے اعدادوشمار (مومینٹم اور تغیر)، نیز وزن کی ایک مکمل درستگی کاپی، نیز اس کا میلان۔ مخلوط صحت سے متعلق تربیت میں یہ کل تقریباً 16 بائٹس فی پیرامیٹر ہو سکتا ہے، وزن کے لیے 2 بائٹس کو بونا کر دیتا ہے۔ آف لوڈنگ اس سامان کو GPU سے دور کر دیتی ہے۔ CPU آف لوڈ آپٹیمائزر سٹیٹس کو PCIe بس کے اوپر عام سسٹم RAM میں لے جاتا ہے، جبکہ NVMe آف لوڈ انہیں تیز ٹھوس سٹیٹ ڈسکوں کی طرف دھکیل دیتا ہے۔ ڈیپ اسپیڈ کے زیرو-انفینٹی اور زیرو-آف لوڈ کے ذریعے مقبول، یہ تکنیک صلاحیت کے لیے خام رفتار کی تجارت کرتی ہے، جس سے ایک واحد GPU یا چھوٹے کلسٹر فائن ٹیون ماڈلز کو اربوں پیرامیٹرز کی اجازت دی جاتی ہے۔

تکنیکی بصیرت

کلید حساب کے ساتھ ڈیٹا کی نقل و حرکت کو اوور لیپ کرنا ہے۔ اصلاحی ریاستیں CPU/NVMe میں بیٹھتی ہیں۔ پسماندہ پاس کے دوران، پارٹیشنز کو ضرورت سے پہلے PCIe پر پیش کیا جاتا ہے اور آپٹیمائزر مرحلہ خود اکثر CPU پر چلتا ہے۔ ZeRO-Offload CPU پر فلوٹ 32 ماسٹر وزن اور ایڈم لمحات رکھتا ہے، لہذا صرف آگے اور پیچھے کی ریاضی GPU پر رہتی ہے۔ NVMe ایک ٹائرڈ کیشے کا اضافہ کرتا ہے لہذا ٹیرابائٹ پیمانے کی حالتیں ڈسک پر پھیل جاتی ہیں جبکہ گرم پارٹیشنز RAM میں رہتے ہیں۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

سی پی یو اور NVMe پر آپٹیمائزر اسٹیٹ آف لوڈنگ کا مستقبل

چونکہ ماڈلز GPU میموری کو بڑھاتے رہتے ہیں، ٹائرڈ آف لوڈنگ غیر ملکی کے بجائے معیاری ہوتی جارہی ہے۔ تیز تر انٹرکنیکٹس جیسے NVLink-C2C اور CXL میموری پولز کے ساتھ سخت انضمام کی توقع کریں جو CPU-GPU باؤنڈری کو دھندلا کر دیتے ہیں، نیز ہوشیار شیڈیولرز جو یہ پیش گوئی کرتے ہیں کہ کون سی ریاست پہلے سے تیار کی جائے گی۔ یونیفائیڈ میموری آرکیٹیکچرز جیسے گریس ہوپر PCIe کے جرمانے کو کم کرتے ہیں، اور فریم ورک ملٹی ٹائر آف لوڈ کو تقریباً شفاف بنانے کی طرف زور دے رہے ہیں تاکہ شوق رکھنے والے معمولی ہارڈ ویئر پر بڑے ماڈلز کو ٹھیک کر سکیں۔

حقیقی دنیا کا نفاذ

ایڈم سٹیٹس کو CPU RAM کی طرف دھکیلنے کے لیے DeepSpeed ​​ZeRO-Offload کا استعمال کرتے ہوئے ایک 24 GB صارف GPU پر 13-بلین پیرامیٹر LLM کو ٹھیک کرنا۔

ایک چھوٹی ریسرچ لیب ZeRO-Infinity کے ساتھ NVMe ڈرائیوز پر آپٹیمائزر سٹیٹس کو پھیلا کر چند GPUs پر ملٹی بلین پیرامیٹر ماڈل کی تربیت دے رہی ہے۔

ہگنگ فیس ایکسلریٹ کنفیگرز جو CPU آف لوڈ کو فعال کرتی ہیں تاکہ صارف مکمل فائن ٹیوننگ جابز چلا سکیں جو بصورت دیگر میموری سے باہر ہونے والی خرابیوں کو پھینک دیں گی۔

لاگت سے آگاہ اسٹارٹ اپ سستے، کم میموری والے کلاؤڈ GPUs کو کرائے پر لے رہے ہیں اور اعلی درجے کے 80 GB کارڈز کے لیے ادائیگی کرنے کے بجائے منسلک NVMe پر آف لوڈ کر رہے ہیں۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Optimizer State Offloading to CPU and NVMe quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

ایڈم اور اڈاپٹیو آپٹیمائزرز

اکثر پوچھے گئے سوالات

What is Optimizer State Offloading to CPU and NVMe?

میموری کو بچانے کی ایک چال جو CPU RAM میں یا NVMe SSDs پر قلیل GPU میموری کی بجائے ٹریننگ کی بھاری بک کیپنگ (آپٹیمائزر اسٹیٹس، گریڈیئنٹس، بعض اوقات وزن) کو پارک کرتی ہے۔ یہ لوگوں کو ان کے GPU کی میموری سے کہیں زیادہ بڑے ماڈلز کی تربیت دینے دیتا ہے بصورت دیگر۔

CPU یا NVMe پر آپٹیمائزر اسٹیٹس کو آف لوڈ کرنے کا بنیادی مقصد کیا ہے؟

آف لوڈنگ ہیوی آپٹیمائزر کو GPU سے ہٹ کر CPU RAM یا NVMe میں منتقل کرتا ہے، GPU میموری کو آزاد کرتا ہے تاکہ بڑے ماڈلز کو اسی ہارڈ ویئر پر تربیت دی جا سکے۔

مخلوط درستگی میں ایڈم آپٹیمائزر کے لیے، کون سا ڈیٹا عام طور پر سب سے زیادہ میموری فی پیرامیٹر استعمال کرتا ہے؟

ایڈم رفتار، تغیر، اور ایک مکمل درستگی والا ماسٹر وزن، کل تقریباً 16 بائٹس فی پیرامیٹر، 2-بائٹ آدھے درست وزن سے کہیں زیادہ ذخیرہ کرتا ہے۔

کس فریم ورک کی خصوصیت نے بڑے پیمانے پر آپٹیمائزر آف لوڈنگ کو مقبول بنایا؟

DeepSpeed ​​کے ZeRO-Offload اور ZeRO-Infinity نے CPU اور NVMe میں آف لوڈنگ آپٹیمائزر سٹیٹس کو پیمانے پر متعارف کرایا اور مقبول کیا۔

CPU یا NVMe پر آف لوڈ کرنے کی اصل کارکردگی کی قیمت کیا ہے؟

ریاستوں کو GPU سے دور منتقل کرنے کا مطلب ہے ڈیٹا کو PCIe یا NVMe پر منتقل کرنا، جو GPU میموری کے مقابلے میں سست ہے، لہذا تھرو پٹ گرتا ہے جب تک کہ کمپیوٹ کے ساتھ اوورلیپ نہ ہو۔

آف لوڈنگ سسٹمز منتقلی میں تاخیر کو کیسے چھپاتے ہیں؟

شیڈیولرز PCIe پر ضروری پارٹیشنز کو پیش کرتے ہیں جب کہ GPU ابھی بھی کمپیوٹنگ کر رہا ہے، کمپیوٹنگ کے ساتھ مواصلت کو ماسک لیٹینسی تک لے جا رہا ہے۔