ٹیکنیکل گائیڈ

چیک پوائنٹ شارڈنگ اور دوبارہ شروع ہونے والی تربیت

ماڈل کی تربیتی حالت کو ٹکڑوں (شارڈز) میں محفوظ کرنے کی تکنیکیں تاکہ دیوہیکل ماڈلز کو میموری یا ڈسک کی حدود میں گھٹن کے بغیر محفوظ اور دوبارہ لوڈ کیا جا سکے، اور اس طرح کریش ہونے والا رن بالکل وہی جگہ لے سکتا ہے جہاں سے اسے چھوڑا گیا تھا۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

Essential for any training job that runs for days or weeks across many GPUs.

گہرا غوطہ

ایک تربیتی چوکی دوبارہ شروع کرنے کے لیے درکار ہر چیز کا اسنیپ شاٹ ہے: ماڈل وزن، آپٹیمائزر اسٹیٹس، سیکھنے کی شرح کا شیڈول، ڈیٹا لوڈر کی پوزیشن، اور بے ترتیب نمبر جنریٹر کے بیج۔ بڑے ماڈلز کے لیے یہ سنیپ شاٹ سینکڑوں گیگا بائٹس کا ہو سکتا ہے، جو ایک فائل یا ایک مشین کی میموری کے لیے بہت بڑا ہے۔ چیک پوائنٹ شارڈنگ اسنیپ شاٹ کو بہت سی فائلوں اور کئی رینکوں میں تقسیم کرتا ہے، اس لیے ہر GPU متوازی طور پر صرف اپنا ٹکڑا لکھتا ہے۔ دوبارہ شروع ہونے والی تربیت پھر ان شارڈز کو دوبارہ لوڈ کرتی ہے اور پوری حالت کو ٹھیک ٹھیک بحال کرتی ہے۔ اس کے بغیر، ایک ملٹی ویک رن جو 200 گھنٹے پر کریش ہو جاتی ہے اسے شروع سے دوبارہ شروع کرنا پڑے گا۔ فریم ورک جیسے PyTorch Distributed Checkpoint، DeepSpeed، اور Hugging Face Hub کے sharded safetensors فارمیٹ اس معمول کو بناتے ہیں۔

تکنیکی بصیرت

شارڈنگ کام کرتی ہے کیونکہ تقسیم شدہ تربیت پہلے ہی درجہ بندیوں میں وزن اور اصلاحی ریاستوں کو تقسیم کرتی ہے (ڈیٹا، ٹینسر، یا زیرو متوازی کے ذریعے)۔ ہر درجہ صرف اس کی تقسیم کو سیریلائز کرتا ہے، اکثر سیفٹینسرز جیسے فارمیٹس میں جو سست، میموری میپڈ لوڈنگ کی اجازت دیتے ہیں۔ ایک انڈیکس فائل پیرامیٹر کے ناموں کو شارڈ فائلوں میں نقش کرتی ہے۔ تعییناتی طور پر دوبارہ شروع کرنے کے لیے، سسٹم RNG سٹیٹس، آپٹیمائزر سٹیپ کاؤنٹ، اور عین مطابق ڈیٹا لوڈر آفسیٹ کو بھی برقرار رکھتا ہے، لہذا دوبارہ چلنا بیچوں کی اسی ترتیب کو دوبارہ پیش کرتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

چیک پوائنٹ شیئرنگ اور دوبارہ شروع ہونے والی تربیت کا مستقبل

چیک پوائنٹنگ ایک متواتر اسٹاپ دی ورلڈ ایونٹ سے کسی غیر مطابقت پذیر اور تقریبا مفت میں منتقل ہو رہی ہے۔ مزید ان میموری اور اوورلیپ شدہ چیک پوائنٹنگ کی توقع کریں جو تربیت جاری رہنے کے دوران پس منظر میں شارڈز لکھتی ہے، نیز مٹانے والے کوڈ شدہ اور نقل شدہ چیک پوائنٹس جو ہزار GPU پیمانے پر عام نوڈ کی ناکامیوں سے بچ جاتے ہیں۔ کلاؤڈ آبجیکٹ اسٹورز اور تیز تر مقامی NVMe ٹائرز شارڈز کی میزبانی کریں گے، اور سیفٹینسرز جیسے معیاری فارمیٹس ٹریننگ کی بحالی اور انفرنس تعیناتی دونوں کے لیے محفوظ، تیز، جزوی لوڈنگ کو بہتر بناتے رہیں گے۔

حقیقی دنیا کا نفاذ

ایک فرنٹیئر ماڈل ہزاروں GPUs پر چلتا ہے جو ہر چند سو قدموں پر شارڈڈ چیک پوائنٹس کو خود بخود محفوظ کرتا ہے لہذا ایک ناکام نوڈ صرف منٹوں میں خرچ ہوتا ہے، دن نہیں۔

Hugging Face ایک بڑے کھلے ماڈل کو ایک سے زیادہ سیفٹینسرز شارڈ کے علاوہ index.json کے طور پر تقسیم کرتا ہے تاکہ صارف اسے ٹکڑے ٹکڑے کرکے ڈاؤن لوڈ اور لوڈ کر سکیں۔

ایک محقق ایک وقفہ شدہ فائن ٹیون کو دوبارہ شروع کر رہا ہے جو بغیر کسی رکاوٹ کے جاری رکھنے کے لیے درست اصلاحی رفتار، قدموں کی گنتی، اور ڈیٹا لوڈر کی پوزیشن کو بحال کرتا ہے۔

سستے پیشگی کلاؤڈ GPUs پر اسپاٹ-انسٹینس ٹریننگ، جہاں بار بار شارڈ چوکیاں نوکری کو بے دخل ہونے اور دوبارہ شیڈول کیے جانے کے بعد زندہ رہنے دیتی ہیں۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Checkpoint Sharding and Resumable Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

AI ٹریننگ کلسٹرز کے لیے سلم

اکثر پوچھے گئے سوالات

What is Checkpoint Sharding and Resumable Training?

ماڈل کی تربیتی حالت کو ٹکڑوں (شارڈز) میں محفوظ کرنے کی تکنیکیں تاکہ دیوہیکل ماڈلز کو میموری یا ڈسک کی حدود میں گھٹن کے بغیر محفوظ اور دوبارہ لوڈ کیا جا سکے، اور اس طرح کریش ہونے والا رن بالکل وہی جگہ لے سکتا ہے جہاں سے اسے چھوڑا گیا تھا۔ کسی بھی تربیتی کام کے لیے ضروری ہے جو کئی GPUs میں دنوں یا ہفتوں تک چلتا ہے۔

بڑے ماڈل چوکیوں کو شارڈز میں کیوں تقسیم کیا جاتا ہے؟

بڑی چوکیاں (سینکڑوں جی بی) ایک فائل کی طرح ناقابل عمل ہیں۔ شارڈنگ بہت سے رینک کو اپنے سلائسز کو متوازی طور پر لکھنے دیتی ہے اور پیس وار لوڈنگ کو قابل بناتی ہے۔

ماڈل کے وزن کے علاوہ، دوبارہ شروع کرنے کے قابل چیک پوائنٹ کو عام طور پر اور کیا بچانا چاہیے؟

بالکل دوبارہ شروع کرنے کے لیے، چیک پوائنٹ آپٹیمائزر اسٹیٹس، رینڈم نمبر جنریٹر اسٹیٹس، قدموں کی گنتی، اور ڈیٹا لوڈر نے کہاں چھوڑا تھا اسٹور کرتا ہے۔

طویل ملازمتوں کے لیے دوبارہ شروع کی جانے والی تربیت کا بنیادی فائدہ کیا ہے؟

دوبارہ شروع کرنے کے قابل چیک پوائنٹس کے ساتھ، ایک وقفہ شدہ رن اپنی آخری محفوظ شدہ حالت کو دوبارہ لوڈ کرتا ہے اور حساب کے دنوں کو ضائع کرنے کے بجائے جاری رہتا ہے۔

ہر GPU رینک عام طور پر شارڈ چیک پوائنٹ میں کیسے حصہ ڈالتا ہے؟

چونکہ تقسیم شدہ تربیت ماڈل کو پہلے ہی صفوں میں تقسیم کرتی ہے، ہر رینک صرف اس کا ٹکڑا لکھتا ہے، جس سے بچت متوازی اور میموری کو موثر بنایا جاتا ہے۔

شارڈ چیک پوائنٹس میں انڈیکس فائل کیا کردار ادا کرتی ہے؟

ایک انڈیکس (مثال کے طور پر، index.json) ریکارڈ کرتا ہے کہ کون سا شارڈ ہر پیرامیٹر کو رکھتا ہے تاکہ لوڈرز صحیح ٹکڑوں کو بازیافت اور دوبارہ جوڑ سکیں۔