ٹیکنیکل گائیڈ

تقسیم شدہ AI کے لیے رے

رے ایک اوپن سورس فریم ورک ہے جو لیپ ٹاپ سے لے کر ہزاروں مشینوں کے کلسٹر تک Python اور AI ورک بوجھ کو پیمانہ کرنا آسان بناتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It matters because it gives a simple, unified way to distribute training, tuning, data processing, and serving without rewriting your code for each.

گہرا غوطہ

رے کا بنیادی خیال کم سے کم تبدیلی کے ساتھ عام Python فنکشنز اور کلاسز کو تقسیم شدہ یونٹوں میں تبدیل کر رہا ہے۔ ریموٹ 'ٹاسک' کے بطور نشان زد ایک فنکشن کلسٹر میں کسی بھی کارکن پر متضاد طور پر چلتا ہے۔ دور دراز کے 'اداکار' کے طور پر نشان زد ایک کلاس ایک کارکن پر رہنے والی ریاستی خدمت بن جاتی ہے۔ رے ہلکا پھلکا فیوچر (آبجیکٹ حوالہ جات) واپس کرتا ہے اور شیڈولنگ، مشترکہ آبجیکٹ اسٹور کے ذریعے ڈیٹا کی نقل و حرکت، اور غلطی برداشت کرتا ہے۔ اس بنیادی سیٹ کے مقصد سے تیار کردہ لائبریریوں کے اوپری حصے میں: تقسیم شدہ ماڈل ٹریننگ کے لیے رے ٹرین، ہائپر پیرامیٹر کی تلاش کے لیے رے ٹیون، ڈیٹا پائپ لائنوں کو سٹریم کرنے کے لیے رے ڈیٹا، کمک سیکھنے کے لیے RLlib، اور توسیع پذیر ماڈل کی خدمت کے لیے رے سرو۔ یہ ایک کلسٹر کو پورے ML ورک فلو کو آخر تک ہینڈل کرنے دیتا ہے۔

تکنیکی بصیرت

کلیدی پرائمٹیو ٹاسکس (سٹیٹ لیس، متوازی فنکشن کالز) اور اداکار ہیں (ریاستی کارکن جو بھاری بھرکم ماڈل یا کاؤنٹر جیسی چیزیں رکھتے ہیں)۔ جب آپ کسی ریموٹ ٹاسک کو کال کرتے ہیں، رے فوری طور پر مستقبل لوٹاتا ہے اور دستیاب CPUs/GPUs میں کام کو شیڈول کرتا ہے۔ آپ نتائج حاصل کرنے کے لیے ray.get() کو کال کریں۔ زیرو کاپی مشترکہ میموری کے ساتھ ایک تقسیم شدہ ان میموری آبجیکٹ اسٹور بڑی اشیاء جیسے کارکنوں کے درمیان صفوں کو مؤثر طریقے سے منتقل کرتا ہے، بار بار سیریلائزیشن سے گریز کرتا ہے اور ڈیٹا ہیوی AI پائپ لائنوں کو تیزی سے بناتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

تقسیم شدہ AI کے لیے رے کا مستقبل

رے بڑے پیمانے پر AI کے لیے ریڑھ کی ہڈی بن گیا ہے، خاص طور پر بڑے زبان کے ماڈلز کی تربیت اور پیش کرنے میں استعمال ہوتا ہے۔ LLM کے لیے مخصوص سرونگ (VLLM کے ساتھ رے سرو)، متضاد GPU شیڈولنگ، ڈیٹا لیکس اور Kubernetes کے ساتھ KubeRay کے ذریعے سخت انضمام، اور تیز پیدا کرنے والے کام کے بوجھ کے لیے بہتر آٹو اسکیلنگ میں اضافے کی توقع کریں۔ جیسے جیسے ماڈلز بڑھتے ہیں، ملٹی نوڈ ٹریننگ، RLHF پائپ لائنز، اور ہزاروں ایکسلریٹروں کے بیچ کے تخمینے کو ترتیب دینے میں رے کے کردار میں توسیع کا امکان ہے۔

حقیقی دنیا کا نفاذ

بہترین ماڈل کنفیگریشن تلاش کرنے کے لیے ایک GPU کلسٹر میں متوازی طور پر سینکڑوں ہائپر پیرامیٹر کے مجموعے تلاش کرنے کے لیے رے ٹیون چلانا

بہت سے GPUs اور نوڈس میں کم سے کم کوڈ تبدیلیوں کے ساتھ گہری سیکھنے کے ماڈل کی تربیت کو تقسیم کرنے کے لیے رے ٹرین کا استعمال

رے ڈیٹا کے ساتھ ایک بیچ-انفرنس پائپ لائن بنانا تاکہ ریکارڈز کو ایک کلسٹر میں ماڈل کے ذریعے سٹریم کر کے لاکھوں ریکارڈ اسکور کر سکیں

متغیر پروڈکشن ٹریفک کو سنبھالنے کے لیے رے سرو کے ساتھ ایک ہی آٹو اسکیلنگ اینڈ پوائنٹ کے پیچھے متعدد ماڈلز کو تعینات کرنا

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Ray for Distributed AI quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

گریڈینٹ چیک پوائنٹنگ

اکثر پوچھے گئے سوالات

What is Ray for Distributed AI?

رے ایک اوپن سورس فریم ورک ہے جو لیپ ٹاپ سے لے کر ہزاروں مشینوں کے کلسٹر تک Python اور AI ورک بوجھ کو پیمانہ کرنا آسان بناتا ہے۔ یہ اہمیت رکھتا ہے کیونکہ یہ ہر ایک کے لیے آپ کے کوڈ کو دوبارہ لکھے بغیر تربیت، ٹیوننگ، ڈیٹا پروسیسنگ، اور سرونگ تقسیم کرنے کا ایک آسان، متحد طریقہ فراہم کرتا ہے۔

رے بنیادی طور پر کون سا مسئلہ حل کرتا ہے؟

رے کام کے بوجھ کی ہر قسم کے لیے آپ کے کوڈ کو دوبارہ لکھے بغیر کئی مشینوں میں حساب تقسیم کرنے کا ایک متحد، آسان طریقہ فراہم کرتا ہے۔

رے میں، 'ٹاسک' اور 'اداکار' میں کیا فرق ہے؟

ٹاسک اسٹیٹ لیس ریموٹ فنکشنز ہیں جو متوازی طور پر چلتے ہیں، جب کہ اداکار طویل عرصے تک رہنے والی چیزیں ہیں جو ایک بھری ہوئی ماڈل کی طرح ریاست کو برقرار رکھتی ہیں۔

جب آپ کوئی ریموٹ ٹاسک شروع کرتے ہیں تو رے فوری طور پر کیا واپس کرتا ہے؟

رے فوری طور پر ایک ہلکا پھلکا مستقبل لوٹاتا ہے لہذا کام متضاد طور پر چلتا ہے۔ آپ ray.get() کو کال کریں تاکہ ضرورت پڑنے پر اصل نتیجہ حاصل کیا جا سکے۔

کون سی رے لائبریری تقسیم شدہ ہائپر پیرامیٹر تلاش کے لیے ڈیزائن کی گئی ہے؟

رے ٹیون ایک کلسٹر میں متوازی طور پر بہت سے ہائپر پیرامیٹر ٹرائلز چلانے میں مہارت رکھتا ہے۔

رے کا آبجیکٹ اسٹور ڈیٹا ہیوی AI پائپ لائنوں کو کس طرح موثر بناتا ہے؟

مشترکہ ان میموری آبجیکٹ اسٹور زیرو کاپی ریڈز کا استعمال کرتا ہے تاکہ کارکنوں کے ذریعہ مہنگی دوبارہ سیریلائزیشن کے بغیر بڑی صفوں تک رسائی حاصل کی جاسکے۔