کیا ہوا؟
NVIDIA نے شیڈو انجن ریکوری کو ایک پیش نظارہ خصوصیت کے طور پر Dynamo میں متعارف کرایا، اس کا پلیٹ فارم بڑے لینگویج ماڈلز کو پیش کرتا ہے۔ ڈیزائن فعال انجن کے ساتھ ایک بیکار، مکمل طور پر ابتدائی انجن رکھتا ہے اور GPU میموری سروس کا استعمال کرتا ہے تاکہ عمل کی ناکامیوں کے دوران ماڈل کے وزن کو محفوظ اور شیئر کیا جا سکے۔
NVIDIA نے 25 اگست 2026 کو ایک تکنیکی بلاگ میں شیڈو انجن کی بحالی کو NVIDIA Dynamo میں پیش نظارہ کی صلاحیت کے طور پر بیان کیا۔ کمپنی کا کہنا ہے کہ ایل ایل ایم انجن کے عمل میں ناکامی کے بعد روایتی بحالی کے لیے ماڈل کے وزن کو ہائی بینڈوڈتھ میموری میں لوڈ کرنا، دانا کو مرتب کرنا، کلیدی قدر کیشے کا سائز بنانا، انجن کو ٹیون کرنا، اور CUDA گراف کو دوبارہ حاصل کرنا پڑتا ہے۔ اس کولڈ سٹارٹ ترتیب میں بڑے ماڈلز کے لیے منٹ لگ سکتے ہیں، جس سے باقی کارکنان ناکام کارکن کی ٹریفک کو جذب کرنے کے لیے چھوڑ دیتے ہیں۔
مجوزہ ڈیزائن ہر کارکن کے GPUs پر انجن کے دو عمل رکھتا ہے۔ ایک انجن درخواستوں کو پورا کرتا ہے جبکہ دوسرا آغاز مکمل کرتا ہے اور پھر غیر فعال حالت میں انتظار کرتا ہے۔ NVIDIA کی GPU میموری سروس، یا GMS، کسی بھی انجن کے عمل سے آزادانہ طور پر وزن کے لیے استعمال ہونے والی جسمانی میموری کی مالک ہے۔ انجن اسی جسمانی وزن والے صفحات کو اپنے CUDA ایڈریس اسپیس میں نقشہ بناتے ہیں، لہذا اسٹینڈ بائی کو HBM میں ماڈل وزن کی دوسری کاپی کی ضرورت نہیں ہوتی ہے۔ NVIDIA کا کہنا ہے کہ GMS فی GPU سائڈ کار ہے جو فزیکل پیجز مختص کرتا ہے اور ہینڈلز فراہم کرتا ہے۔ یہ بعد کے کرنل پڑھنے کے راستے میں نہیں بیٹھتا ہے۔
غیر فعال ہونے سے پہلے، شیڈو انجن اپنا CUDA سیاق و سباق قائم کرتا ہے، وزن کی نقشہ سازی درآمد کرتا ہے، NCCL اور NIXL کمیونیکیٹر بناتا ہے، CUDA گراف کیپچر کرتا ہے، اور وارم اپ انجام دیتا ہے۔ یہ پارکنگ کے دوران KV کیشے کو نہیں بناتا ہے۔ اگر فعال عمل ختم ہوجاتا ہے تو، آپریٹنگ سسٹم کے ذریعہ ایک مشترکہ POSIX فائل لاک جاری کیا جاتا ہے، جس سے شیڈو کو لاک حاصل کرنے، اس کے وزن کو دوبارہ ترتیب دینے، اس کی کیش کو مکمل کرنے، اور روٹر کے ساتھ رجسٹر کرنے کی اجازت ملتی ہے۔ NVIDIA کا کہنا ہے کہ ناکام انجن پھر پس منظر میں دوبارہ شروع ہوتا ہے اور اگلا سایہ بن جاتا ہے۔
NVIDIA نے دو کارکنوں کی GLM-5.2 تعیناتی میں جان بوجھ کر ایک کارکن کو ختم کر کے ڈیزائن کی پیمائش کی۔ سیٹ اپ میں کوانٹائزڈ NVFP4 وزن، NVIDIA B200 نوڈس، آٹھ کا ٹینسر متوازی، ایک 200,000 ٹوکن زیادہ سے زیادہ سیاق و سباق، ایک FP8 KV کیش، اور مصنوعی درخواستوں کا استعمال کیا گیا ہے جس میں 32,000 ان پٹ ٹوکنز اور 1,000 آؤٹ پٹ ٹوکن ہیں۔ درخواستیں 0.7 فی سیکنڈ کے حساب سے پہنچیں اور راؤنڈ رابن میں تقسیم کی گئیں۔ اس ٹیسٹ میں، دوسرے کارکن نے 7.3 سیکنڈ کے بعد شیڈو ریکوری کے ساتھ دوبارہ سروس شروع کی، اس کے مقابلے میں کولڈ ری اسٹارٹ کے لیے 283 سیکنڈ۔ NVIDIA نے پہلے ٹوکن کے لیے ناکامی کے بعد کا درمیانی وقت کم اور شیڈو کنفیگریشن میں فی صارف ڈی کوڈ کی زیادہ شرح کی اطلاع دی۔
ماخذ کی تفصیلات: developer.nvidia.com ↗
یہ کیوں اہمیت رکھتا ہے۔
یہ خصوصیت LLM کی تعیناتی میں ایک عملی کمزوری کو نشانہ بناتی ہے: ایک سافٹ ویئر کی ناکامی زندہ بچ جانے والے کارکنوں کو تمام ٹریفک لے جانے کے بعد چھوڑ سکتی ہے جب کہ متبادل عمل وزن کو دوبارہ لوڈ کرتا ہے اور اس کی عملدرآمد کی حالت کو دوبارہ بناتا ہے۔ تیزی سے بازیابی تاخیر سے ہونے والے اضافے اور سروس کی سطح کی رکاوٹوں کو کم کر سکتی ہے، حالانکہ NVIDIA کے نتائج ایک کمپنی کے زیر انتظام بینچ مارک سے آتے ہیں اور ہارڈ ویئر یا نوڈ کی ناکامیوں کا احاطہ نہیں کرتے ہیں۔
فوری قدر ناکامیوں کے اس طبقے کے لیے سروس کا تسلسل ہے جو بنیادی ہارڈ ویئر کو نقصان نہیں پہنچاتی ہے۔ NVIDIA خاص طور پر عمل کے کریشوں، قابل بازیافت CUDA کی خرابیوں، اور عارضی اجتماعی ناکامیوں کو ایسے معاملات کے طور پر بیان کرتا ہے جن میں نوڈ اور GPUs صحت مند رہ سکتے ہیں جبکہ عمل کی حالت ختم ہو جاتی ہے۔ کولڈ ری اسٹارٹ کے دوران، ایک زندہ بچ جانے والا کارکن اوور لوڈ ہو سکتا ہے۔ کمپنی کے ٹیسٹ میں ناکامی کے بعد کے درمیانی وقت کی اطلاع دی گئی ہے جو کہ بیس لائن میں 23,815 ملی سیکنڈز کے پہلے ٹوکن کے لیے ہے، اس کے مقابلے میں شیڈو ریکوری کے ساتھ 1,311 ملی سیکنڈز۔
نتیجہ میموری کے انتظام میں تبدیلی بھی ہے جس کے مضمرات کے ساتھ انفرنس سسٹم مہنگی GPU صلاحیت کو کس طرح استعمال کرتے ہیں۔ اسٹینڈ بائی انجن کو عام طور پر وزن کی ایک اور مکمل کاپی درکار ہوتی ہے، جس سے درخواست کی کارروائی کے لیے دستیاب میموری کو کم کیا جاتا ہے۔ NVIDIA کا کہنا ہے کہ GMS کنکرنٹ انجنوں کو ایک فزیکل کاپی شیئر کرنے دیتا ہے، جبکہ پارک کیا ہوا سایہ صرف اپنے سیاق و سباق، کیپچر شدہ گرافس، کمیونیکیٹر اور میپنگ کو برقرار رکھتا ہے۔ کمپنی اسے ثانوی انجن کے لیے صفر معمولی وزن کی لاگت کے طور پر بیان کرتی ہے، لیکن ماخذ تمام اضافی میموری، CPU، اسٹوریج، یا آرکیسٹریشن کے اخراجات کا مکمل حساب کتاب فراہم نہیں کرتا ہے۔
بینچ مارک تجویز کرتا ہے کہ دستیابی انجینئرنگ صارف کے تجربے کو مادی طور پر متاثر کر سکتی ہے یہاں تک کہ جب ماڈل خود تبدیل نہ ہوا ہو۔ NVIDIA نے رپورٹ کیا کہ 399 میں سے 201 بیس لائن درخواستیں انجیکشن کی غلطی کے بعد پہلی ٹوکن میں پانچ سیکنڈ سے تجاوز کر گئیں، اس کے مقابلے میں شیڈو آرم میں 398 درخواستوں میں سے ایک تھی۔ اس نے یہ بھی اطلاع دی ہے کہ 226 بیس لائن درخواستیں فی صارف 20 ٹوکن فی سیکنڈ سے نیچے آگئیں، اس کے مقابلے میں شیڈو آرم میں کوئی بھی نہیں۔ یہ اعداد و شمار NVIDIA کے بیان کردہ مصنوعی ٹیسٹ سے پیمائش ہیں، یہ آزاد ثبوت نہیں ہیں کہ ماڈلز، ٹریفک کے نمونوں، یا پیداواری ماحول میں یکساں بہتری آئے گی۔
دعوے کی اہم حدود ہیں۔ یہ خصوصیت ایک پیش نظارہ ہے اور انجن کے عمل کی ناکامیوں کو حل کرتی ہے، نہ کہ ہارڈ ویئر، نوڈ، یا ملٹی نوڈ کی ناکامی۔ وہ اب بھی معیاری ری شیڈولنگ کا استعمال کرتے ہیں۔ ترقی یافتہ سایہ ایک خالی KV کیش سے شروع ہوتا ہے، لہذا NVIDIA کا کہنا ہے کہ کٹ اوور کے بعد کے وقت سے پہلے ٹوکن میں تھوڑا سا اضافہ ہوا ہے۔ کمپنی پریفکس-کیشے انڈیکس اور کیش میموری دونوں کو منتقل کرنے پر کام کر رہی ہے، لیکن تکمیل کی کوئی تاریخ نہیں بتاتی۔ ماخذ قیمتوں کا تعین، عام دستیابی کا وقت، آزاد توثیق، یا بیان کردہ ترتیب سے باہر کام کے بوجھ کے نتائج کو بھی بیان نہیں کرتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
crm_get_transaction(id='4092').Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
NVIDIA کا کہنا ہے کہ یہ فیچر آنے والے مہینوں میں بتدریج شروع ہوگا۔ اہم ٹیسٹوں میں حقیقی کام کا بوجھ، وسیع تر بیک اینڈ سپورٹ، آپریشنل اوور ہیڈ، اور کیا مستقبل کے ورژنز پروموشن کے بعد دوبارہ تعمیر کرنے کے بجائے فیل اوور کے دوران KV-کیشے کی حالت کو محفوظ رکھ سکتے ہیں۔
NVIDIA کا کہنا ہے کہ شیڈو انجن کی بحالی آنے والے مہینوں میں بتدریج شروع ہو جائے گی، vLLM کے ساتھ بنیادی حمایت یافتہ بیک اینڈ کے طور پر۔ بلاگ کہتا ہے کہ vLLM، SGLang، اور TensorRT-LLM ہر ایک GMS کو اپنی مرضی کے مطابق CUDA- پلگ ایبل ایلوکیٹر کے ذریعے ویٹ میموری پول کے لیے مربوط کرتا ہے، لیکن دستاویزی بازیافت کی مثال vLLM کے ارد گرد بنائی گئی ہے۔ مستقبل کے ریلیز نوٹس میں یہ واضح ہونا چاہیے کہ کون سے بیک اینڈ مکمل ریکوری ورک فلو کو استعمال کر سکتے ہیں اور کن تعیناتی کے حالات میں۔
اگلا تکنیکی سنگ میل کیشے کا تسلسل ہے۔ آج، اسٹینڈ بائی بغیر کسی فزیکل بیکنگ کے KV-cache ایڈریس رینج کو محفوظ رکھتا ہے اور پروموشن کے بعد ہی کیش تخلیق کرتا ہے۔ اس سے پارکڈ فٹ پرنٹ کم ہو جاتا ہے، لیکن اس کا مطلب یہ بھی ہے کہ ترقی یافتہ انجن میں پہلے کی بات چیت اور سابقہ کیشے کی حالت کا فقدان ہے۔ اس حالت کو محفوظ رکھنے سے کٹ اوور کے بعد مختصر کارکردگی کے ٹکرانے کو مزید کم کیا جا سکتا ہے، جبکہ اضافی مطابقت پذیری اور میموری کے انتظام کے تقاضوں کو متعارف کرایا جا سکتا ہے جن کی ماخذ ابھی تک تفصیل نہیں دیتا ہے۔
آپریٹرز کو اپنے ناکامی کے طریقوں اور بنیادی ڈھانچے کے خلاف خصوصیت کا جائزہ لینے کی ضرورت ہوگی۔ بیان کردہ تعیناتی کے لیے Kubernetes 1.34 یا اس سے جدید تر، Dynamic Resource Allocation فعال، اور NVIDIA GPU DRA ڈرائیور کی ضرورت ہے۔ NVIDIA انجیکشن کی خرابی کا پتہ لگانے کے لیے 1.7 سیکنڈ اور اس کے ٹیسٹ میں شیڈو کو فروغ دینے کے لیے 5.6 سیکنڈ کا وقت بتاتا ہے، لیکن ان اوقات کا انحصار تحقیقات، راؤٹرز، ماڈل سائز، کلسٹر کنفیگریشن، اور ٹریفک پر ہو سکتا ہے۔ ماخذ غیر فعال انجن کو چلانے کے لیے وسائل کی تقابلی ضروریات فراہم نہیں کرتا ہے۔
آزاد جانچ کو یہ جانچنا چاہئے کہ آیا رپورٹ شدہ فوائد مختلف ماڈلز، سیاق و سباق کی لمبائی، درخواست کے مکس، آٹو اسکیلنگ رویے، اور ملٹی جی پی یو یا ملٹی نوڈ لے آؤٹس کے ساتھ برقرار رہتے ہیں۔ اسے یہ بھی پیمائش کرنا چاہئے کہ کتنی بار ناکامیوں کا صاف طور پر پتہ لگایا جاتا ہے، آیا جزوی خرابیوں کے دوران لاک پر مبنی ہینڈ آف قابل اعتماد رہتا ہے، اور دوبارہ شروع ہونے والا انجن کتنی جلدی شیڈو حالت میں دوبارہ داخل ہو سکتا ہے۔ جب تک ان سوالات کے جوابات نہیں مل جاتے، فیچر کو سوفٹ ویئر کی ناکامی کی بحالی کے لیے ایک امید افزا پیش نظارہ کے طور پر سمجھا جاتا ہے نہ کہ انفرنس کی بندش کے عمومی حل کے۔