کیا ہوا؟
NVIDIA نے میموری سے چلنے والے چیف آف اسٹاف ایجنٹ کے لیے ایک تکنیکی ڈیزائن شائع کیا جو NemoClaw کے ساتھ بنایا گیا تھا، جس میں سٹرکچرڈ مارک ڈاؤن میموری، ایک SQLite واجبی لیجر اور OpenShell رن ٹائم کنٹرولز کا استعمال کیا گیا تھا۔ کمپنی ایک ایجنٹی RAG بیس لائن کے خلاف بینچ مارک کے بہتر نتائج کی اطلاع دیتی ہے، جبکہ یہ نوٹ کرتے ہوئے کہ مثال ایجاد کردہ ڈیٹا اور آف لائن واک تھرو کا استعمال کرتی ہے۔
NVIDIA کا کہنا ہے کہ اس کی NemoClaw مثال میموری سے چلنے والا چیف آف اسٹاف ایجنٹ بناتی ہے جو لوگوں، پروجیکٹس، ترجیحات، اہداف اور بار بار چلنے والے کام کے نمونوں کا انسانی پڑھنے کے قابل "سیلف ماڈل" کو برقرار رکھتا ہے۔ میموری کو انڈیکسنگ، کراس ریفرینس، پرووینس اور نمو کی حدوں کے ساتھ سٹرکچرڈ مارک ڈاؤن پیجز میں محفوظ کیا جاتا ہے۔ ایک علیحدہ SQLite لیجر ذمہ داریوں، درجہ بندیوں، اصلاحات اور آڈٹ کے واقعات کو ریکارڈ کرتا ہے، ثبوت، علم اور فیصلے کے درمیان فرق کو محفوظ رکھتا ہے۔
اس نسخے میں باؤنڈڈ رینکنگ لاجک، ایک انٹینٹ گیٹ شامل ہے جو صارف کی بیان کردہ ترجیحات سے منسلک ذمہ داریوں کو ترجیح دیتا ہے، صرف اپنڈ کرنے کے لیے اصلاحی آڈٹ، شیڈول میموری مینٹیننس، مصنوعی پیغامات اور میموری پیجز، یونٹ ٹیسٹ اور آف لائن واک تھرو۔ NVIDIA کا کہنا ہے کہ نسخہ اوپن سورس ہے اور NemoClaw کے لیے قابل تعیناتی ہرمیس پروفائل کے طور پر پیک کیا گیا ہے۔ موجودہ مثال پیغامات بھیجتی ہے اور نہ ہی سورس سسٹم میں ترمیم کرتی ہے، اور اس کے نمونے کے لوگ، تنظیمیں، پروجیکٹس اور پیغامات ایجاد ہوتے ہیں۔
NVIDIA نے رپورٹ کیا ہے کہ، Nemotron 3 Ultra کا استعمال کرتے ہوئے، سیلف ماڈل کنفیگریشن 186 سوالات پر مجموعی طور پر 90.9% درستگی تک پہنچ گئی، اس کے مقابلے میں 82.8% ایک ایجنٹی بازیافت-بڑھا ہوا-جنریشن بیس لائن کے لیے۔ یہ مشکل سوالات، تبدیل شدہ حقائق سے باخبر رہنے، پوائنٹ ان ٹائم استدلال، ہستی کو واضح کرنے، ملٹی سورس ترکیب اور حوالہ کی کوریج پر بھی اعلیٰ اسکور کی اطلاع دیتا ہے۔ یہ مثال کے ذخیرے کے ایجنٹ میموری بینچ مارک کے نتائج ہیں، نہ کہ آزاد تشخیص۔
رن ٹائم کے وقت، NVIDIA کا کہنا ہے کہ NemoClaw OpenShell کے ساتھ ضم ہوتا ہے، جو ایجنٹ کو سینڈ باکس کرتا ہے اور فائل سسٹم، عمل اور نیٹ ورک تک رسائی کو کنٹرول کرتا ہے۔ منظم اندازے اور MCP کنکشن کے لیے اسناد سینڈ باکس سے باہر رہتی ہیں۔ ماخذ اس بات پر زور دیتا ہے کہ بازیافت شدہ مواد اور میموری ماڈل کے ان پٹ ہیں، قابل اعتماد سیکیورٹی پالیسی نہیں۔ قیمتوں کا تعین، عام دستیابی اور معاون لائیو کنیکٹرز کی وضاحت نہیں کی گئی ہے۔
ماخذ کی تفصیلات: developer.nvidia.com ↗
یہ کیوں اہمیت رکھتا ہے۔
یہ ڈیزائن ڈویلپرز کو ماخذ کے ثبوت، اخذ کردہ میموری، ایجنٹ کے فیصلوں اور مجاز کارروائیوں کو الگ کرنے کا ایک ٹھوس طریقہ پیش کرتا ہے- کام کی جگہ کے بدلتے ہوئے سیاق و سباق میں کام کرنے والے سسٹمز کے لیے ایک اہم امتیاز۔ NVIDIA کے رپورٹ کردہ بینچ مارک فوائد ممکنہ طور پر مفید ہیں، لیکن وہ کمپنی کے اپنے نمونے کی تشخیص سے آتے ہیں اور اس ذریعہ میں آزادانہ طور پر قائم نہیں کیے گئے ہیں۔
طویل عرصے سے کام کرنے والے ایجنٹوں کو یہ فرق کرنے کی ضرورت ہے کہ ذریعہ پیغام کیا کہتا ہے اس سے کہ نظام کیا مانتا ہے، اس نے کیا فیصلہ کیا ہے اور اسے کیا کرنے کی اجازت ہے۔ NVIDIA کا فن تعمیر ان حدود کو واضح بناتا ہے، جس سے شواہد کے ادخال، یادداشت کی بحالی، بازیافت اور حتمی فیصلہ سازی میں غلطیوں کی تشخیص آسان ہو سکتی ہے۔
اصلاحی کام کا فلو قابل ذکر ہے کیونکہ صارفین ذمہ داریوں کو منتقل یا نظر انداز کر سکتے ہیں، ان فیصلوں کو بعد میں چلنے کے دوران محفوظ رکھ سکتے ہیں اور نتیجے میں آنے والی ترجیحی پالیسی کا معائنہ یا ترمیم کر سکتے ہیں۔ یہ صارفین کو مکمل طور پر پوشیدہ ماڈل کی حالت پر انحصار کرنے کے بجائے ایک نظر آنے والی رائے کا راستہ فراہم کرتا ہے۔ یہ ان معاونین کے لیے عملی طور پر مفید ہو سکتا ہے جنہیں ہر فوری درخواست کو یکساں طور پر اہم سمجھے بغیر ترجیحات کو تبدیل کرنے کے لیے اپنانا چاہیے۔
رپورٹ کردہ فوائد بدلے ہوئے حقائق اور وقتی استدلال کے لیے سب سے مضبوط ہیں، اس قسم کے مسائل جن سے گفتگو کی عام تاریخ اور بازیافت خراب طریقے سے نمٹ سکتی ہے۔ تاہم، تشخیص ماخذ کے اپنے بینچ مارک اور مثال کے نفاذ تک محدود ہے۔ ایک میٹرک—کارپس کے ساتھ وفاداری—سیلف ماڈل کے لیے بیس لائن کی نسبت کم تھی، جو اس بات کی نشاندہی کرتی ہے کہ مجموعی درستگی میں بہتری تجارت کو ختم نہیں کرتی ہے۔
حفاظتی ماڈل کا عملی اثر بھی ہوتا ہے: میموری کسی عمل کی اجازت کے بغیر اطلاع دے سکتی ہے۔ اسناد کو سینڈ باکس سے باہر رکھنے اور رن ٹائم پر اجازتوں کو نافذ کرنے سے غلطی یا بدنیتی پر مبنی ہدایات کے اثرات کو محدود کیا جا سکتا ہے، لیکن ذریعہ انٹرپرائز کی براہ راست تعیناتی سے آزادانہ حفاظتی جانچ یا ثبوت فراہم نہیں کرتا ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
An agent must create a draft calendar event for Tuesday at 2 p.m. Which evidence would establish the requested result?
آگے کیا دیکھنا ہے۔
آیا یہ نسخہ کام کی جگہ کے حقیقی ڈیٹا، لائیو کنیکٹرز اور مختلف ماڈلز کے ساتھ اسی طرح کی کارکردگی کا مظاہرہ کرتی ہے، اور آف لائن مثال سے آگے بڑھتے ہوئے تنظیمیں اسناد، رازداری، برقرار رکھنے، حذف کرنے اور انسانی منظوری کو کیسے ہینڈل کرتی ہیں۔
اگلا بامعنی امتحان حقیقی کام کی جگہ کے کھاتوں اور لائیو کنیکٹرز کے ساتھ تعیناتی ہے۔ NVIDIA کا کہنا ہے کہ ان انضمام کے لیے اسناد، رازداری، برقرار رکھنے اور حذف کرنے کا الگ علاج درکار ہے، لیکن ماخذ مخصوص پالیسیوں، منظوری کے بہاؤ یا کنیکٹر کی دستیابی کی وضاحت نہیں کرتا ہے۔
آزادانہ جائزوں کو جانچنا چاہیے کہ آیا رپورٹ شدہ بہتری ماڈلز، ڈومینز، میموری سائزز اور بدلتی ہوئی معلومات میں برقرار رہتی ہے، جبکہ غلط ترجیحات، باسی یا غلط یادیں، حوالہ کی ناکامی اور طے شدہ دیکھ بھال کی لاگت کی پیمائش کرتے ہوئے۔
ڈویلپرز کو یہ بھی دیکھنا چاہئے کہ اوپن شیل پالیسیاں حقیقت پسندانہ فوری انجیکشن اور ٹول کے استعمال کے منظرناموں کے تحت کیسے برتاؤ کرتی ہیں۔ NVIDIA سینڈ باکس اور گورننس کی خصوصیات کو بیان کرتا ہے، لیکن یہ ذریعہ کسی بیرونی آڈٹ یا مخالفانہ تشخیص کے ذریعے ان کی تاثیر کو قائم نہیں کرتا ہے۔
قیمتوں کا تعین، مکمل اسٹیک کے لیے لائسنسنگ کی تفصیلات، پروڈکشن سپورٹ اور عام دستیابی پوسٹ میں درج نہیں ہے۔ وہ نامعلوم اس بات پر اثر انداز ہوں گے کہ آیا یہ نسخہ بنیادی طور پر تعلیمی حوالہ ہے یا انٹرپرائز کی تعیناتی کا عملی راستہ۔