کیا ہوا؟
Google DeepMind نے ایک پائلٹ کا اعلان کیا جسے وہ ملکیتی، فرنٹیئر کلاس AI ماڈل کی پہلی ڈبل بلائنڈ تشخیص کے طور پر بیان کرتا ہے۔ ٹرائل میں Gemini فلیش لائٹ ماڈل اور بیرونی جائزہ کاروں کے ذریعے فراہم کردہ خفیہ بینچ مارکس کا استعمال کیا گیا ہے۔
Google DeepMind نے 27 اگست کو کہا کہ وہ ایک ڈبل بلائنڈ تشخیص کو پائلٹ کر رہا ہے جس میں ایک خفیہ ماحول کے اندر بیرونی جانچ کی جاتی ہے۔ کمپنی نے اس منصوبے کو ملکیتی، فرنٹیئر کلاس AI ماڈل کی پہلی تشخیص کے طور پر بیان کیا۔ جس ماڈل کا تجربہ کیا جا رہا ہے وہ ایک Gemini Flash Lite ماڈل ہے، اور بینچ مارکس خفیہ ہیں۔
پائلٹ Google DeepMind، سنگاپور AI سیفٹی انسٹی ٹیوٹ، OpenMined، AVERI اور MLCcommons کو اکٹھا کرتا ہے۔ ذریعہ کا کہنا ہے کہ شرکاء رازداری کے تحفظ کے ماحول میں خفیہ معیارات کے خلاف ماڈل کی جانچ کریں گے۔ یہ معیار کے سوالات کی شناخت نہیں کرتا، ماڈل کے مخصوص ورژن کو ظاہر نہیں کرتا یا پائلٹ سے نتائج فراہم کرتا ہے۔
یہ نظام خفیہ جگہ استعمال کرتا ہے، جو Google کلاؤڈ کے خفیہ کمپیوٹنگ پورٹ فولیو کا حصہ ہے۔ Google کا کہنا ہے کہ ماحول خفیہ طور پر اس بات کی تصدیق کر سکتا ہے کہ بیرونی تشخیصی ڈیٹا اور ملکیتی ماڈل ان کے متعلقہ مالکان کے لیے نجی رہیں۔ بیان کردہ انتظام کے تحت، تشخیص کار Gemini ماڈل کے وزن کو نہیں دیکھ سکتے ہیں، جبکہ Google تشخیص کاروں کے ٹیسٹ کے اشارے نہیں دیکھ سکتے ہیں۔
بیان کردہ مسئلہ بینچ مارک آلودگی ہے: ایک ماڈل بہتر کارکردگی کا مظاہرہ کر سکتا ہے اگر اسے جانچ سے پہلے تشخیصی سوالات یا اشارے کا سامنا کرنا پڑا۔ Google کا کہنا ہے کہ موجودہ صفر لاگنگ کے طریقہ کار اور معاہدے کے تحفظات نے بیرونی اشارے کو خفیہ رکھنے میں مدد کی ہے، لیکن دلیل دی کہ تکنیکی اور خفیہ نگاری کے تحفظات یقین دہانی کی ایک اور تہہ کا اضافہ کرتے ہیں۔
اعلان قارئین کو طریقہ کار اور نتائج کے لیے ایک تکنیکی رپورٹ کی طرف اشارہ کرتا ہے۔ سورس ٹیکسٹ میں رپورٹ کے نتائج، ایک آزاد آڈٹ، کرپٹوگرافک تصدیقی پروٹوکول کی تفصیل اس کا اندازہ لگانے کے لیے کافی تفصیل سے، یا اس بات کا ثبوت شامل نہیں ہے کہ پائلٹ نے ماڈل کی کارکردگی یا تعیناتی کے فیصلے پہلے ہی تبدیل کر دیے ہیں۔
ماخذ کی تفصیلات: deepmind.google ↗
یہ کیوں اہمیت رکھتا ہے۔
اس نقطہ نظر کا مقصد بینچ مارک آلودگی کو کم کرنا ہے جبکہ آزاد تنظیموں کو ماڈل کا وزن حاصل کیے بغیر یا ماڈل فراہم کنندہ کو ان کے ٹیسٹ کے اشارے ظاہر کیے بغیر قابل AI سسٹمز کی جانچ کرنے کی اجازت دینا ہے۔
AI بینچ مارک سکور اکثر سسٹمز کا موازنہ کرنے اور صلاحیت اور حفاظت کے بارے میں فیصلوں کو مطلع کرنے کے لیے استعمال ہوتے ہیں۔ اگر کسی ماڈل یا اس کے ڈویلپر کو جانچ کے مواد تک پہلے سے ہی رسائی حاصل ہے، تو ایک اعلی اسکور جزوی طور پر جانچ سے واقفیت کی عکاسی کر سکتا ہے بجائے اس کے کہ ٹیسٹ کی پیمائش کرنا ہے۔ Google اس ساکھ کے مسئلے کو حل کرنے کے طریقے کے طور پر ڈبل بلائنڈ ٹیسٹنگ کو تیار کرتا ہے۔
مجوزہ انتظام بیرونی تشخیص میں ایک عملی تنازعہ کو نشانہ بناتا ہے۔ تاریخی طور پر، Google کے مطابق، تشخیص کاروں نے یا تو ماڈل فراہم کنندہ کے ساتھ اشارے شیئر کیے یا فراہم کنندہ سے ماڈل کے وزن کا اشتراک کرنے کو کہا۔ پہلا آپشن خفیہ سوالات کو بے نقاب کر سکتا ہے۔ دوسرا قیمتی دانشورانہ املاک کو بے نقاب کر سکتا ہے۔ پائلٹ کو تبادلے کی ضرورت سے بچنے کے لیے ڈیزائن کیا گیا ہے۔
پرائیویسی کے تحفظ کی تشخیص خاص طور پر سائبر سیکیورٹی یا سرکاری ایجنسیوں کے ٹیسٹوں کے لیے مفید ہو سکتی ہے، جہاں اشارے، منظرنامے اور ڈیٹا حساس ہو سکتے ہیں۔ ذریعہ کا کہنا ہے کہ نقطہ نظر ڈیٹا کی خودمختاری اور سلامتی کو برقرار رکھتے ہوئے آزاد جانچ کی حمایت کرسکتا ہے۔ یہ ایک بیان کردہ ممکنہ فائدہ ہے، نہ کہ اس پائلٹ کا ظاہر کردہ نتیجہ۔
وسیع تر اہمیت کا انحصار اس بات پر ہے کہ آیا کرپٹوگرافک شواہد اس بات کا تعین کر سکتے ہیں کہ تشخیصی ماحول کے اندر کیا ہوا اور کیا باہر کی جماعتیں اس ثبوت کا بامعنی انداز میں معائنہ یا توثیق کر سکتی ہیں۔ اشارے اور وزن کو پوشیدہ رکھنے سے کچھ خطرات کم ہو سکتے ہیں، لیکن یہ بذات خود یہ ظاہر نہیں کرتا ہے کہ ایک بینچ مارک اچھی طرح سے ڈیزائن کیا گیا ہے، کہ ماڈل کا جامع تجربہ کیا گیا ہے یا یہ کہ نتائج حقیقی دنیا کے استعمال کے لیے عام ہیں۔
اس لیے یہ اعلان نئے ماڈل کی صلاحیت کے بجائے تشخیص کے بنیادی ڈھانچے میں ترقی ہے۔ اس کی فوری عوامی قدر ہائی اسٹیک AI دعووں کی جانچ پڑتال کو آسان بنانے کے امکان میں ہے۔ اس کی حدود کافی ہیں: ذریعہ کوئی کارکردگی کے نتائج پیش نہیں کرتا ہے، روایتی تشخیص کے ساتھ کوئی موازنہ نہیں کرتا ہے اور ابھی تک اس بات کا کوئی ثبوت نہیں ہے کہ یہ طریقہ وسیع پیمانے پر قابل استعمال ہے۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
Which component of an AI application is the machine-learning model itself?
آگے کیا دیکھنا ہے۔
اہم حل نہ ہونے والے سوالات یہ ہیں کہ آیا پائلٹ بڑے پیمانے پر قابل اعتماد طریقے سے کام کرتا ہے، تصدیق کتنی آزاد ہے، تکنیکی رپورٹ کیا دکھائے گی، اور کیا دوسرے ماڈل کے ڈویلپرز تقابلی تحفظات اپناتے ہیں۔
تکنیکی رپورٹ میں تشخیصی پروٹوکول کو واضح کرنا چاہیے، بشمول ہر شریک کن معلومات کا مشاہدہ کر سکتا ہے، خفیہ ماحول کو کس طرح ترتیب دیا جاتا ہے اور جائزہ لینے والوں کے لیے کیا ثبوت پیش کیے جاتے ہیں۔ ان تفصیلات کے بغیر، یہ فیصلہ کرنا مشکل ہے کہ پائلٹ موجودہ رازداری کے معاہدوں اور لاگنگ کنٹرولز سے آگے کتنا اعتماد بڑھاتا ہے۔
ایک اہم سوال یہ ہے کہ آیا پائلٹ صرف ایک تنگ ماڈل اور بینچ مارک کے امتزاج کی جانچ کرتا ہے یا یہ طریقہ مختلف ماڈل آرکیٹیکچرز، تشخیص فراہم کرنے والوں اور حساس ڈیٹاسیٹس کو سپورٹ کر سکتا ہے۔ عملی اپنانے کا انحصار لاگت، کارکردگی، موجودہ ٹیسٹنگ ٹولز کے ساتھ مطابقت اور آزاد ماحول میں تشخیص کو دہرانے کی صلاحیت پر ہوگا۔
مبصرین کو بینچ مارک کے بارے میں بھی معلومات تلاش کرنی چاہئیں۔ ڈبل بلائنڈ طریقہ کار ٹیسٹ کے سوالات کی حفاظت میں مدد کر سکتے ہیں، لیکن وہ کمزور ٹاسک ڈیزائن، نامکمل کوریج، مبہم اسکورنگ یا بینچ مارک کی کارکردگی اور تعیناتی میں رویے کے درمیان مماثلت جیسے مسائل کو حل نہیں کر سکتے۔ ذرائع نے یہ نہیں بتایا کہ ان مسائل کو کیسے نمٹا جائے گا۔
شرکت کرنے والی تنظیموں کے کردار اور نگرانی کے انتظامات اہم ہوں گے۔ اعلان میں کئی شراکت داروں کے نام درج ہیں، لیکن اس کی وضاحت نہیں کی گئی ہے کہ تشخیص کو کون کنٹرول کرتا ہے، کون نتائج کو چیلنج کر سکتا ہے، آیا کوئی پارٹی آڈٹ شائع کرے گی یا سسٹم کے آپریشن سے متعلق تنازعات کو کیسے حل کیا جائے گا۔
آخر میں، صنعت کا ردعمل اس بات کی نشاندہی کرے گا کہ آیا یہ Google-مخصوص تجربہ رہتا ہے یا مشترکہ مشق بن جاتا ہے۔ ذرائع کا کہنا ہے کہ پائلٹ کا مقصد وسیع تر صنعت کو محفوظ اور زیادہ بھروسہ مند AI سسٹمز تیار کرنے میں مدد کرنا ہے، لیکن یہ دوسرے ماڈل ڈویلپرز، ریگولیٹرز یا آزاد ٹیسٹنگ باڈیز سے وعدوں کا اعلان نہیں کرتا ہے۔ ذریعہ اپنانے کے اس وسیع تر سوال کو کھلا چھوڑ دیتا ہے، لہذا صنعت کے کسی بھی وسیع اثر کا تعین کرنا باقی ہے۔