کیا ہوا؟
اینریک باربا روک اور لوئس کروز کے ذریعہ arXiv (2608.14550) پر پوسٹ کیا گیا ایک پری پرنٹ ایک سابقہ مطالعہ کو نقل کرنے کی کوشش کرتا ہے جس میں یہ اندازہ لگانے کے لیے ایک "α-FLOPs" فارمولہ تجویز کیا گیا تھا کہ فلوٹنگ پوائنٹ آپریشن کی گنتی عمل درآمد کے وقت میں کیسے ترجمہ کرتی ہے۔ نقل اصل کے بنیادی تجرباتی دعوے کی تائید کرتی ہے — کہ خام FLOPs رن ٹائم کے لیے ایک ناقص پراکسی ہیں، کیونکہ مقامی جہتیں کرنل کے طول و عرض سے زیادہ آسانی سے متوازی ہو جاتی ہیں — لیکن نئے، زیادہ طاقتور ہارڈ ویئر پر خود فارمولے کے منفی نتائج کی اطلاع دیتی ہے۔ مصنفین یہ بھی کہتے ہیں کہ اصل مطالعہ کی نقل تیار کرنے والے مواد نامکمل تھے، اور وہ اپنا پیکج شائع کرتے ہیں۔
اینریک باربا روک اور لوئس کروز کی طرف سے 2608.14550 کے طور پر arXiv پر درج ایک پری پرنٹ، پہلے سے شائع شدہ "α-FLOPs" تخمینہ فارمولے کے پیچھے تجربات کو نقل کرنے کے لیے تیار ہے۔ فہرست سازی آرٹیفیشل انٹیلی جنس (cs.AI) کے تحت کام کو کارکردگی (cs.PF) کے لیے کراس لسٹنگ کے ساتھ درجہ بندی کرتی ہے، اور 30 اپریل 2026 کو جمع کرایا گیا ایک واحد ورژن دکھاتی ہے۔ بیان کردہ ہدف تنگ ہے: چیک کریں کہ آیا اصل مطالعہ کے نتائج اب بھی نئے، زیادہ طاقتور ہارڈ ویئر پر موجود ہیں جس پر اس کا تجربہ کیا گیا تھا۔
مشین لرننگ انجینئرنگ میں جس مسئلہ کو اصل کام نے حل کیا ہے وہ واقف ہے۔ فلوٹنگ پوائنٹ آپریشنز، یا FLOPs، یہ رپورٹ کرنے کا روایتی طریقہ ہیں کہ ایک ماڈل یا پرت کو کتنی کمپیوٹیشن کی ضرورت ہے۔ لیکن جیسا کہ خلاصہ یہ بتاتا ہے، FLOPs اور عمل درآمد کے وقت کے درمیان تعلق "سیدھا نہیں ہے،" کیونکہ یکساں FLOP شماروں والی دو تہوں میں مختلف وقت لگ سکتا ہے — کچھ آپریشنز دوسروں کے مقابلے جدید ایکسلریٹر پر زیادہ آسانی سے متوازی ہوتے ہیں۔ α-FLOPs فارمولہ ایک تصحیح کے طور پر تجویز کیا گیا تھا جو نقشہ FLOP کو حقیقی کام کے قریب کسی چیز پر شمار کرتا ہے۔
مرکزی دعوے پر، نقل متفق ہے۔ مصنفین رپورٹ کرتے ہیں کہ ان کے نتائج "اس مقالے کی توثیق کرتے ہیں کہ صرف خام FLOPs عمل درآمد کے وقت کے لیے ایک مناسب میٹرک نہیں ہیں،" اور یہ کہ اصل مطالعہ میں شناخت کردہ طریقہ کار اب بھی لاگو ہوتا ہے: مقامی جہتیں دانا کے طول و عرض سے زیادہ آسانی سے متوازی رہتی ہیں۔ پہلے کی تلاش کا وہ حصہ نئے ہارڈ ویئر میں منتقل ہونے سے بچ جاتا ہے۔
اصلاحی فارمولے کا بھی فائدہ نہیں ہے۔ خلاصہ کے مطابق، عمدہ پیمائش سے پتہ چلتا ہے کہ FLOPs سے وقتی تعلق "پہلے دکھائے گئے مقابلے میں بہت کم سیدھا" ہے، جس میں نئے ہارڈ ویئر کے ساتھ عدم استحکام اور تعطل ظاہر ہوتا ہے - جس کو چھلانگ اور دوغلے کے طور پر بیان کیا جاتا ہے - عمل کے وقت میں۔ α-FLOPs فارمولہ، مصنفین لکھتے ہیں، عام طور پر ان کو کم سمجھتا ہے۔ ان کا خلاصہ: کام اصل کے تجرباتی نتائج کی توثیق کرتا ہے لیکن تخمینہ کے فارمولے کے منفی نتائج کی اطلاع دیتا ہے۔
دوسری تلاش طبیعیات کے بجائے عمل سے متعلق ہے۔ نقل کے دوران، مصنفین کا کہنا ہے کہ انہوں نے اصل مطالعہ فراہم کردہ مواد میں حدود کی نشاندہی کی، بشمول مخصوص انحصار کی تفصیلات اور رجعت کے اعداد و شمار کے بارے میں شفافیت کی کمی۔ وہ دلیل دیتے ہیں کہ ہارڈ ویئر پر منحصر کارکردگی کی تشخیص پر تحقیق کو مکمل اور درست نقل کے پیکجوں کی شدید ضرورت ہے، اور کہتے ہیں کہ وہ اپنے نفاذ کے لیے ایک مکمل پیکج فراہم کرتے ہیں۔ خلاصہ یہ نہیں بتاتا ہے: کن چپس یا وینڈرز کی جانچ کی گئی، کن پرتوں یا ماڈلز کی پیمائش کی گئی، کتنی بڑی کمی ہے، یا پیکیج کہاں ہوسٹ کیا گیا ہے۔ فہرست ہم مرتبہ کے جائزے کا کوئی اشارہ نہیں دیتی ہے۔ پوسٹ کرنے سے پہلے arXiv پری پرنٹس کا حوالہ نہیں دیا جاتا ہے۔
یہ کیوں اہمیت رکھتا ہے۔
FLOPs ریسرچ پیپرز، ماڈل کارڈز، کارکردگی کے دعووں اور ماحولیاتی اثرات کے تخمینے میں کمپیوٹیشنل لاگت کے لیے پہلے سے طے شدہ شارٹ ہینڈ ہیں۔ اگر FLOPs سے حقیقی عمل آوری کے وقت تک کی نقشہ سازی نہ صرف غلط ہے بلکہ غیر مستحکم ہے - اس وقفے کے ساتھ جس کا ایک شائع شدہ اصلاحی فارمولہ کم اندازہ لگاتا ہے - تو صرف FLOP شماروں پر بنایا گیا کارکردگی کا موازنہ سسٹم کو غلط درجہ دے سکتا ہے۔ کاغذ میدان میں ایک عملی مسئلہ کو بھی دستاویز کرتا ہے: ہارڈ ویئر پر منحصر نتائج کی جانچ کرنا مشکل ہے جب نقل پیکجز انحصاری ورژن اور رپورٹ شدہ رجعت کے پیچھے ڈیٹا کو چھوڑ دیتے ہیں۔
FLOPs کمپیوٹیشنل لاگت کے لیے فیلڈ کی مشترکہ کرنسی کے طور پر کام کرتے ہیں۔ وہ فن تعمیر کا موازنہ کرنے والے کاغذات میں، نئے ماڈلز کے بارے میں کارکردگی کے دعووں میں، اور توانائی کے استعمال اور کاربن فوٹ پرنٹ کے لفافے کے پچھلے تخمینے میں ظاہر ہوتے ہیں۔ اپیل یہ ہے کہ ان کا شمار تجزیاتی طور پر کیا جائے، بغیر کچھ چلائے۔ یہ کاغذ ایک یاددہانی ہے — اور، اس کے اپنے اکاؤنٹ پر، براہ راست ثبوت — کہ جس مقدار کو شمار کیا جا رہا ہے وہ وہ مقدار نہیں ہے جس کی لوگ عام طور پر پرواہ کرتے ہیں، جو کہ حقیقی ہارڈ ویئر پر خرچ ہونے والا وقت، توانائی اور پیسہ ہے۔
عملی نتیجہ کسی بھی شخص پر پڑتا ہے جو کاغذ پر ڈیزائن کے درمیان انتخاب کرتا ہے۔ اگر کم FLOPs کے ساتھ ایک پرت کی ترتیب بہر حال سست ہو سکتی ہے، تو ہو سکتا ہے کہ FLOP کو کم کرنے والے ڈیزائن کے فیصلے متوقع رفتار فراہم نہ کر سکیں، اور FLOP شماروں سے اخذ کردہ کارکردگی کی درجہ بندی ایک حقیقی ایکسلریٹر کے ساتھ رابطے میں نہیں رہ سکتی ہے۔ اس خلا کو ختم کرنے کے لیے α-FLOPs فارمولہ موجود تھا۔ نقل کا پتہ لگانا کہ یہ نئے ہارڈ ویئر پر رن ٹائم کو منظم طریقے سے کم سمجھتا ہے اس کا مطلب ہے کہ فرق کم از کم ہے، اس طریقہ سے بند نہیں ہوا ہے۔ اس سے عملی طور پر کتنی غلطی ہوتی ہے اس کا خلاصہ میں اندازہ نہیں لگایا گیا ہے، اور قارئین کو یہ خیال نہیں کرنا چاہیے کہ تضادات ہر معاملے میں بڑے ہیں۔
اطلاع دی گئی عدم استحکام اوسط غلطی سے زیادہ اہمیت رکھتا ہے۔ عمل درآمد کے وقت میں چھلانگیں اور دوغلے یہ بتاتے ہیں کہ تعلق ایک ہموار وکر نہیں ہے جسے ایک ہی فٹ شدہ فارمولہ ٹریک کر سکتا ہے - یہ اس حد پر منحصر ہو سکتا ہے کہ ہارڈ ویئر پر کام کیسے طے ہوتا ہے۔ مستقل تعصب کے مقابلے میں اسے درست کرنا مشکل ہے۔ خلاصہ کسی خاص وجہ سے تعطل کو منسوب نہیں کرتا ہے، اور خلاصہ کے طور پر کاغذ ان کی وضاحت کرنے کا دعوی نہیں کرتا ہے۔
واضح طور پر بیان کرنے کے قابل ایک پالیسی ملحقہ ہے، کیونکہ اسے بڑھانا آسان ہے۔ متعدد دائرہ اختیار میں ریگولیٹرز نے یہ فیصلہ کرنے کے لیے کہ کون سے ماڈلز کو اضافی ذمہ داریوں کا سامنا کرنا پڑتا ہے، FLOPs میں بیان کردہ ٹریننگ کمپیوٹ کی حد استعمال کی ہے۔ یہ یہاں پڑھے گئے میٹرک سے مختلف استعمال ہے: یہ مقالہ پرتوں کے عمل آوری کے وقت کی پیش گوئی سے متعلق ہے، قانونی درجہ بندی کے لیے کل تربیتی کمپیوٹ کی پیمائش نہیں کرتا۔ یہ جانچ نہیں کرتا، اور نہ ہی اس بارے میں کچھ دعویٰ کرتا ہے کہ آیا اس طرح کی حدیں اچھی طرح سے کیلیبریٹ کی گئی ہیں۔ یہ جس چیز کی حمایت کرتا ہے وہ زیادہ عام نقطہ ہے کہ FLOPs اور حقیقی وسائل کی کھپت ڈھیلے طریقے سے جوڑے جاتے ہیں۔
آخر میں، نقلی مواد کی تلاش ایک پائیدار مسئلہ سے بات کرتی ہے۔ ایسے نتائج جو مخصوص ہارڈ ویئر اور سافٹ ویئر ورژن پر منحصر ہوتے ہیں ان کی مختصر شیلف لائف ہوتی ہے، اور ان کی دوبارہ جانچ صرف اس صورت میں کی جا سکتی ہے جب اصل نمونے انحصار کی وضاحت کریں اور بنیادی ڈیٹا کو بے نقاب کریں۔ یہ کاغذ خود فیلڈ کی جانچ پڑتال کی ایک مثال ہے، اور اس کی جانچ اس سے کہیں زیادہ مشکل ہے جو اسے ہونی چاہیے تھی۔
انٹرایکٹو میکانزم: یہ اصل میں کیسے کام کرتا ہے۔
اس ترقی کے پیچھے بنیادی ٹیکنالوجی کو انٹرایکٹو طریقے سے دریافت کریں۔
In AI training, what is an "epoch"?
آگے کیا دیکھنا ہے۔
آیا مصنفین کے نقلی پیکج کو اٹھایا گیا ہے اور ناپے گئے عدم استحکام دوسرے چپس اور سافٹ ویئر کے ڈھیروں میں دوبارہ پیدا ہوتے ہیں؛ کیا کوئی چھلانگ اور دوغلوں کی وجہ کی نشاندہی کرتا ہے، جس کی یہ خلاصہ تشخیص نہیں کرتا ہے۔ چاہے اصل مطالعہ کے مصنفین جواب دیں؛ اور آیا پری پرنٹ ہم مرتبہ کے جائزے کو صاف کرتا ہے۔ یہ بھی دیکھیں کہ کیا کارکردگی کی رپورٹنگ کے اصول FLOPs کے ساتھ ساتھ ناپے ہوئے وقت اور توانائی کی طرف بڑھتے ہیں، اور آیا پرت کی سطح کے نتائج پورے ماڈل پیمانے پر ہوتے ہیں۔
دیکھنے کے لیے سب سے فوری چیز وہ نقلی پیکج ہے جو مصنفین کا کہنا ہے کہ وہ فراہم کرتے ہیں۔ اس کی افادیت ان تفصیلات پر منحصر ہے جو خلاصہ نہیں دیتا ہے: چاہے یہ سافٹ ویئر ورژن کو پن کرے، خام ٹائمنگ کی پیمائشیں، اور استعمال شدہ ہارڈ ویئر کے نام شامل ہوں۔ اگر ایسا ہوتا ہے تو، دوسرے محققین جانچ کر سکتے ہیں کہ آیا رپورٹ شدہ چھلانگیں اور دوغلے مختلف ایکسلریٹروں، ڈرائیور ورژنز اور کرنل لائبریریوں پر ظاہر ہوتے ہیں، یا آیا وہ ایک سیٹ اپ کے لیے مخصوص ہیں۔
دوسرا کھلا سوال تشخیص ہے۔ خلاصہ عدم استحکام کی اطلاع دیتا ہے لیکن ان کی وضاحت نہیں کرتا ہے۔ پرفارمنس انجینئرنگ لٹریچر میں قابل فہم وضاحتیں موجود ہیں - کام کو کس طرح ٹائل کیا جاتا ہے، جو لائبریری مخصوص شکلوں پر منتخب کرتی ہے، سائز کی حدود میں میموری کا برتاؤ - لیکن یہ کاغذ ان کے درمیان فیصلہ نہیں کرتا، اور کسی کو بھی اس سے منسوب نہیں کیا جانا چاہئے۔ فالو اپ کام پر نظر رکھیں جو طریقہ کار کی نشاندہی کرتا ہے، کیونکہ اصلاحی فارمولہ اتنا ہی اچھا ہے جتنا کہ اس کے پیچھے ہارڈ ویئر کے رویے کا ماڈل ہے۔
اس کے بعد اصل مطالعہ کے مصنفین کا جواب ہے، اور خود اس پری پرنٹ کی حیثیت۔ نقلیں جو شائع شدہ طریقہ پر منفی نتائج کی اطلاع دیتی ہیں اکثر دائرہ کار کے بارے میں فوری وضاحت کرتی ہیں: فارمولے کے حامی یہ استدلال کر سکتے ہیں کہ اسے ہارڈ ویئر جنریشن یا آپریٹنگ نظام کے لیے کیلیبریٹ کیا گیا تھا جو اب لاگو نہیں ہوتا ہے۔ ہم مرتبہ جائزہ، اگر کاغذ اس سے گزرتا ہے، تو یہ بھی تیز ہو سکتا ہے کہ "عام طور پر کم اندازہ" کا کیا مطلب مقداری طور پر ہوتا ہے۔
مزید وسیع طور پر، دیکھیں کہ کیا کارکردگی رپورٹنگ کے اصول بدلتے ہیں۔ اگر FLOPs پر مبنی تخمینہ موجودہ ہارڈ ویئر پر رن ٹائم کے لیے ناقابل اعتبار ثابت ہوتا ہے، تو عملی متبادل دیوار گھڑی کے وقت کی پیمائش اور نامزد ہارڈ ویئر پر توانائی کی پیمائش کی جاتی ہے - زیادہ معلوماتی، لیکن لیبز میں موازنہ کرنا مشکل اور پیدا کرنا زیادہ مہنگا ہے۔ کانفرنس کے نمونے کی تشخیص کے پروگرام ایک ایسی جگہ ہیں جہاں ہارڈ ویئر پر منحصر کارکردگی کے دعووں کی ضروریات کو سخت کرنا پہلے ظاہر ہوگا۔
آخر میں، گنجائش. بیان کردہ کام باریک اور تہہ دار ہے۔ آیا یہ اثرات جمع ہوتے ہیں، منسوخ ہوتے ہیں، یا مکمل ماڈل یا مکمل ٹریننگ کے پیمانے پر دیگر رکاوٹوں سے متاثر ہوتے ہیں، اس پر خلاصہ میں توجہ نہیں دی گئی ہے، اور یہ سوال ہے جو اس بات کا تعین کرے گا کہ تلاش کسی کے عمل میں کتنی تبدیلی لاتی ہے۔