بنیادی اصول گائیڈ

چنچیلا کمپیوٹ - بہترین تربیت

چنچیلا 2022 کا ڈیپ مائنڈ ہے جس میں معلوم ہوتا ہے کہ زیادہ تر بڑی زبان کے ماڈلز بری طرح سے زیر تربیت تھے: ایک مقررہ کمپیوٹ بجٹ کے لیے آپ کو پیرامیٹر اور ڈیٹا کو تقریباً یکساں طور پر پیمانہ کرنا چاہیے، نہ کہ صرف ایک بڑا ماڈل بنانا چاہیے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It reshaped how the industry balances model size against training data.

گہرا غوطہ

ڈیپ مائنڈ کے چنچیلا پیپر نے سکیلنگ پر نظرثانی کی اور 400 سے زیادہ ماڈلز کو کمپیوٹ کے بہترین توازن کو تلاش کرنے کے لیے تربیت دی۔ انگوٹھے کی سرخی کا اصول: ماڈل سائز اور ٹریننگ ٹوکنز کو لاک سٹیپ میں بڑھنا چاہیے، تقریباً 20 ٹریننگ ٹوکن فی پیرامیٹر۔ اس کو ثابت کرنے کے لیے، انہوں نے 1.4 ٹریلین ٹوکنز پر ایک 70-بلین پیرامیٹر ماڈل، چنچیلا کو تربیت دی، اسی کمپیوٹ کا استعمال کرتے ہوئے 280-بلین پیرامیٹر گوفر نے بہت کم ٹوکنز پر تربیت دی تھی۔ چنچیلا، چار گنا چھوٹا ہونے کے باوجود، گوفر، GPT-3، اور دیگر جنات کو تقریباً ہر بینچ مارک پر پیچھے چھوڑ دیا۔ اس سبق نے پہلے کے OpenAI نتیجہ کو پلٹ دیا جس میں اعداد و شمار کے مقابلے میں سائز کو ترجیح دی گئی تھی، جس میں دکھایا گیا تھا کہ بہت سے فلیگ شپ ماڈلز بہت بڑے اور بہت زیادہ ڈیٹا سے محروم ہونے کی وجہ سے کارکردگی کو میز پر چھوڑ رہے ہیں۔

تکنیکی بصیرت

چنچیلا فٹ نقصان L(N,D) = E + A·N^(-α) + B·D^(-β) کے ساتھ، α اور β دونوں 0.34 کے قریب ہیں، یعنی پیرامیٹرز اور ڈیٹا تقریباً ہم آہنگی سے حصہ لیتے ہیں۔ ایک مقررہ کمپیوٹ رکاوٹ (ٹرانسفارمرز کے لیے کمپیوٹ ≈ 6·N·D) کے تحت اسے بہتر بنانے سے مساوی پیمانے کا نتیجہ برآمد ہوتا ہے۔ ایک چھوٹا، ڈیٹا سے بھرپور ماڈل تخمینہ پر چلانے کے لیے بھی سستا ہے، اس لیے اس کا فائدہ صرف تربیت ہی نہیں، تعیناتی میں بھی ہے۔

اسٹریٹجک اثر

واضح فیصلے

یہ آپ کو مارکیٹنگ کی زبان سے واضح تکنیکی دعووں کو الگ کرنے میں مدد کرتا ہے۔

لاگت اور بجٹ

آپ پیسہ یا وقت خرچ کرنے سے پہلے بہتر نفاذ کے سوالات پوچھ سکتے ہیں۔

Team and workflow

مشترکہ تفہیم کے ساتھ ٹیمیں بہتر پروڈکٹ، پالیسی اور سیکھنے کے فیصلے کرتی ہیں۔

چنچیلا کمپیوٹ کا مستقبل - بہترین تربیت

لاما 3 جیسے جدید ماڈلز جان بوجھ کر چنچیلا کے 20 ٹوکن فی پیرامیٹر تناسب کو آگے بڑھاتے ہیں، چھوٹے ماڈلز کو ٹریلین ٹوکنز پر تربیت دیتے ہیں تاکہ تخمینہ کو سستا بنایا جا سکے، ذیلی بہترین تربیتی کمپیوٹ کو قبول کیا جا سکے۔ جیسے جیسے اچھے ڈیٹا کی کمی ہو رہی ہے، بار بار آنے والے دور، مصنوعی ڈیٹا، اور کوالٹی فلٹرنگ میں دلچسپی بڑھ رہی ہے۔ چنچیلا حوالہ نقطہ بنی ہوئی ہے، لیکن زیادہ سے زیادہ تیزی سے زندگی بھر کے تخمینہ لاگت پر منحصر ہے، نہ کہ صرف ایک بار کے تربیتی بجٹ پر۔

حقیقی دنیا کا نفاذ

اسی بجٹ کے لیے بہت کم ڈیٹا پر 30-بلین ماڈل کے بجائے 2 ٹریلین ٹوکنز پر 7-بلین پیرامیٹر ماڈل کو تربیت دینے کا انتخاب۔

اندازہ لگانا کہ 10-بلین پیرامیٹر ماڈل کمپیوٹ کے بہترین میٹھے مقام کو حاصل کرنے کے لیے تقریباً 200 بلین ٹوکنز چاہتا ہے۔

بڑے حریف کے معیار سے مماثل ہوتے ہوئے فی استفسار تخمینہ لاگت کو کم کرنے کے لیے ایک چھوٹے تعینات ماڈل کا جواز پیش کرنا۔

ایک موجودہ ماڈل کا آڈٹ کرنا اور یہ نتیجہ اخذ کرنا کہ اسے زیر تربیت کیا گیا تھا، پھر پیرامیٹر میں اضافے کے بجائے طویل ٹریننگ چلانے کی منصوبہ بندی کریں۔

خطرات اور گارڈریلز

مختلف ٹیمیں ایک ہی اصطلاح کو مختلف طریقے سے استعمال کر سکتی ہیں، اس لیے دائرہ کار کی جلد وضاحت کریں۔

بینچ مارکس مضبوط نظر آسکتے ہیں جبکہ حقیقی دنیا کی کارکردگی ناہموار ہے۔

ڈیٹا کے معیار اور تشخیص کے منصوبوں کو نظر انداز کرنا اکثر نازک نتائج پیدا کرتا ہے۔

نفاذ کا روڈ میپ

1

آپ کو مطلوبہ نتائج کی سادہ زبان کی تعریف کے ساتھ شروع کریں۔

2

جانچ کرنے سے پہلے ایک کامیابی میٹرک اور ایک ناکامی کی شرط منتخب کریں۔

3

نمائندہ ڈیٹا کے ساتھ ایک چھوٹا پائلٹ چلائیں، نہ کہ پالش شدہ ڈیمو سیٹ۔

4

دستاویز جہاں Chinchilla Compute-Optimal Training مدد کرتی ہے اور جہاں آسان طریقے بہتر ہیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Chinchilla Compute-Optimal Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Chinchilla Compute-Optimal Training?

چنچیلا 2022 کا ڈیپ مائنڈ ہے جس میں معلوم ہوتا ہے کہ زیادہ تر بڑی زبان کے ماڈلز بری طرح سے زیر تربیت تھے: ایک مقررہ کمپیوٹ بجٹ کے لیے آپ کو پیرامیٹر اور ڈیٹا کو تقریباً یکساں طور پر پیمانہ کرنا چاہیے، نہ کہ صرف ایک بڑا ماڈل بنانا چاہیے۔ اس نے نئی شکل دی کہ کس طرح انڈسٹری ٹریننگ ڈیٹا کے خلاف ماڈل سائز کو متوازن کرتی ہے۔

کمپیوٹ کی بہترین تربیت کے لیے چنچیلا کا انگوٹھے کا مشہور اصول کیا ہے؟

ڈیپ مائنڈ نے پائے گئے پیرامیٹرز اور ٹوکنز کو ایک دیے گئے کمپیوٹ بجٹ کے لیے تقریباً 20 ٹوکن فی پیرامیٹر کے حساب سے پیمانہ ہونا چاہیے۔

70B-پیرامیٹر چنچیلا کا 280B-پیرامیٹر گوفر سے موازنہ کیسے ہوا؟

اسی کمپیوٹ کے ساتھ کہیں زیادہ ٹوکنز پر تربیت یافتہ، چنچیلا نے زیادہ تر بینچ مارکس میں بہت بڑے گوفر کو شکست دی۔

چنچیلا پیپر نے پہلے کے بڑے ماڈلز کے بارے میں کیا اہم مسئلہ ظاہر کیا؟

GPT-3 اور گوفر جیسے ماڈلز ان کے تربیتی ڈیٹا کے لحاظ سے بہت بڑے تھے، جس کی وجہ سے کارکردگی کا اندازہ نہیں ہوا۔

چنچیلا اصول 10 بلین پیرامیٹر ماڈل کے لیے تقریباً کتنے ٹوکن تجویز کرتا ہے؟

20 ٹوکن فی پیرامیٹر پر، 10 بلین پیرامیٹرز کا مطلب تقریباً 200 بلین ٹریننگ ٹوکنز ہیں۔

تربیت کی کارکردگی کے علاوہ، ایک چھوٹا، ڈیٹا سے بھرپور ماڈل تعیناتی میں پرکشش کیوں ہے؟

کم پیرامیٹرز کا مطلب ہے کم فی استفسار کمپیوٹ، لہذا جب بھی ماڈل استعمال کیا جائے تو بچت کا مرکب۔