زبان AI گائیڈ

گہرائیوں کا مرکب

گہرائیوں کا مرکب (MoD) ایک ٹرانسفارمر کو مختلف ٹوکنز پر کمپیوٹ کی مختلف مقدار خرچ کرنے دیتا ہے، ہر پرت کی بھاری گنتی کے ذریعے صرف 'اہم' ٹوکن کو روٹ کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It cuts the cost of processing easy tokens while keeping a fixed, predictable compute budget.

گہرا غوطہ

معیاری ٹرانسفارمرز ہر پرت کو ہر ٹوکن پر لاگو کرتے ہیں، حتیٰ کہ اوقاف جیسے معمولی پر بھی۔ گہرائیوں کا مرکب، جو 2024 میں Google DeepMind کے ذریعے متعارف کرایا گیا، ہر بلاک پر ایک چھوٹا سا راؤٹر شامل کرتا ہے جو مکمل خود توجہ اور MLP حساب سے گزرنے کے لیے ٹوکن کے ایک مقررہ ٹاپ-k حصے کو منتخب کرتا ہے۔ باقی ایک بقایا کنکشن کے ذریعے بلاک کو چھوڑ دیں۔ چونکہ فی پرت صرف k ٹوکن پر کارروائی کی جاتی ہے، اس لیے کل کمپیوٹ (FLOPs) پہلے سے متحرک گہرائی کے طریقوں کے برعکس جو غیر متوقع طور پر مختلف ہوتے ہیں، کیپ اور پہلے سے معلوم ہوتا ہے۔ یہ بیچنگ اور ہارڈ ویئر کے استعمال کو موثر بناتا ہے۔ MoD کے تربیت یافتہ ماڈلز فی فارورڈ پاس میں کم FLOPs کا استعمال کرتے ہوئے بیس لائن ٹرانسفارمر کے معیار سے مماثل ہو سکتے ہیں، یا اسی کمپیوٹ میں اعلیٰ معیار تک پہنچ سکتے ہیں، اور یہ خیال قدرتی طور پر 'MoDE' ماڈلز کو گہرائی اور چوڑائی دونوں پر دینے کے لیے مکسچر آف ایکسپرٹس کے ساتھ تیار کرتا ہے۔

تکنیکی بصیرت

ہر MoD بلاک پر، ایک سیکھا ہوا لکیری راؤٹر ہر ٹوکن کو اسکور کرتا ہے اور اسکور کے لحاظ سے ٹاپ-k رکھتا ہے۔ منتخب ٹوکن توجہ اور MLP سے گزرتے ہیں، جب کہ غیر منتخب ٹوکن کو بقایا راستے کے ذریعے بغیر کسی تبدیلی کے آگے بڑھایا جاتا ہے۔ ایک فکسڈ ٹاپ-k (فی ٹوکن تھریشولڈ کے بجائے) کا استعمال کمپیوٹ گراف کو جامد اور ٹینسر کی شکلوں کو مستقل بناتا ہے، جو کہ ہارڈ ویئر کے موافق ہے۔ راؤٹر کو بقیہ نیٹ ورک کے ساتھ تربیت دی جاتی ہے، اور کازل جنریشن معاون پیش گوئوں کا استعمال کرتی ہے لہذا روٹنگ کے فیصلے مستقبل کے ٹوکنز پر نہیں جھانکتے ہیں۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

گہرائیوں کے مرکب کا مستقبل

ماڈل اسکیل کے طور پر کارکردگی کے لیے مشروط حساب ایک اہم لیور ہے، اور MoD ایک ابتدائی، صاف مثال ہے۔ مکسچر آف ایکسپرٹس کے ساتھ گہرے انضمام کی توقع کریں (گہرائی اور ماہرین دونوں پر روٹنگ)، انکولی بجٹ جو آسان ان پٹس کے لیے سکڑ جاتے ہیں، اور ایسے سیکھے ہوئے راؤٹرز جو بہتر طور پر شناخت کرتے ہیں کہ کون سے ٹوکن کو واقعی گہری پروسیسنگ کی ضرورت ہے۔ چونکہ تخمینہ لاگت تعیناتی معاشیات پر حاوی ہے، ایسی تکنیک جو ماڈلز کو صرف ضرورت کے مطابق 'سخت سوچنے' دیتی ہیں، پیشین گوئی کی تاخیر کو برقرار رکھتے ہوئے، بڑے پیمانے پر فن تعمیر میں معیاری بننے کا امکان ہے۔

حقیقی دنیا کا نفاذ

فلر ٹوکنز پر گہرے حساب کو چھوڑ کر طویل دستاویزات پر کارروائی کے لیے درکار FLOPs کو کم کرنا

ایسے ماڈل کو تربیت دینا جو کم کمپیوٹ پر بنیادی معیار سے میل کھاتا ہو، سرونگ لاگت کو کم کرتا ہو۔

پرت کی گہرائی اور ماہر کی پسند دونوں پر روٹ کرنے کے لیے مکسچر آف ایکسپرٹس (MoDE) کے ساتھ ملانا

پیشین گوئی کے مطابق، فی ٹوکن مقررہ تاخیر کو برقرار رکھنا کیونکہ فی پرت کمپیوٹ بجٹ پہلے سے طے ہوتا ہے۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Mixture of Depths quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Mixture of Depths?

گہرائیوں کا مرکب (MoD) ایک ٹرانسفارمر کو مختلف ٹوکنز پر کمپیوٹ کی مختلف مقدار خرچ کرنے دیتا ہے، ہر پرت کی بھاری گنتی کے ذریعے صرف 'اہم' ٹوکن کو روٹ کرتا ہے۔ یہ ایک مقررہ، متوقع کمپیوٹ بجٹ کو برقرار رکھتے ہوئے آسان ٹوکن پر کارروائی کرنے کی لاگت کو کم کرتا ہے۔

ٹوکن میں گہرائیوں کا مرکب کیا مختلف ہوتا ہے؟

MoD ہر پرت کی بھاری گنتی کے ذریعے صرف کچھ ٹوکن روٹ کرتا ہے، لہذا مختلف ٹوکن مؤثر طریقے سے مختلف گہرائی حاصل کرتے ہیں۔

MoD اپنے کمپیوٹ بجٹ کو کس طرح قابل قیاس رکھتا ہے؟

فی بلاک ٹوکن کے ایک مقررہ ٹاپ-k کا انتخاب FLOPs اور ٹینسر کی شکلوں کو مستقل رکھتا ہے، جو ہارڈ ویئر کے موافق ہے۔

ان ٹوکنز کا کیا ہوتا ہے جنہیں راؤٹر دیئے گئے بلاک پر منتخب نہیں کرتا؟

غیر منتخب شدہ ٹوکن بلاک کی گنتی کو نظرانداز کرتے ہیں اور بقایا راستے سے بغیر کسی تبدیلی کے آگے بڑھ جاتے ہیں۔

گہرائیوں کا مرکب کس نے متعارف کرایا؟

گہرائیوں کا مرکب Google ڈیپ مائنڈ نے ڈائنامک ٹرانسفارمر کمپیوٹ پر 2024 کے پیپر میں متعارف کرایا تھا۔

ایم او ڈی کو مکسچر آف ایکسپرٹس کے ساتھ ملانے سے کیا پیدا ہوتا ہے؟

ماہر روٹنگ کے ساتھ گہرائی کی روٹنگ کو ملانے سے 'MoDE' ماڈل حاصل ہوتے ہیں جو کہ پرتوں اور ماہرین دونوں پر حساب کرتے ہیں۔