زبان AI گائیڈ

قیاس آرائی پر مبنی ڈیکوڈنگ ڈرافٹ ماڈلز

قیاس آرائی پر مبنی ضابطہ کشائی میں آنے والے کئی ٹوکنز کا اندازہ لگانے کے لیے ایک چھوٹا، تیز 'ڈرافٹ' ماڈل استعمال کیا جاتا ہے جس کے بعد ایک بڑا ماڈل ایک پاس میں تصدیق کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It speeds up text generation 2-3x with no change to the output.

گہرا غوطہ

بڑے لینگویج ماڈلز ایک وقت میں ٹیکسٹ ایک ٹوکن تیار کرتے ہیں، اور ہر قدم کے لیے اربوں پیرامیٹرز سے گزرنے کی ضرورت ہوتی ہے — آہستہ اور میموری کے ساتھ۔ قیاس آرائی پر مبنی ضابطہ کشائی بڑے 'ٹارگٹ' ماڈل کو سستے 'ڈرافٹ' ماڈل کے ساتھ جوڑ کر اس پر حملہ کرتی ہے۔ ڈرافٹ ماڈل تیزی سے 4-8 امیدواروں کے ٹوکن کا ایک حصہ تجویز کرتا ہے۔ پھر بڑا ماڈل ان سب کو ایک ہی متوازی فارورڈ پاس میں پروسیس کرتا ہے اور ہر ایک کو چیک کرتا ہے۔ ٹوکن جو بڑے ماڈل کے تیار کردہ سے مماثل ہیں قبول کیے جاتے ہیں۔ پہلی مماثلت کو درست کیا جاتا ہے اور باقی کو رد کردیا جاتا ہے۔ چونکہ ایک ساتھ کئی ٹوکنز کی تصدیق کرنے پر تقریباً ایک بنانے کے برابر لاگت آتی ہے، اس لیے منظور شدہ رنز تقریباً مفت ہیں۔ اہم بات یہ ہے کہ، مسترد کرنے کا نمونہ لینے کا مرحلہ اس بات کی ضمانت دیتا ہے کہ حتمی تقسیم صرف بڑے ماڈل کو چلانے کے مترادف ہے — معیار کے نقصان کے بغیر رفتار۔

تکنیکی بصیرت

کلیدی چال ایک ترمیم شدہ رد کرنے کے نمونے لینے کا ٹیسٹ ہے۔ ہر ڈرافٹ شدہ ٹوکن کے لیے، ہدف کے ماڈل کے امکان کا موازنہ ڈرافٹ ماڈل سے کیا جاتا ہے۔ اگر ہدف مساوی یا زیادہ امکان فراہم کرتا ہے، تو ٹوکن قبول کیا جاتا ہے۔ بصورت دیگر اسے تناسب کے برابر امکان کے ساتھ قبول کیا جاتا ہے، اور مسترد ہونے پر ایک ایڈجسٹ شدہ بقایا تقسیم سے ایک درست ٹوکن کا نمونہ لیا جاتا ہے۔ یہ ریاضی آؤٹ پٹ کو بڑے ماڈل سے براہ راست نمونے لینے کے مترادف بناتا ہے۔

اسٹریٹجک اثر

رفتار اور پیمانہ

زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔

رسائی اور رسائی

یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔

واضح فیصلے

ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔

قیاس آرائی پر مبنی ڈیکوڈنگ ڈرافٹ ماڈلز کا مستقبل

توقع ہے کہ ڈرافٹ ماڈلز vLLM اور TensorRT-LLM جیسے انفرنس سرورز میں معیاری انفراسٹرکچر بن جائیں گے۔ خود ساختہ قیاس آرائیاں (Medusa, EAGLE) ہلکے وزن کی پیشن گوئی کے سروں کو شامل کر کے الگ الگ ڈرافٹ ماڈل کو مکمل طور پر چھوڑ دیتی ہیں، اور درختوں پر مبنی مسودہ ایک ساتھ کئی امیدواروں کے تسلسل کی تصدیق کرتا ہے۔ جیسے جیسے سیاق و سباق کی کھڑکیوں میں اضافہ ہوتا ہے اور سرونگ لاگت کا غلبہ ہوتا ہے، زیادہ ہوشیار، ماڈل سے مماثل ڈرافٹرز اور ہارڈویئر سے آگاہی کی تصدیق قبولیت کی شرحوں اور تھرو پٹ کو بلند کرے گی۔

حقیقی دنیا کا نفاذ

Anthropic، OpenAI، اور Google قیاس آرائی پر مبنی ضابطہ کشائی کا استعمال کرتے ہیں تاکہ لاکھوں صارفین کی خدمت کرنے والے چیٹ اسسٹنٹس پر تاخیر اور سرونگ لاگت کو کم کیا جا سکے۔

vLLM اور NVIDIA TensorRT-LLM جہاز بلٹ ان قیاس آرائی پر مبنی ضابطہ کشائی تاکہ خود میزبان Llama یا Mistral کی تعیناتیوں کو تیز کر سکیں۔

ایک 7B ڈرافٹ ماڈل کو 70B ہدف کے ساتھ جوڑنا (مثلاً، Llama-3 فیملی) ایک واحد GPU پر ٹوکن فی سیکنڈ کو تقریباً دوگنا کرنا۔

کوڈ مکمل کرنے والے ٹولز بوائلر پلیٹ تجویز کرنے کے لیے ایک چھوٹے سے ڈرافٹ ماڈل کا استعمال کرتے ہیں جس کی بڑے ماڈل سے تصدیق ہوتی ہے، ایڈیٹر میں تجاویز کو تیز رکھا جاتا ہے۔

خطرات اور گارڈریلز

گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔

فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔

اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔

نفاذ کا روڈ میپ

1

رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔

2

جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔

3

ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔

4

ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Decoding Draft Models quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

کوڈ ماڈلز کے لیے قیاس آرائی پر مبنی ترامیم

اکثر پوچھے گئے سوالات

What is Speculative Decoding Draft Models?

قیاس آرائی پر مبنی ضابطہ کشائی میں آنے والے کئی ٹوکنز کا اندازہ لگانے کے لیے ایک چھوٹا، تیز 'ڈرافٹ' ماڈل استعمال کیا جاتا ہے جس کے بعد ایک بڑا ماڈل ایک پاس میں تصدیق کرتا ہے۔ یہ آؤٹ پٹ میں بغیر کسی تبدیلی کے ٹیکسٹ جنریشن کو 2-3x تیز کرتا ہے۔

قیاس آرائی پر مبنی ضابطہ کشائی میں 'ڈرافٹ' ماڈل کا بنیادی کردار کیا ہے؟

چھوٹا ڈرافٹ ماڈل آنے والے ٹوکنز کا سستے انداز میں اندازہ لگاتا ہے، جسے بڑا ہدف ماڈل پھر ایک ہی متوازی پاس میں چیک کرتا ہے۔

ایک ہی وقت میں متعدد ڈرافٹ شدہ ٹوکنز کی تصدیق کرنے سے وقت کی بچت کیوں ہوتی ہے؟

نسل یادداشت کی پابند ہے۔ ایک بیچڈ پاس میں کئی ٹوکن چیک کرنا تقریباً ایک قدم جتنا سستا ہے، اس لیے قبول شدہ رنز تقریباً مفت ہیں۔

ٹارگٹ ماڈل کے پہلے ٹوکن کو مسترد کرنے کے بعد مسودہ کردہ ٹوکنز کا کیا ہوتا ہے؟

قبولیت پہلے اختلاف تک جاری رہتی ہے۔ اس ٹوکن کو درست کیا جاتا ہے اور اس کے بعد کے تمام ڈرافٹ شدہ ٹوکنز کو پھینک دیا جاتا ہے۔

قیاس آرائی پر مبنی ضابطہ کشائی کیسے یقینی بناتی ہے کہ آؤٹ پٹ کے معیار کو گرا نہیں ہے؟

ایک ترمیم شدہ ریجیکشن سیمپلنگ ٹیسٹ ٹارگٹ ماڈل سے براہ راست نمونے لینے کے حتمی ٹوکن ڈسٹری بیوشن میچز کی ضمانت دیتا ہے۔

ان میں سے کون سا 'خود قیاس' نقطہ نظر ہے جو ایک الگ ڈرافٹ ماڈل سے گریز کرتا ہے؟

Medusa اور EAGLE مرکزی ماڈل میں ہلکے وزن کے اضافی پیشن گوئی ہیڈز شامل کرتے ہیں تاکہ یہ اپنے مستقبل کے ٹوکن کا مسودہ تیار کر سکے۔