طویل سیاق و سباق کے لیے پوزیشنی انٹرپولیشن
پوزیشنل انٹرپولیشن (PI) ایک سادہ، بااثر تکنیک ہے جو ایک ٹرانسفارمر کے سیاق و سباق کی ونڈو کو اس حد میں نچوڑ کر توسیع کرتی ہے جس کا ماڈل پہلے سے جانتا ہے۔
جائزہ
Instead of extrapolating to unseen positions, it interpolates within trained ones, requiring only brief fine-tuning.
گہرا غوطہ
2023 میں Meta محققین (Chen et al.) کی طرف سے متعارف کرایا گیا، Positional Interpolation اس حقیقت سے نمٹتا ہے کہ RoPE والے ماڈلز تربیت سے باہر کی پوزیشنوں پر منتقل ہونے پر تباہ کن طور پر ناکام ہو جاتے ہیں۔ بصیرت متضاد ہے: ماڈل سے بڑی پوزیشن والی اقدار کو سنبھالنے کے لیے کہنے کے بجائے، اس نے کبھی نہیں دیکھا، PI آنے والی پوزیشن کے اشاریوں کو پیمانے کے عنصر سے تقسیم کرتا ہے تاکہ 8K نقشے کی اصل 2K رینج میں واپس آ جائے۔ چونکہ ماڈل کو اس حد پر تربیت دی گئی تھی، اس لیے گردشیں تقسیم میں رہتی ہیں۔ صرف 1,000 فائن ٹیوننگ اقدامات کے بعد، ایک LLaMA ماڈل نے 32K سیاق و سباق تک اس طریقے کو بڑھایا۔ اس مقالے میں دکھایا گیا ہے کہ ایکسٹراپولیشن توجہ کے اسکور کو بہت زیادہ اقدار تک اڑا سکتا ہے، جب کہ انٹرپولیشن انہیں پابند اور مستحکم رکھتا ہے، یہی وجہ ہے کہ انٹرپولیشن ڈرامائی طور پر ایکسٹراپولیشن سے بہتر کام کرتا ہے۔
تکنیکی بصیرت
PI پوزیشن کو m سے m/s میں ری اسکیل کرتا ہے جہاں s توسیع کا عنصر ہے (مثال کے طور پر، نئی لمبائی کو اصل لمبائی سے تقسیم کیا گیا ہے)۔ RoPE کے لیے یہ ملحقہ پوزیشنوں کے درمیان گھماؤ کے مرحلے کو مؤثر طریقے سے سکڑتا ہے، تربیت یافتہ کونیی رینج میں مزید پوزیشنوں کو پیک کرتا ہے۔ مقالے میں نظریاتی پابند ظاہر کرتا ہے کہ انٹرپولیٹڈ توجہ کے اسکور اچھی طرح سے کنٹرول میں رہتے ہیں، جب کہ بے ہودہ ایکسٹراپولیشن تربیت میں نظر آنے والی کسی بھی چیز سے زیادہ شدت کے اسکور آرڈر پیدا کر سکتا ہے، جو سافٹ میکس کو غیر مستحکم کرتا ہے۔
اسٹریٹجک اثر
لاگت اور بجٹ
فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔
واضح فیصلے
تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔
کوالٹی کنٹرول
انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔
طویل سیاق و سباق کے لیے پوزیشنی انٹرپولیشن کا مستقبل
پوزیشنل انٹرپولیشن فالو اپس کی ایک لہر کی بنیاد بن گئی، جس میں NTK-آگاہی اسکیلنگ اور YaRN شامل ہیں، جو مقامی تفصیلات کو محفوظ رکھنے کے لیے زیادہ منتخب طریقے سے انٹرپول کرتے ہیں۔ رفتار ان طریقوں کی طرف ہے جن کو بہت کم یا کوئی ٹھیک ٹیوننگ کی ضرورت نہیں ہے اور بیکنگ کی طرف طویل سیاق و سباق کو پہلے سے تربیت دینے کی طرف ہے۔ PI ایک قیمتی بیس لائن بنی ہوئی ہے اور 128K پلس سیاق و سباق کی ونڈوز تک مؤثر طریقے سے پہنچنے کے لیے اکثر اسے جدید ترین فریکوئنسی سے آگاہ اسکیموں کے ساتھ جوڑ دیا جاتا ہے۔
حقیقی دنیا کا نفاذ
تقریباً 1,000 فائن ٹیوننگ مراحل کے ساتھ 8K-32K ٹوکن کو ہینڈل کرنے کے لیے 2K سیاق و سباق کے LLaMA ماڈل کو بڑھانا
شروع سے دوبارہ تربیت کیے بغیر طویل دستاویز کے خلاصے کے لیے موجودہ چیٹ ماڈل کو اپنانا
تصوراتی بنیاد کے طور پر کام کرنا جس پر NTK-آگاہی اسکیلنگ اور YaRN بہتر ہوتے ہیں۔
مختصر ونڈوز کے ساتھ اصل میں تربیت یافتہ ماڈلز پر طویل سیاق و سباق کوڈ یا قانونی دستاویز کے تجزیہ کو فعال کرنا
خطرات اور گارڈریلز
ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔
بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔
سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔
نفاذ کا روڈ میپ
نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔
حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔
غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔
اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Positional Interpolation for Long Context quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
سیاق و سباق کی توسیع کے لیے پوزیشن انٹرپولیشن
اکثر پوچھے گئے سوالات
What is Positional Interpolation for Long Context?
پوزیشنل انٹرپولیشن (PI) ایک سادہ، بااثر تکنیک ہے جو ایک ٹرانسفارمر کے سیاق و سباق کی ونڈو کو اس حد میں نچوڑ کر توسیع کرتی ہے جس کا ماڈل پہلے سے جانتا ہے۔ غیر دیکھی جگہوں پر اکٹھا کرنے کے بجائے، یہ تربیت یافتہ لوگوں کے اندر گھس جاتا ہے، جس کے لیے صرف مختصر ٹھیک ٹیوننگ کی ضرورت ہوتی ہے۔
Positional Interpolation کے پیچھے بنیادی خیال کیا ہے؟
PI پوزیشن کے اشاریہ جات کو پیمانے کے عنصر سے تقسیم کرتا ہے تاکہ لمبے تسلسل کو تقسیم میں گردش کو برقرار رکھتے ہوئے، تربیت یافتہ پوزیشن کی حد میں واپس نقشہ بنایا جائے۔
لمبے عہدوں پر سادہ لوح کیوں ناکام ہو جاتا ہے؟
پی آئی پیپر نے ظاہر کیا کہ نادیدہ بڑی پوزیشنیں softmax کو غیر مستحکم کرتے ہوئے، تربیت سے زیادہ شدت کے توجہ کے اسکور آرڈر دے سکتی ہیں۔
LLaMA کو 32K تک بڑھانے کے لیے اصل PI کام کو تقریباً کتنی باریک ٹوننگ کی ضرورت تھی؟
مقالے میں بتایا گیا ہے کہ تقریباً 1,000 فائن ٹیوننگ کے اقدامات 32K ٹوکنز تک سیاق و سباق کو بڑھانے کے لیے کافی تھے۔
اگر آپ فیکٹر s سے سیاق و سباق کو بڑھاتے ہیں، تو PI پوزیشن m کو کیسے تبدیل کرتا ہے؟
PI نئی بڑی رینج کو اصل تربیت یافتہ رینج میں کمپریس کرتے ہوئے، m تا m/s پوزیشن کو ری اسکیل کرتا ہے۔
PI نے YaRN جیسے بعد کے طریقوں کو کیسے متاثر کیا؟
PI نے انٹرپولیشن کو محفوظ نقطہ نظر کے طور پر قائم کیا۔ NTK- آگاہ سکیلنگ اور YaRN نے فریکوئنسیوں کو زیادہ منتخب طریقے سے انٹرپولیٹ کر کے اسے بہتر کیا۔