ٹیکنیکل گائیڈ

YaRN اور سیاق و سباق کی لمبائی کی توسیع

YaRN (ابھی تک ایک اور RoPE ایکسٹینشن) ماڈل کی قابل استعمال سیاق و سباق کی کھڑکی کو اس سے کہیں زیادہ پھیلانے کی ایک موثر تکنیک ہے جس پر اسے تربیت دی گئی تھی۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It cleverly rescales rotary position embeddings so a model trained on, say, 4K tokens can handle 32K or more with minimal fine-tuning.

گہرا غوطہ

زیادہ تر جدید LLMs ٹوکن پوزیشنز کو RoPE (روٹری پوزیشن ایمبیڈنگز) کے ساتھ انکوڈ کرتے ہیں، جو پوزیشن سے منسلک زاویوں سے سوال اور کلیدی ویکٹر کو گھماتے ہیں۔ جب آپ ٹریننگ کی لمبائی سے زیادہ لمبے سلسلے کو فیڈ کرتے ہیں، تو یہ گردشیں ان دیکھی حدود میں داخل ہوتی ہیں اور ماڈل ٹوٹ جاتا ہے۔ YaRN، جو 2023 میں Bowen Peng اور معاونین کے ذریعے متعارف کرایا گیا تھا، اسے NTK- آگاہ انٹرپولیشن فی فریکوئنسی لاگو کرتے ہوئے ٹھیک کرتا ہے: یہ اعلی تعدد کے طول و عرض (جو مقامی، مختصر فاصلے کے رشتوں کو پکڑتا ہے) کو زیادہ تر اچھوتا چھوڑ دیتا ہے جب کہ کم تعدد کے طول و عرض (جو طویل فاصلے کی پوزیشن کو ٹریک کرتا ہے)۔ YaRN طویل سیاق و سباق سے آنے والی اینٹروپی تبدیلیوں کا مقابلہ کرنے کے لیے توجہ کے لیے درجہ حرارت کی ایڈجسٹمنٹ بھی شامل کرتا ہے۔ نتیجہ اعداد و شمار کے صرف ایک چھوٹے سے حصے پر فائن ٹیوننگ کے بعد مضبوط سیاق و سباق کی کارکردگی ہے اور ایسے اقدامات جن کی سادہ لوحی کی ضرورت ہوتی ہے۔

تکنیکی بصیرت

RoPE ہر سرایت کرنے والے جہت کو گردش کی فریکوئنسی تفویض کرتا ہے۔ سادہ لکیری انٹرپولیشن تمام فریکوئنسیوں کو یکساں طور پر کمپریس کرتا ہے، جس سے اعلی تعدد کے طول و عرض کو نقصان پہنچتا ہے جو مقامی تفصیلات کو انکوڈ کرتے ہیں۔ YaRN ایک ریمپ فنکشن کا استعمال کرتا ہے تاکہ صرف کم فریکوئنسی (لمبی طول موج) کے طول و عرض کو انٹرپولیٹ کیا جا سکے جبکہ اعلی تعدد والے کو محفوظ رکھتے ہوئے، نیز 1/sqrt(t) توجہ کا درجہ حرارت پیمانہ جو ترتیب کی لمبائی کے بڑھنے کے ساتھ ساتھ softmax نفاست کو مستحکم رکھتا ہے۔ یہ NTK بہ حصوں کا نقطہ نظر بہت کم تنزلی کے ساتھ سیاق و سباق کو بڑھاتا ہے۔

اسٹریٹجک اثر

لاگت اور بجٹ

فن تعمیر کے فیصلے سالوں تک کارکردگی اور آپریٹنگ لاگت کو آگے بڑھاتے ہیں۔

واضح فیصلے

تکنیکی تعلیم ٹیموں کو صحیح اسٹیک منتخب کرنے میں مدد کرتی ہے، نہ صرف جدید ترین۔

کوالٹی کنٹرول

انجینئرنگ کے بہتر انتخاب پیداوار میں قابل اعتماد واقعات کو کم کرتے ہیں۔

YaRN کا مستقبل اور سیاق و سباق کی لمبائی کی توسیع

سیاق و سباق کی توسیع اب معیاری مشق ہے: کھلے ماڈلز معمول کے مطابق 128K ٹوکن یا اس سے زیادہ تک پہنچنے والے YaRN کے توسیعی ورژن بھیجتے ہیں۔ تحقیق ان طریقوں کی طرف بڑھ رہی ہے جو سیاق و سباق کو صفر یا قریب صفر ٹھیک ٹیوننگ کے ساتھ بڑھاتے ہیں، توجہ کے نمونوں کی چالوں کے ساتھ RoPE ریسکیلنگ کو جوڑتے ہیں، اور صرف سروں کے بجائے پوری ونڈو میں معیار کو برقرار رکھتے ہیں۔ پہلے سے تربیت میں ان تکنیکوں کے سخت انضمام کی توقع کریں تاکہ لمبا سیاق و سباق ریٹروفٹ کی بجائے مقامی ہو۔

حقیقی دنیا کا نفاذ

مختصر فائن ٹیوننگ کے ساتھ طویل دستاویز کے سوالوں کے جوابات کے لیے کھلے 4K سیاق و سباق کے ماڈل کو 32K یا 128K تک بڑھانا

بازیافت کے بڑھے ہوئے نظام کو چالو کرنا تاکہ بغیر کسی کٹے ہوئے متعدد مربوط حصئوں کو شامل کیا جا سکے۔

پاورنگ کوڈ اسسٹنٹ جن کو ایک پرامپٹ میں ایک پوری بڑی ریپوزٹری فائل یا متعدد فائلوں کی ضرورت ہوتی ہے۔

طویل کثیر موڑ گفتگو کے لیے ایک بنیادی ماڈل کو اپنانا جو بڑی چیٹ ہسٹری جمع کرتی ہے۔

خطرات اور گارڈریلز

ایک بینچ مارک کو بہتر بنانا نظام کی وسیع تر کمزوریوں کو چھپا سکتا ہے۔

بنیادی ڈھانچے اور دیکھ بھال کے اخراجات کو اکثر کم سمجھا جاتا ہے۔

سیکورٹی اور مشاہداتی فرق بڑھ سکتا ہے کیونکہ نظام زیادہ پیچیدہ ہو جاتا ہے۔

نفاذ کا روڈ میپ

1

نفاذ سے پہلے تاخیر، معیار اور لاگت کے اہداف کی وضاحت کریں۔

2

حقیقت پسندانہ بوجھ اور ڈیٹا کی شرائط کے تحت بینچ مارک۔

3

غلطیوں، بڑھے ہوئے، اور صارف کے اثرات کے لیے آلے کی نگرانی۔

4

اسکیلنگ سے پہلے رول بیک اور واقعہ کے ردعمل کے راستے تیار کریں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the YaRN and Context Length Extension quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اگلا گائیڈ

سیاق و سباق کی توسیع کے لیے پوزیشن انٹرپولیشن

اکثر پوچھے گئے سوالات

What is YaRN and Context Length Extension?

YaRN (ابھی تک ایک اور RoPE ایکسٹینشن) ماڈل کی قابل استعمال سیاق و سباق کی کھڑکی کو اس سے کہیں زیادہ پھیلانے کی ایک موثر تکنیک ہے جس پر اسے تربیت دی گئی تھی۔ یہ چالاکی کے ساتھ روٹری پوزیشن ایمبیڈنگز کو دوبارہ اسکیل کرتا ہے تاکہ ایک ماڈل جس پر تربیت یافتہ ہو، کہہ لیں، 4K ٹوکن کم سے کم فائن ٹیوننگ کے ساتھ 32K یا اس سے زیادہ کو سنبھال سکتا ہے۔

سیاق و سباق کو بڑھانے کے لیے YaRN کس پوزیشن انکوڈنگ طریقہ میں ترمیم کرتا ہے؟

YaRN، جس کے نام کا مطلب ایک اور RoPE ایکسٹینشن ہے، زیادہ تر جدید LLMs میں استعمال ہونے والی روٹری پوزیشن ایمبیڈنگز کو دوبارہ اسکیل کرتا ہے۔

کیا غلط ہوتا ہے جب ایک RoPE ماڈل اپنی تربیت کی لمبائی سے زیادہ طویل ترتیب دیکھتا ہے؟

تربیت سے آگے کی پوزیشنیں گھومنے والے زاویے پیدا کرتی ہیں جو ماڈل نے کبھی نہیں دیکھے، لہذا توجہ کا برتاؤ تیزی سے کم ہوتا ہے۔

YaRN مختلف RoPE فریکوئنسی کے طول و عرض کا علاج کیسے کرتا ہے؟

YaRN ایک NTK بائی پارٹس ریمپ کا استعمال کرتا ہے جو طویل طول موج کی کم تعدد کے مدھم کو انٹرپول کرتا ہے اور شارٹ رینج ہائی فریکوئنسی مدھم زیادہ تر برقرار رہتا ہے۔

تعدد کو دوبارہ اسکیل کرنے کے علاوہ، YaRN کس اضافی ایڈجسٹمنٹ کا اطلاق کرتا ہے؟

YaRN اینٹروپی شفٹوں کا مقابلہ کرنے کے لیے توجہ کے لاگٹس میں درجہ حرارت کی پیمائش کا اضافہ کرتا ہے جو سیاق و سباق کے بڑھنے کے ساتھ ہوتی ہے۔

بے ہودہ مداخلت پر YaRN کا ایک اہم عملی فائدہ کیا ہے؟

YaRN ڈیٹا کے ایک چھوٹے سے حصے پر فائن ٹیوننگ کے بعد طویل سیاق و سباق کا مضبوط معیار حاصل کرتا ہے جس کے لیے سادہ طریقہ کی ضرورت ہوتی ہے۔