YaRN سیاق و سباق ونڈو اسکیلنگ
YaRN (ایک اور RoPE ایکسٹینشن) ایک ایسی تکنیک ہے جو ٹرانسفارمر کے قابل استعمال سیاق و سباق کی کھڑکی کو اس سے کہیں زیادہ پھیلا دیتی ہے جس پر اسے تربیت دی گئی تھی، کم سے کم فائن ٹیوننگ کے ساتھ۔
جائزہ
It matters because it lets existing models handle much longer documents without retraining from scratch.
گہرا غوطہ
زیادہ تر جدید LLMs روٹری پوزیشن ایمبیڈنگز (RoPE) کا استعمال کرتے ہوئے الفاظ کی پوزیشنوں کو انکوڈ کرتے ہیں، جو صرف اس لمبائی تک اچھی طرح سے کام کرتے ہیں جو ماڈل نے ٹریننگ کے دوران دیکھی تھی۔ ایک طویل ترتیب میں کھانا کھلانا اور ماڈل بری طرح گر جاتا ہے۔ YaRN تعدد سے آگاہ طریقے سے RoPE کی گردش کی فریکوئنسیوں کو دوبارہ اسکیل کرکے اس کو حل کرتا ہے: اعلی تعدد کے طول و عرض (جو مقامی، قریبی رشتوں کو پکڑتے ہیں) کو زیادہ تر اچھوتا چھوڑ دیا جاتا ہے، جب کہ کم تعدد کے طول و عرض (جو طویل فاصلے کی پوزیشن پر قبضہ کرتے ہیں) انٹرپولیٹڈ ہوتے ہیں۔ یہ لمبے رینجز پر لاگٹس کو اچھا برتاؤ رکھنے کے لیے توجہ میں درجہ حرارت کی ایڈجسٹمنٹ کا اضافہ بھی کرتا ہے۔ نتیجہ، جس کا مظاہرہ LLaMA ماڈلز پر ہوتا ہے، سیاق و سباق کو 4K سے 64K-128K ٹوکنز تک پھیلاتا ہے جس میں اصل تربیتی اعداد و شمار کا صرف 0.1% اور چند سو فائن ٹیوننگ اقدامات استعمال ہوتے ہیں۔
تکنیکی بصیرت
RoPE استفسار اور کلیدی ویکٹرز کو پوزیشن کے متناسب زاویہ اور فی ڈائمینشن فریکوئنسی سے گھماتا ہے۔ سادہ لکیری انٹرپولیشن (پوزیشن انٹرپولیشن) تمام تعدد کو یکساں طور پر اسکواش کرتا ہے، جس سے مقامی تفصیلات کو نقصان پہنچتا ہے۔ YaRN اس کے بجائے 'NTK-by-parts' کا اطلاق کرتا ہے: یہ صرف کم تعدد (طویل طول موج) کے طول و عرض کو جوڑتا ہے، اعلی تعدد والے کو اکیلا چھوڑ دیتا ہے، اور ان کے درمیان ریمپ کرتا ہے۔ توجہ کے درجہ حرارت کا پیمانہ اینٹروپی شفٹ کی تلافی کرتا ہے، توسیعی لمبائی میں درستگی کو محفوظ رکھتا ہے۔
اسٹریٹجک اثر
رفتار اور پیمانہ
زبان کے کام کے بہاؤ مستقل مزاجی کی قربانی کے بغیر تیزی سے آگے بڑھ سکتے ہیں۔
رسائی اور رسائی
یہ زبانوں اور مواصلاتی طرزوں تک رسائی کو بڑھاتا ہے۔
واضح فیصلے
ٹیمیں فیصلے پر زیادہ وقت گزار سکتی ہیں جبکہ آٹومیشن تکرار کو سنبھالتی ہے۔
YaRN سیاق و سباق ونڈو اسکیلنگ کا مستقبل
YaRN طرز کی فریکوئنسی آگاہی توسیع طویل سیاق و سباق کے ماڈلز کی ترسیل کے لیے ایک طے شدہ جزو بن گئی ہے۔ مختلف قسمیں اور جانشین ظاہر ہوتے رہتے ہیں جب لیبز ملین ٹوکن ونڈوز کی طرف دھکیلتی ہیں۔ موثر توجہ، KV-کیشے کمپریشن، اور ڈائنامک اسکیلنگ کے ساتھ سخت انضمام کی توقع کریں جو فی درخواست پر فلائی پر ایڈجسٹ ہو جاتی ہے۔ وسیع تر رجحان 'ایک ماڈل کو کتنی دیر تک تربیت دی گئی' سے 'یہ کتنی دیر تک مفید طور پر پڑھ سکتا ہے' کو الگ کر رہا ہے، طویل سیاق و سباق کو ایک مہنگی تعمیراتی وابستگی کے بجائے تربیت کے بعد کی ایک سستی خصوصیت بنا رہا ہے۔
حقیقی دنیا کا نفاذ
ایک کھلے LLaMA ماڈل کو 4K سے 128K ٹوکن تک بڑھانا تاکہ یہ ایک پاس میں پورا کوڈ بیس یا طویل معاہدہ کھا سکے۔
کسی چیٹ بوٹ کو پہلے کے موڑ کو تراشے بغیر گفتگو کی بہت لمبی تاریخوں کو برقرار رکھنے دینا
کتاب کی لمبائی کے دستاویزات یا کثیر گھنٹے کی نقلوں کا خلاصہ کرنا جو بیس ماڈل کی مقامی ونڈو سے زیادہ ہے
صرف ایک چھوٹی سی فائن ٹیوننگ رن کا استعمال کرتے ہوئے طویل سیاق و سباق کی بازیافت کے کاموں کے لئے پہلے سے تربیت یافتہ ماڈل کو سستے انداز میں ڈھالنا
خطرات اور گارڈریلز
گمراہ شدہ حقائق خاموشی سے رپورٹس، سپورٹ فلو، یا تحقیقی نتائج درج کر سکتے ہیں۔
فوری حساسیت اسی طرح کی درخواستوں میں متضاد نتائج پیدا کر سکتی ہے۔
اگر رسائی کے کنٹرول کمزور ہیں تو حساس ٹیکسٹ ڈیٹا کو بے نقاب کیا جا سکتا ہے۔
نفاذ کا روڈ میپ
رول آؤٹ سے پہلے آؤٹ پٹ فارمیٹ، ٹون اور معیار کے معیارات کی وضاحت کریں۔
جب بھی درستگی اہمیت رکھتی ہے تو بھروسہ مند ذرائع کے ساتھ زمینی جوابات۔
ہائی اسٹیک آؤٹ پٹس کے لیے ایک انسانی جائزہ چیک پوائنٹ رکھیں۔
ناکامی کے نمونوں کو ٹریک کریں اور پرامپٹس یا ورک فلو کو باقاعدگی سے دوبارہ تربیت دیں۔
دریافت کرتے رہیں
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the YaRN Context Window Scaling quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
اگلا گائیڈ
سیاق و سباق ونڈوز
اکثر پوچھے گئے سوالات
What is YaRN Context Window Scaling?
YaRN (ایک اور RoPE ایکسٹینشن) ایک ایسی تکنیک ہے جو ٹرانسفارمر کے قابل استعمال سیاق و سباق کی کھڑکی کو اس سے کہیں زیادہ پھیلا دیتی ہے جس پر اسے تربیت دی گئی تھی، کم سے کم فائن ٹیوننگ کے ساتھ۔ یہ اہمیت رکھتا ہے کیونکہ یہ موجودہ ماڈلز کو شروع سے دوبارہ تربیت کے بغیر زیادہ طویل دستاویزات کو سنبھالنے دیتا ہے۔
سیاق و سباق کی لمبائی کو بڑھانے کے لیے YaRN کس پوزیشن انکوڈنگ اسکیم میں ترمیم کرتا ہے؟
YaRN کا مطلب 'Eet other RoPE extensionN' ہے اور یہ روٹری پوزیشن ایمبیڈنگز میں استعمال ہونے والی گردش کی فریکوئنسیوں کو دوبارہ اسکیل کرکے کام کرتا ہے۔
YaRN اعلی تعدد بمقابلہ کم تعدد RoPE طول و عرض کا علاج کیسے کرتا ہے؟
YaRN کا 'NTK-by-parts' اپروچ مقامی تفصیلات کو نقصان پہنچانے سے بچنے کے لیے کم فریکوئنسی (لمبی رینج) کو انٹرپول کرتے ہوئے اعلی تعدد (مقامی) طول و عرض کو محفوظ رکھتا ہے۔
شروع سے طویل سیاق و سباق کے ماڈل کو تربیت دینے پر YaRN کی کارکردگی کا ایک اہم فائدہ کیا ہے؟
YaRN اصل تربیتی ڈیٹا کے تقریباً 0.1% کا استعمال کرتے ہوئے سیاق و سباق کو بڑھا سکتا ہے اور تھوڑی تعداد میں فائن ٹیوننگ کے اقدامات، جو دوبارہ تربیت سے کہیں زیادہ سستا ہے۔
تعدد کو دوبارہ اسکیل کرنے کے علاوہ، طویل فاصلے تک توجہ کو مستحکم رکھنے کے لیے YaRN کونسی اضافی ایڈجسٹمنٹ لاگو ہوتی ہے؟
YaRN توجہ کے درجہ حرارت میں ترمیم کرتا ہے تاکہ انٹراپی/لاگٹ شفٹ کی تلافی کی جاسکے جو اس وقت ہوتی ہے جب تسلسل بہت طویل ہوجاتا ہے۔
کیا مسئلہ ہوتا ہے اگر آپ RoPE ماڈل کی ترتیب کو اس کی تربیت سے کہیں زیادہ لمبا کھلاتے ہیں، بغیر کسی پیمانے کے؟
RoPE نادیدہ لمبی پوزیشنوں کو ناقص طور پر عام کرتا ہے، لہذا معیار گر جاتا ہے جب تک کہ تعدد کو دوبارہ نہیں بنایا جاتا۔