بنیادی اصول گائیڈ

ٹوکنائزیشن

ٹوکنائزیشن وہ مرحلہ ہے جو متن کو چھوٹے چھوٹے ٹکڑوں میں کاٹتا ہے جسے ٹوکن کہتے ہیں، وہ اکائیاں جنہیں زبان کا ماڈل درحقیقت پڑھتا اور پیش گوئی کرتا ہے۔

2 منٹ پڑھیںآخری بار اپ ڈیٹ کیا گیا۔

جائزہ

It quietly shapes cost, context limits, and even how well a model handles spelling and rare words.

گہرا غوطہ

اس سے پہلے کہ کوئی ماڈل آپ کے متن کو دیکھے، ٹوکنائزر اسے ٹوکنز میں تقسیم کرتا ہے، جو کہ عام طور پر پورے الفاظ یا واحد حروف کی بجائے ذیلی الفاظ کے ٹکڑے ہوتے ہیں۔ لفظ 'ناخوشی' 'غیر'، 'خوشی'، یا 'ٹوکنائزیشن' 'ٹوکن' اور 'ائزیشن' میں تقسیم ہو سکتا ہے۔ عام الفاظ اکثر ایک ٹوکن پر نقشہ بناتے ہیں، جبکہ نایاب الفاظ، نام، یا کوڈ کئی حصوں میں تقسیم ہوتے ہیں۔ ہر ٹوکن پھر ایک شناختی نمبر پر نقش کیا جاتا ہے جسے ماڈل ایک ویکٹر میں تبدیل کرتا ہے۔ یہ عملی طور پر اہمیت رکھتا ہے کیونکہ ماڈلز میں ٹوکنز میں ماپا جانے والی سیاق و سباق کی ونڈوز ہیں، اور APIs کا بل فی ٹوکن ہے، اس لیے انگوٹھے کا ایک کھردرا اصول تقریباً 4 حروف یا 0.75 الفاظ فی ٹوکن ہے۔ ٹوکنائزیشن کلاسک ماڈل نرکس کی بھی وضاحت کرتی ہے: حروف کو گننا یا درست ہجے کرنا مشکل ہے کیونکہ ماڈل ٹکڑوں کو دیکھتا ہے، انفرادی حروف کو نہیں۔

تکنیکی بصیرت

زیادہ تر جدید ایل ایل ایم ذیلی لفظ ٹوکنائزیشن کا استعمال کرتے ہیں جیسے بائٹ پیئر انکوڈنگ (BPE) یا اس کے بائٹ لیول کی مختلف حالتیں۔ BPE حروف سے شروع ہوتا ہے اور ایک مقررہ ذخیرہ الفاظ (اکثر 30,000 سے 100,000+ ٹوکنز) بنانے کے لیے اکثر ملحقہ جوڑوں کو بار بار ضم کرتا ہے۔ یہ دو انتہاؤں کو متوازن کرتا ہے: لفظ کی سطح کی ٹوکنائزیشن ان دیکھے الفاظ کو سنبھال نہیں سکتی، جبکہ کردار کی سطح ترتیب کو بہت طویل بناتی ہے۔ ذیلی الفاظ ماڈل کو کسی بھی سٹرنگ کی نمائندگی کرنے دیتے ہیں، بشمول ٹائپوز اور نئے الفاظ، معلوم ٹکڑوں کو کمپوز کرکے، ترتیب کو معقول حد تک مختصر رکھتے ہوئے۔

اسٹریٹجک اثر

واضح فیصلے

یہ آپ کو مارکیٹنگ کی زبان سے واضح تکنیکی دعووں کو الگ کرنے میں مدد کرتا ہے۔

لاگت اور بجٹ

آپ پیسہ یا وقت خرچ کرنے سے پہلے بہتر نفاذ کے سوالات پوچھ سکتے ہیں۔

Team and workflow

مشترکہ تفہیم کے ساتھ ٹیمیں بہتر پروڈکٹ، پالیسی اور سیکھنے کے فیصلے کرتی ہیں۔

ٹوکنائزیشن کا مستقبل

ٹوکنائزیشن ایک فعال تحقیقی شعبہ ہے کیونکہ یہ کارکردگی اور انصاف پسندی کو محدود کرتا ہے۔ جو زبانیں زیادہ ٹکڑوں میں تبدیل ہوتی ہیں ان کی قیمت زیادہ ہوتی ہے اور سیاق و سباق کو تیزی سے استعمال کیا جاتا ہے، اس لیے کثیر لسانی انصاف پسندی ایک حقیقی تشویش ہے جسے بہتر، زیادہ متوازن الفاظ کے ساتھ حل کیا جا رہا ہے۔ محققین ٹوکن فری یا بائٹ لیول ماڈلز (جیسے ByT5) بھی تلاش کر رہے ہیں اور ٹوکنائزیشن سیکھ رہے ہیں جو ٹوٹنے والے ہاتھ سے بنائے گئے قدم کو مکمل طور پر ختم کر سکتے ہیں۔ ابھی کے لیے، بڑی ذخیرہ الفاظ، ہوشیار کثیر لسانی ٹوکنائزرز، اور ٹوکن پر مبنی قیمتوں اور سیاق و سباق کے بجٹ کے بارے میں صارف کی بڑھتی ہوئی آگاہی کی توقع کریں۔

حقیقی دنیا کا نفاذ

GPT اور Claude جیسے ماڈلز کے لیے API کی قیمتوں کا تعین فی ان پٹ اور آؤٹ پٹ ٹوکن بل کیا جاتا ہے، اس لیے ٹوکن کی گنتی لاگت کو براہ راست متاثر کرتی ہے۔

سیاق و سباق کی ونڈو کی حدیں (مثال کے طور پر، 128K یا 200K ٹوکنز) ٹوکنز میں ماپا جاتا ہے، اس بات کو محدود کرتے ہوئے کہ آپ کتنا متن یا کوڈ شامل کر سکتے ہیں۔

ڈویلپرز درخواستیں بھیجنے سے پہلے فوری سائز کا اندازہ لگانے اور مواد کو تراشنے کے لیے ٹوکنائزرز (جیسے ٹک ٹوکن) کا استعمال کرتے ہیں۔

ٹوکنائزیشن اس بات کی وضاحت کرتی ہے کہ ماڈلز کیوں کسی لفظ میں حروف کو گننے یا اسٹرنگ کو ریورس کرنے کے لیے جدوجہد کرتے ہیں، کیوں کہ وہ حروف کو نہیں بلکہ ذیلی الفاظ کے ٹکڑے دیکھتے ہیں۔

خطرات اور گارڈریلز

مختلف ٹیمیں ایک ہی اصطلاح کو مختلف طریقے سے استعمال کر سکتی ہیں، اس لیے دائرہ کار کی جلد وضاحت کریں۔

بینچ مارکس مضبوط نظر آسکتے ہیں جبکہ حقیقی دنیا کی کارکردگی ناہموار ہے۔

ڈیٹا کے معیار اور تشخیص کے منصوبوں کو نظر انداز کرنا اکثر نازک نتائج پیدا کرتا ہے۔

نفاذ کا روڈ میپ

1

آپ کو مطلوبہ نتائج کی سادہ زبان کی تعریف کے ساتھ شروع کریں۔

2

جانچ کرنے سے پہلے ایک کامیابی میٹرک اور ایک ناکامی کی شرط منتخب کریں۔

3

نمائندہ ڈیٹا کے ساتھ ایک چھوٹا پائلٹ چلائیں، نہ کہ پالش شدہ ڈیمو سیٹ۔

4

دستاویز جہاں ٹوکنائزیشن مدد کرتی ہے اور جہاں آسان طریقے بہتر ہیں۔

دریافت کرتے رہیں

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

کوئز شروع کریں۔

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

اکثر پوچھے گئے سوالات

What is Tokenization?

ٹوکنائزیشن وہ مرحلہ ہے جو متن کو چھوٹے چھوٹے ٹکڑوں میں کاٹتا ہے جسے ٹوکن کہتے ہیں، وہ اکائیاں جنہیں زبان کا ماڈل درحقیقت پڑھتا اور پیش گوئی کرتا ہے۔ یہ خاموشی سے لاگت، سیاق و سباق کی حدود، اور یہاں تک کہ ماڈل ہجے اور نایاب الفاظ کو کتنی اچھی طرح سے ہینڈل کرتا ہے۔

زبان کے ماڈل کے تناظر میں 'ٹوکن' کیا ہے؟

ٹوکن وہ اکائیاں ہیں جو ایک ماڈل پراسیس کرتی ہیں، عام طور پر ذیلی الفاظ کے ٹکڑے، بعض اوقات پورے الفاظ یا ایک حرف۔

زیادہ تر جدید ایل ایل ایم کس ٹوکنائزیشن کا طریقہ استعمال کرتے ہیں؟

ذیلی الفاظ کے طریقے جیسے کہ BPE متواتر کریکٹر جوڑوں کو ضم کرتے ہیں، خالص لفظ کی سطح اور کردار کی سطح کے نقطہ نظر کی کمزوریوں کو متوازن کرتے ہیں۔

ٹوکنائزیشن LLMs کے لیے ایک لفظ میں حروف کی گنتی جیسے کاموں کو کیوں مشکل بناتی ہے؟

چونکہ متن کو ذیلی الفاظ کے ٹوکنز میں گروپ کیا گیا ہے، اس لیے ماڈل ہر حرف کو براہ راست نہیں سمجھتا، جس سے خط کی سطح کے کاموں میں غلطی ہوتی ہے۔

API لاگت اور سیاق و سباق کی حدود کے لیے ٹوکنائزیشن کیوں اہم ہے؟

فراہم کنندگان کا بل فی ٹوکن اور سیاق و سباق کی کھڑکیوں کا سائز ٹوکن میں ہوتا ہے، اس لیے ٹوکن کی گنتی قیمت اور آپ کتنی رقم شامل کر سکتے ہیں، دونوں کو بڑھاتے ہیں۔

کچھ زبانوں میں انگریزی کے مقابلے ایک ہی جملے کی قیمت کیوں زیادہ ہو سکتی ہے؟

زیادہ تر انگریزی پر تربیت یافتہ الفاظ دیگر زبانوں کو مزید ٹوکنز میں تقسیم کرتے ہیں، لاگت میں اضافہ اور سیاق و سباق کو تیزی سے استعمال کرتے ہیں۔