الترميز وترميز زوج البايت
يقوم الترميز بتقسيم النص إلى وحدات صغيرة يقرأها نموذج اللغة فعليًا، ويعد تشفير زوج البايت (BPE) الطريقة الشائعة لبناء تلك المفردات.
نظرة عامة
It balances having a manageable vocabulary against handling any word the model might encounter.
الغوص العميق
لا ترى نماذج اللغة أحرفًا أولية أو كلمات كاملة، بل ترى الرموز المميزة ومعرفات الأعداد الصحيحة المعينة لأجزاء من النص. يعد اختيار هذه القطع بمثابة مقايضة: فالمفردات على مستوى الكلمات ضخمة وتختنق بالكلمات غير المرئية أو التي بها أخطاء إملائية، في حين أن المفردات على مستوى الأحرف تجعل التسلسلات طويلة جدًا. تشفير زوج البايت يحقق حلاً وسطًا. يبدأ BPE، المستعار من خوارزمية ضغط البيانات في التسعينيات، من الأحرف الفردية (أو البايتات الأولية) ويدمج بشكل متكرر الزوج المجاور الأكثر شيوعًا في رمز مميز جديد، مما يؤدي إلى تنمية المفردات نحو الكلمات الفرعية الشائعة. تصبح الكلمات المتكررة رموزًا فردية، بينما تنقسم الكلمات النادرة إلى أجزاء قابلة لإعادة الاستخدام. يعمل BPE على مستوى البايت، الذي تستخدمه نماذج GPT، على وحدات البايت الأولية بحيث يمكنه تمثيل أي نص Unicode - بما في ذلك الرموز التعبيرية وأي لغة - دون أي فشل في المفردات.
البصيرة الفنية
تدريب BPE جشع ويحركه التردد. بدءًا من الأبجدية الأساسية، يقوم بإحصاء أزواج الرموز المتجاورة عبر المجموعة ويدمج الزوج الأكثر شيوعًا، ويسجل كل عملية دمج كقاعدة. تكرار هذا آلاف المرات ينتج عنه قائمة دمج مرتبة ومفردات ثابتة. عند الاستدلال، يتم ترميز النص من خلال تطبيق قواعد الدمج هذه بالترتيب. ولهذا السبب نادرًا ما تتطابق أعداد الرموز المميزة مع عدد الكلمات: تغير المسافات والأحرف الكبيرة والكلمات النادرة كيفية تقسيم النص إلى رموز مميزة، ويمكن أن تصبح كلمة واحدة عدة رموز مميزة.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل الترميز وترميز زوج البايت
يخضع الترميز حاليًا لعملية إعادة تفكير نشطة. تهدف النماذج على مستوى البايت والأحرف مثل ByT5، والبنيات الناشئة الخالية من الرمز المميز أو "البايت الكامنة"، إلى إسقاط المفردات الثابتة تمامًا حتى تتعامل النماذج مع أي مدخلات وأي لغة بشكل موحد. يعالج الباحثون أيضًا عدالة الترميز - حيث تكلف العديد من اللغات غير الإنجليزية واللغات منخفضة الموارد حاليًا عددًا أكبر بكثير من الرموز المميزة لكل جملة، مما يؤدي إلى ارتفاع السعر وتقليص السياق الفعال. توقع ضبط الرموز المميزة للتعليمات البرمجية والرياضيات والتوازن متعدد اللغات، بالإضافة إلى التجارب المستمرة لدفع الحدود مرة أخرى نحو وحدات البايت الأولية.
التنفيذ في العالم الحقيقي
تستخدم نماذج GPT وLlama الرموز المميزة على نمط BPE لتحويل المطالبات إلى معرفات الرموز المميزة التي تعالجها الشبكة.
يتم قياس تسعير واجهة برمجة التطبيقات (API) وحدود نافذة السياق بالرموز المميزة، لذا يؤثر الترميز بشكل مباشر على التكلفة ومدى ملاءمة النص.
التعامل مع الرموز التعبيرية والأكواد والكلمات النادرة بأمان عن طريق تقسيمها إلى كلمات فرعية أو أجزاء بايت قابلة لإعادة الاستخدام.
دعم العديد من اللغات في نموذج واحد دون قاموس منفصل لكل لغة، عبر التشفير على مستوى البايت.
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Tokenization and Byte Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
تشفير زوج البايت
الأسئلة المتداولة
What is Tokenization and Byte Pair Encoding?
يقوم الترميز بتقسيم النص إلى وحدات صغيرة يقرأها نموذج اللغة فعليًا، ويعد تشفير زوج البايت (BPE) الطريقة الشائعة لبناء تلك المفردات. فهو يوازن بين وجود مفردات يمكن التحكم فيها والتعامل مع أي كلمة قد يواجهها النموذج.
ما الذي ينتجه الترميز لنموذج اللغة ليقرأه؟
تعمل النماذج على الرموز المميزة - معرفات الأعداد الصحيحة التي تمثل الأحرف أو الكلمات الفرعية أو الكلمات - بدلاً من السلاسل النصية الأولية.
كيف يقوم Byte Pair Encoding ببناء مفرداته؟
يبدأ BPE من الأحرف أو البايتات ويدمج بشكل جشع الأزواج المتجاورة الأكثر شيوعًا، ليشكل تدريجيًا رموزًا فرعية مشتركة.
ما هي المشكلة التي تحلها أساليب الكلمات الفرعية مثل BPE مقارنة بالترميز على مستوى الكلمة؟
تفشل المفردات على مستوى الكلمات في الكلمات غير المرئية؛ يقوم ترميز الكلمات الفرعية بتقسيم الكلمات النادرة إلى أجزاء معروفة، مما يتجنب المشكلات خارج المفردات مع الحفاظ على سهولة التحكم في المفردات.
ما هي ميزة BPE على مستوى البايت، كما هو مستخدم في نماذج GPT؟
ويعني التشغيل على وحدات البايت الأولية أنه يمكن تشفير كل المدخلات الممكنة، لذلك لا توجد أحرف غير معروفة حقًا بغض النظر عن اللغة أو الرمز.
لماذا يختلف عدد الرموز المميزة للنموذج غالبًا عن عدد الكلمات في الجملة؟
يمكن أن يؤدي ترميز الكلمات الفرعية إلى تقسيم كلمة واحدة إلى أجزاء متعددة، كما أنه حساس للمسافات وحالة الأحرف، لذلك نادرًا ما يتساوى عدد الرموز المميزة مع عدد الكلمات.