تشفير زوج البايت
Byte-Pair Encoding (BPE) هو خوارزمية مستوحاة من الضغط تقوم ببناء مفردات من خلال الدمج المتكرر لأزواج الرموز الأكثر شيوعًا.
نظرة عامة
It is the tokenizer behind GPT models, balancing tiny vocabularies of characters against huge vocabularies of whole words.
الغوص العميق
يبدأ BPE بمعاملة النص كسلسلة من الأحرف الفردية (أو البايتات الأولية). ثم يقوم بعد ذلك بعد كل زوج من الرموز المتجاورة، ويدمج الزوج الأكثر شيوعًا في رمز مميز جديد، ويكرر ذلك آلاف المرات. يتم تسجيل كل دمج كقاعدة. تصبح تسلسلات الحروف الشائعة مثل "th" أو "ing" أو الكلمات المتكررة بالكامل رموزًا فردية تدريجيًا، بينما تظل الكلمات النادرة مقسمة إلى أجزاء أصغر. كانت في الأصل طريقة لضغط البيانات من عام 1994، وتم تكييفها مع البرمجة اللغوية العصبية بواسطة Sennrich et al. في عام 2016 للترجمة الآلية. يستخدم GPT-2 وGPT-4 BPE على مستوى البايت، والذي يعمل على بايتات UTF-8 بحيث يمكن دائمًا تشفير أي حرف أو رمز تعبيري أو لغة بدون أي فشل خارج المفردات.
البصيرة الفنية
ينتج عن تدريب BPE قائمة مرتبة لقواعد الدمج. لتمييز النص الجديد، تقوم الخوارزمية بتقسيمه إلى بايت/أحرف وتطبق عمليات الدمج بشراهة بنفس ترتيب الأولوية حتى لا تتطابق أي قاعدة. يضمن BPE على مستوى البايت إجراءً احتياطيًا: حتى الرمز غير المرئي يتحلل إلى وحدات البايت المكونة له، وبالتالي فإن مفردات 256 بايت بالإضافة إلى عمليات الدمج المكتسبة تغطي كل شيء بدون رمز UNK المميز.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل ترميز زوج البايت
تظل BPE هي أداة الترميز الأساسية، لكن الضغط يتزايد نحو النماذج على مستوى البايت أو الأحرف التي تتخطى الترميز الصريح، وتتجنب المراوغات مثل الانقسامات غير الملائمة في التعليمات البرمجية أو الرياضيات أو النصوص غير الإنجليزية. يهدف البحث في البنى الخالية من الرموز والرموز المميزة المستفادة إلى إصلاح تحيزات BPE. ومع ذلك، فإن سرعته وكفاءة الضغط تعني أن المفردات على طراز BPE ستدعم معظم برامج LLM للإنتاج في المستقبل القريب.
التنفيذ في العالم الحقيقي
يستخدم GPT-2 وGPT-4 BPE على مستوى البايت بحيث يمكن تشفير أي حرف Unicode أو رمز تعبيري دون أخطاء.
تستخدم أنظمة الترجمة الآلية BPE لتقسيم الكلمات النادرة أو المركبة إلى أجزاء كلمات فرعية قابلة لإعادة الاستخدام ومشتركة عبر اللغات.
تقوم مكتبة الرموز المميزة الخاصة بـ Hugging Face بتدريب مفردات BPE على المجالات المخصصة مثل النصوص الطبية الحيوية أو القانونية.
تقوم نماذج التعليمات البرمجية بترميز المعرفات والكلمات الرئيسية باستخدام BPE، ودمج الأنماط المتكررة مثل 'def' أو '==' في رموز مميزة واحدة.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Byte-Pair Encoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
الترميز وترميز زوج البايت
الأسئلة المتداولة
What is Byte-Pair Encoding?
Byte-Pair Encoding (BPE) هو خوارزمية مستوحاة من الضغط تقوم ببناء مفردات من خلال الدمج المتكرر لأزواج الرموز الأكثر شيوعًا. إنه الرمز المميز وراء نماذج GPT، حيث يوازن بين المفردات الصغيرة للأحرف والمفردات الضخمة للكلمات الكاملة.
ما هي العملية الأساسية التي يكررها BPE لبناء مفرداته؟
تقوم BPE بإحصاء أزواج الرموز المتجاورة ودمج الزوج الأكثر تكرارًا في رمز مميز جديد، مع تكرار ذلك آلاف المرات.
كيف يتعامل BPE مع النص عندما يبدأ التدريب؟
يبدأ BPE من أصغر الوحدات (الأحرف أو البايتات الأولية) وينمو الرموز المميزة الأكبر من خلال عمليات الدمج.
لماذا يتجنب BPE على مستوى البايت الأخطاء خارج المفردات (UNK)؟
نظرًا لأن المفردات الأساسية تتضمن جميع البايتات البالغ عددها 256 بايت، فحتى الرموز غير المرئية تعود إلى تمثيل البايت الخاص بها.
من أين أتت خوارزمية BPE في الأصل قبل أن تعتمدها البرمجة اللغوية العصبية؟
تم تقديم BPE كتقنية لضغط البيانات في عام 1994 وتم تكييفها لاحقًا لترميز الكلمات الفرعية في عام 2016.
عند ترميز نص جديد، كيف يطبق BPE قواعده المكتسبة؟
يتم ترتيب قواعد الدمج، ويطبقها الترميز بجشع حسب الأولوية حتى لا تتطابق أي قاعدة أخرى.