دليل اللغة AI

ترميز WordPiece

WordPiece هي خوارزمية ترميز الكلمات الفرعية التي تعمل على تشغيل BERT والعديد من نماذج Google، وتقسيم الكلمات إلى أجزاء قابلة لإعادة الاستخدام حتى يتمكن النموذج من التعامل مع أي نص باستخدام مفردات ثابتة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is why a model that has never seen 'unhappiness' can still understand it by reading 'un', '##happy', and '##ness'.

الغوص العميق

يبني WordPiece مفردات مكونة من وحدات كلمات فرعية بدلاً من كلمات كاملة أو أحرف مفردة. بدءًا من الأحرف الفردية، فإنه يدمج بجشع زوجًا من الرموز التي تزيد من احتمالية مجموعة التدريب، ويكرر ذلك حتى يصل إلى حجم المفردات المستهدف (يستخدم BERT حوالي 30000 رمزًا). عند الاستدلال، فإنه يرمز بجشع من اليسار إلى اليمين، ويطابق أطول كلمة فرعية في المفردات، ثم يستمر في الباقي. يتم تمييز القطع المستمرة داخل الكلمة ببادئة "##"، لذلك تصبح كلمة "playing" "play" + "##ing". يؤدي هذا إلى حل مشكلة عدم وجود مفردات: الكلمات النادرة أو غير المرئية تتحلل ببساطة إلى أجزاء معروفة، وصولاً إلى أحرف مفردة إذا لزم الأمر، بينما تظل الكلمات الشائعة كرموز فردية لتحقيق الكفاءة.

البصيرة الفنية

يختلف WordPiece عن تشفير Byte-Pair في معيار الدمج الخاص به. يقوم BPE بدمج الزوج المجاور الأكثر شيوعًا؛ يقوم WordPiece بدمج الزوج الذي يزيد من احتمالية بيانات التدريب، ويختار تقريبًا الزوج الذي يتجاوز تردده المشترك حاصل ضرب ترددات أجزائه. تعمل العلامة "##" على تمييز الأجزاء التي تبدأ بالكلمة عن الامتدادات، مما يسمح للرمز المميز بإعادة بناء حدود الكلمات بشكل لا لبس فيه عند فك التشفير مرة أخرى إلى النص.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل ترميز WordPiece

تفضل نماذج اللغات الكبيرة الأحدث بشكل متزايد BPE على مستوى البايت (عائلة GPT) أو نماذج SentencePiece unigram، والتي تتجنب المعالجة المسبقة الخاصة باللغة وتتعامل مع أي إدخال Unicode. يظل WordPiece أساسيًا في برامج التشفير المشتقة من BERT والتي لا تزال منتشرة على نطاق واسع للبحث والتصنيف. نتوقع استمرار الاستخدام في إنتاج البرمجة اللغوية العصبية (NLP)، جنبًا إلى جنب مع البحث في نماذج البايت والأحرف الخالية من الرموز المميزة والتي قد تقلل في النهاية الاعتماد على مفردات الكلمات الفرعية الثابتة تمامًا.

التنفيذ في العالم الحقيقي

يقوم BERT بترميز استعلامات البحث في Google البحث، وتقسيم المصطلحات غير المألوفة إلى كلمات فرعية بحيث يظل النموذج مطابقًا للصفحات ذات الصلة.

يستخدم BertTokenizer من Hugging Face WordPiece لتحويل النص الخام إلى معرفات الرمز المميز التي يتم تغذيتها إلى BERT لتحليل المشاعر والتعرف على الكيان المسمى.

يستخدم BERT متعدد اللغات مفردات WordPiece مشتركة عبر أكثر من 100 لغة، مما يسمح بإعادة استخدام الأجزاء عبر البرامج النصية ذات الصلة.

ترث متغيرات DistilBERT وBERT السريرية/الطبية الحيوية WordPiece، وتتعامل مع المصطلحات الطبية النادرة مثل "تغبر الرئة" عن طريق تقسيمها إلى أجزاء معروفة.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the WordPiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

ترميز الكلمات الفرعية

الأسئلة المتداولة

What is WordPiece Tokenization?

WordPiece هي خوارزمية ترميز الكلمات الفرعية التي تعمل على تشغيل BERT والعديد من نماذج Google، وتقسيم الكلمات إلى أجزاء قابلة لإعادة الاستخدام حتى يتمكن النموذج من التعامل مع أي نص باستخدام مفردات ثابتة. ولهذا السبب فإن النموذج الذي لم يسبق له رؤية "التعاسة" لا يزال بإمكانه فهمها من خلال قراءة "un" و"##happy" و"##ness".

ما الذي تشير إليه البادئة "##" في مخرجات WordPiece؟

يقوم WordPiece بوضع علامة على استمرارات الكلمات الفرعية بـ "##"، لذلك يصبح "playing" "play" + "##ing"، مما يسمح لجهاز فك التشفير بإعادة بناء حدود الكلمات.

ما هو حجم مفردات WordPiece التي يستخدمها BERT الأصلي تقريبًا؟

يستخدم BERT مفردات WordPiece لما يقرب من 30.000 وحدة كلمات فرعية، مما يوازن بين التغطية وحجم جدول التضمين.

كيف يختلف معيار دمج WordPiece عن تشفير Byte-Pair القياسي؟

يقوم BPE بدمج الزوج المجاور الأكثر شيوعًا، بينما يقوم WordPiece بدمج الزوج الذي يزيد من احتمالية المجموعة، ويفضل الأزواج التي يتجاوز ترددها المشترك منتج أجزائها.

كيف يتعامل WordPiece مع كلمة لم يسبق لها مثيل أثناء التدريب؟

يتم تقسيم الكلمات غير المرئية إلى أطول الكلمات الفرعية المعروفة المتطابقة، والعودة إلى أحرف مفردة، مما يحل مشكلة عدم وجود مفردات.

في وقت الاستدلال، كيف يختار WordPiece كيفية تقسيم الكلمة؟

يرمز WordPiece بجشع، ويطابق أطول إدخال للمفردات بدءًا من الموضع الحالي، ثم يكرر الباقي.