دليل اللغة AI

ترميز الكلمات الفرعية

يؤدي ترميز الكلمات الفرعية إلى تقسيم النص إلى وحدات أصغر من الكلمات ولكنها أكبر من الأحرف، مثل "الرمز المميز" بالإضافة إلى "التحويل".

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the standard way modern language models turn text into the discrete IDs they actually process, balancing vocabulary size against meaning.

الغوص العميق

الكلمات كثيرة جدًا بحيث لا يمكن تعدادها (المفردات ستكون هائلة وتفتقد الكلمات النادرة)، في حين أن الأحرف الفردية تحمل القليل من المعنى وتجعل التسلسلات طويلة جدًا. إن ترميز الكلمات الفرعية هو الحل الوسط: فهو يحافظ على الكلمات المتكررة كاملة ولكنه يقسم الكلمات النادرة أو المعقدة إلى أجزاء ذات معنى. "التعاسة" قد تصبح "غير"، "سعيد"، "نيس". تتضمن الخوارزميات الرئيسية تشفير Byte-Pair (المستخدم بواسطة GPT)، وWordPiece (المستخدم بواسطة BERT)، وUnigram/SentencePiece (المستخدم بواسطة T5 والعديد من النماذج متعددة اللغات). يتعامل هذا الأسلوب مع الكلمات غير المرئية بأمان، ويشارك الأجزاء عبر الكلمات ذات الصلة ("تشغيل"، "تشغيل"، "تشغيل")، ويدعم أي لغة. يتم تعيين كل جزء إلى معرف عدد صحيح، وهذه المعرفات هي ما تحوله طبقة تضمين النموذج إلى متجهات.

البصيرة الفنية

تختار الخوارزميات المختلفة الكلمات الفرعية بشكل مختلف: يقوم BPE بدمج الأزواج المتكررة من الأسفل إلى الأعلى، ويختار WordPiece عمليات الدمج التي تزيد من احتمالية المجموعة، ويبدأ Unigram بمفردات كبيرة ورموز مميزة أقل ضررًا على الاحتمالية. يقوم WordPiece بوضع علامات على الأجزاء الداخلية من الكلمات باستخدام البادئة "##"، بينما يتعامل SentencePiece مع المسافات كرمز خاص بحيث يعمل مباشرة على النص الخام دون تقسيم مسبق على مسافات بيضاء، وهو مثالي للغات التي لا تحتوي على مسافات.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل ترميز الكلمات الفرعية

سيظل ترميز الكلمات الفرعية هو السائد لأنه سريع ومضغوط، ولكن نقاط ضعفه، والانقسامات غير الملائمة في الرياضيات، والتعليمات البرمجية، والنصوص النادرة، بالإضافة إلى تكاليف الرمز المميز غير المتساوية عبر اللغات، تدفع البحث إلى نماذج على مستوى البايت وخالية من الرموز المميزة. توقع وجود رموز مميزة أكثر ذكاءً، وربما متعلمة أو قابلة للتكيف، وعدالة أفضل متعددة اللغات، بحيث لا تتم معاقبة النص غير الإنجليزي بمزيد من الرموز المميزة لكل جملة.

التنفيذ في العالم الحقيقي

يستخدم BERT ترميز WordPiece، ووضع علامات على الأجزاء المستمرة مثل '##ing' لإعادة بناء الكلمات الأصلية.

يستخدم T5 والعديد من النماذج متعددة اللغات SentencePiece، الذي يتعامل مباشرة مع اللغات التي لا تحتوي على مسافات مثل اليابانية.

تقوم نماذج الدردشة بتقسيم مصطلح تقني نادر إلى أجزاء معروفة بدلاً من الفشل في كلمة غير معروفة.

تتشارك أدوات الرموز المميزة كلمات فرعية عبر "تشغيل" و"تشغيل" و"عداء"، مما يسمح للنموذج بتعميم الشكل بكفاءة.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Subword Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الأسئلة المتداولة

What is Subword Tokenization?

يؤدي ترميز الكلمات الفرعية إلى تقسيم النص إلى وحدات أصغر من الكلمات ولكنها أكبر من الأحرف، مثل "الرمز المميز" بالإضافة إلى "التحويل". إنها الطريقة القياسية التي تحول بها نماذج اللغة الحديثة النص إلى معرفات منفصلة تقوم بمعالجتها بالفعل، مما يؤدي إلى موازنة حجم المفردات مع المعنى.

ما المشكلة التي يحلها ترميز الكلمات الفرعية مقارنة باستخدام الكلمات الكاملة؟

مفردات الكلمات الكاملة ضخمة ولا تزال تفتقد الكلمات النادرة؛ الكلمات الفرعية تجعل المفردات قابلة للإدارة وتقسم الكلمات غير المعروفة بأمان.

أي من هذه هي خوارزمية ترميز الكلمات الفرعية التي يستخدمها BERT؟

يستخدم BERT WordPiece، الذي يختار عمليات الدمج التي تزيد من احتمالية مجموعة التدريب.

كيف يقوم WordPiece عادةً بوضع علامة على القطعة التي تحتوي على كلمة؟

WordPiece يبدأ الكلمات الفرعية الداخلية للكلمة بـ "##"، لذلك تصبح كلمة "playing" "play" بالإضافة إلى "##ing".

لماذا يعتبر SentencePiece مناسبًا تمامًا للغات مثل اليابانية؟

يعمل SentencePiece على النص الخام ويقوم بتشفير المسافات كرمز خاص، لذلك فهو يعمل حتى بدون وجود مسافات بين الكلمات.

ما الذي يعينه كل جزء من الكلمات الفرعية في النهاية قبل الوصول إلى النموذج؟

يتم تعيين معرف عدد صحيح لكل كلمة فرعية، والذي تحوله طبقة التضمين إلى متجه يمكن للنموذج معالجته.