دليل اللغة AI

ترميز SentencePiece

SentencePiece عبارة عن أداة رمزية لا تعتمد على اللغة وتتعلم كيفية تقسيم النص الخام إلى أجزاء من الكلمات الفرعية مباشرةً من البيانات، دون الاعتماد على المسافات.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It made multilingual models far easier to build by treating any language the same way.

الغوص العميق

تفترض معظم أدوات الرموز المميزة أن الكلمات مفصولة بمسافات، وهو ما يفصل بين اللغات مثل اليابانية أو الصينية أو التايلاندية التي لا تستخدمها. تتجنب SentencePiece، التي أصدرتها Google في عام 2018، هذا من خلال التعامل مع الإدخال كتدفق أولي من الأحرف - بما في ذلك المسافات - وتعلم مفردات وحدات الكلمات الفرعية من البيانات نفسها. من المعروف أنه يستبدل المسافات بعلامة مرئية (رمز تعريف يشبه الشرطة السفلية) بحيث يكون الترميز قابلاً للعكس تمامًا: يمكنك دائمًا إعادة بناء النص الأصلي بالضبط. يدعم SentencePiece خوارزميتين رئيسيتين، تشفير زوج البايت (BPE) ونموذج لغة Unigram، والأخير هو طريقة التوقيع الخاصة به. نظرًا لأنه لا يحتاج إلى ترميز مسبق خاص باللغة، فإن نفس المسار يعمل عبر مئات اللغات، ولهذا السبب تعتمد عليه نماذج مثل T5 وALBERT والعديد من الأنظمة متعددة اللغات.

البصيرة الفنية

تبدأ خوارزمية Unigram الخاصة بـ SentencePiece بمفردات مرشحة كبيرة وتقوم بشكل متكرر بتقليم القطع التي تساهم بشكل أقل في احتمالية مجموعة التدريب، وذلك باستخدام إجراء تعظيم التوقع. تتيح علامة المساحة المرئية (الرمز التعريفي) إمكانية ترميزها وإلغاء ترميزها دون خسارة. ويمكنه أيضًا العمل على مستوى البايت، مما يضمن أن أي حرف - حتى الرموز التعبيرية أو النصوص البرمجية غير المرئية - يمكن تمثيله دون فشل في المفردات.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل ترميز SentencePiece

تظل SentencePiece بمثابة العمود الفقري للنماذج متعددة اللغات والنماذج البرمجية بسبب قابليتها للعكس وحيادها اللغوي. يستكشف هذا المجال تدريجيًا أساليب مستوى البايت والخالية من الرموز المميزة التي تتخطى مفردات الكلمات الفرعية تمامًا، بهدف إزالة مراوغات الترميز التي تضر بالحسابات واللغات النادرة والأرقام الطويلة. ومع ذلك، تستمر تصميمات Unigram وbyte الاحتياطية من SentencePiece في التأثير على الرموز المميزة الأحدث، وستظل فلسفتها التي لا تفقد البيانات والتي تعتمد على التدريب من النص الخام أساسية في المستقبل القريب.

التنفيذ في العالم الحقيقي

نموذج T5 الخاص بـ Google، والذي يستخدم مفردات SentencePiece المدربة على نص الويب متعدد اللغات.

ترميز النص الياباني أو الصيني الذي لا يحتوي على مسافات بين الكلمات، حيث تفشل الرموز المميزة المستندة إلى الكلمات.

بناء مفردات مشتركة واحدة عبر أكثر من 100 لغة لنظام ترجمة متعدد اللغات.

إعادة بناء المدخلات الأصلية (بما في ذلك التباعد) من الرموز المميزة دون فقد البيانات، وهو أمر مفيد لإنشاء التعليمات البرمجية عندما تكون المسافات البيضاء مهمة.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the SentencePiece Tokenization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

ترميز الكلمات الفرعية

الأسئلة المتداولة

What is SentencePiece Tokenization?

SentencePiece عبارة عن أداة رمزية لا تعتمد على اللغة وتتعلم كيفية تقسيم النص الخام إلى أجزاء من الكلمات الفرعية مباشرةً من البيانات، دون الاعتماد على المسافات. لقد جعل بناء النماذج متعددة اللغات أسهل بكثير من خلال التعامل مع أي لغة بنفس الطريقة.

ما هو الافتراض الرئيسي الذي تتجنبه SentencePiece والذي تعتمد عليه أدوات الرموز التقليدية؟

يتعامل SentencePiece مع الإدخال كتدفق أحرف خام، لذلك فهو يعمل حتى مع اللغات التي لا تحتوي على مسافات بين الكلمات.

لماذا تستبدل SentencePiece المسافات برمز التعريف المرئي؟

إن تشفير المسافات كعلامة مرئية يعني أنه يمكن دائمًا إعادة بناء النص الأصلي، بما في ذلك المسافات، تمامًا.

ما الخوارزميتين اللتين تدعمهما SentencePiece بشكل أساسي؟

تقدم SentencePiece تشفير Byte-Pair (BPE) ونموذج لغة Unigram، مع كون Unigram هي طريقة التوقيع الخاصة بها.

كيف يبني نموذج Unigram مفرداته؟

يبدأ Unigram بالعديد من القطع المرشحة ويزيل بشكل متكرر تلك التي تساهم بشكل أقل في احتمالية المجموعة باستخدام تعظيم التوقع.

ما النموذج الذي يستخدم رمز SentencePiece الشهير؟

يستخدم T5 الخاص بـ Google مفردات SentencePiece، كما يفعل ALBERT والعديد من النماذج متعددة اللغات.