دليل اللغة AI

التدريب على التنبؤ بالرموز المتعددة

بدلاً من التنبؤ بالرمز المميز التالي فقط، يتم تدريب النموذج على التنبؤ بعدة رموز مستقبلية في وقت واحد.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

This sharpens learning signals and unlocks faster inference through self-speculative decoding.

الغوص العميق

يتم تدريب نماذج اللغة القياسية على التنبؤ بالرمز المميز التالي: في ظل السياق، توقع الرمز المميز التالي. يضيف التنبؤ متعدد الرموز (MTP)، الذي تم نشره بواسطة ورقة Meta لعام 2024 وتم اعتماده في DeepSeek-V3، رؤوس إخراج إضافية خفيفة الوزن بحيث يتنبأ النموذج في الوقت نفسه بالرمز المميز التالي بالإضافة إلى الرموز المميزة الثانية والثالثة والرابعة للأمام من نفس الحالة المخفية. وهذا يجبر الشبكة على التخطيط بشكل أكبر للمستقبل وتكثيف إشارة التدريب - حيث يساهم كل منصب الآن بفترات خسارة متعددة. سجلت Meta مكاسب كبيرة بشكل خاص في البرمجة والتفكير التوليدي، مع استفادة النماذج الأكبر حجمًا بشكل أكبر. والأهم من ذلك، أنه يمكن التخلص من الرؤوس الإضافية بعد التدريب، لذلك لا يلزم زيادة حجم النموذج عند النشر.

البصيرة الفنية

يقوم MTP بإرفاق عدد n من رؤوس التنبؤ المستقلة أعلى صندوق المحول المشترك؛ يتنبأ الرأس k بالرمز المميز في الموضع t+k من التمثيل في الموضع t. يتم تلخيص الخسائر أثناء التدريب. عند الاستدلال، تتيح الرؤوس المساعدة فك التشفير الذاتي: يقترح النموذج عدة رموز مميزة في مسار واحد، ثم يتحقق منها، مما يحقق توليدًا أسرع بما يصل إلى 3x تقريبًا دون تغيير توزيع المخرجات.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل التدريب على التنبؤ متعدد الرموز

أصبح MTP مكونًا افتراضيًا في وصفات التدريب الحدودية لأنه يعمل على تحسين الجودة وسرعة الاستدلال بتكلفة قليلة. توقع تكاملًا أكثر إحكامًا مع فك التشفير التخميني، وآفاق تنبؤ أعمق، واستخدامه كهدف مساعد يعمل على تحسين التخطيط طويل الأفق. إلى جانب نماذج الاستدلال، فإن التنبؤ بخطوات متعددة للأمام قد يساعد النماذج على محاكاة العواقب داخليًا قبل الالتزام بالإجابة.

التنفيذ في العالم الحقيقي

يستخدم DeepSeek-V3 هدف MTP أثناء التدريب المسبق لتعزيز كفاءة البيانات وتمكين فك التشفير التخميني

تعرض نماذج إنشاء التعليمات البرمجية الخاصة بـ Meta مكاسب الدقة في HumanEval وMBPP من التنبؤ برموز مميزة متعددة

فك التشفير الذاتي: صياغة 3-4 رموز مميزة لكل تمريرة أمامية ثم التحقق من الحصول على مخرجات أسرع والحفاظ على التوزيع

إكمال تلقائي أسرع في مساعدي الترميز حيث يتم اقتراح العديد من الرموز المميزة والتحقق منها في خطوة واحدة

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Multi-Token Prediction Training quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تدفق المضاربة والتنبؤ بالرموز المتعددة

الأسئلة المتداولة

What is Multi-Token Prediction Training?

بدلاً من التنبؤ بالرمز المميز التالي فقط، يتم تدريب النموذج على التنبؤ بعدة رموز مستقبلية في وقت واحد. يؤدي ذلك إلى زيادة حدة إشارات التعلم وفتح الاستدلال بشكل أسرع من خلال فك التشفير الذاتي.

ما الذي يضيفه التنبؤ متعدد الرموز مقارنة بالتدريب القياسي للرموز المميزة التالية؟

يضيف MTP رؤوس إخراج إضافية بحيث يتنبأ النموذج بالرمز المميز التالي بالإضافة إلى عدة رموز مميزة للأمام من حالة مخفية واحدة.

ما النموذج الذي استخدم بشكل خاص هدف التنبؤ متعدد الرموز في التدريب المسبق؟

اعتمد DeepSeek-V3 هدف تدريب MTP لتحسين كفاءة البيانات وتمكين فك التشفير التخميني.

لماذا يقوم MTP بتكثيف إشارة التدريب؟

التنبؤ بعدة رموز مستقبلية يعني أن كل موضع رمز مميز ينتج عنه العديد من خسائر التنبؤ، مما يعطي المزيد من إشارات التعلم لكل رمز مميز.

ما فائدة الاستدلال التي تتيحها رؤوس التنبؤ الإضافية؟

يمكن للرؤوس المساعدة صياغة رموز متعددة لكل تمريرة يتم التحقق منها بعد ذلك، مما يؤدي إلى تسريع عملية الإنشاء دون تغيير توزيع المخرجات.

ماذا يحدث للرؤوس المساعدة بعد التدريب إذا لم تكن بحاجة إلى عمليات تسريع؟

الرؤوس الإضافية اختيارية عند النشر؛ يؤدي التخلص منها إلى إبقاء النموذج بنفس حجم نموذج الرمز المميز التالي القياسي.