الدليل الفني

تدفق المضاربة والتنبؤ بالرموز المتعددة

يعمل التدفق التأملي والتنبؤ متعدد الرموز على تسريع عملية إنشاء نموذج اللغة عن طريق تخمين العديد من الرموز المستقبلية في وقت واحد والتحقق منها في مسار واحد، بدلاً من إنتاج رمز مميز واحد في كل مرة.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

They cut latency without changing the text the model would have written.

الغوص العميق

يكون فك تشفير الانحدار الذاتي العادي بطيئًا لأن كل رمز يتطلب تمريرًا أماميًا كاملاً ويتم إنشاء الرموز المميزة بدقة واحدة تلو الأخرى، مما يترك وحدة معالجة الرسومات غير مستخدمة بشكل كافٍ. يعمل فك التشفير التأملي على إصلاح ذلك من خلال أداة صياغة رخيصة تقترح مجموعة من الرموز المميزة المرشحة، والتي يتحقق منها النموذج المستهدف الكبير بعد ذلك بالتوازي؛ يتم قبول أي بادئة تتطابق مع ما سينتجه الهدف مجانًا، ويتم تصحيح عدم التطابق الأول. يؤدي التدفق التأملي والتنبؤ متعدد الرموز على طراز ميدوسا إلى دمج أداة الصياغة في النموذج نفسه: تتيح رؤوس التنبؤ الإضافية خفيفة الوزن (أو مجموعة من الرموز المميزة للمضاربة) لنموذج واحد إمكانية الصياغة والتحقق، مع تجنب نموذج مسودة منفصل. نظرًا لأن التحقق دقيق، فإن توزيع المخرجات مطابق لفك التشفير القياسي، فأنت ببساطة تحصل على خطوات تسلسلية أقل بمقدار 2 إلى 3 مرات.

البصيرة الفنية

المفتاح هو أن المحول يمكنه تسجيل العديد من المواضع في تمريرة أمامية واحدة بسعر رخيص مثل واحد، لأنه مرتبط بعرض النطاق الترددي للذاكرة، وليس مرتبطًا بالحساب، أثناء فك التشفير. تقوم رؤوس التنبؤ المتعددة بإصدار رموز مرشحة للمناصب العديدة التالية؛ يتم التحقق من شجرة أو تسلسل المرشحين معًا، ويستخدم القبول أخذ عينات الرفض (أو المطابقة الجشعة) بحيث تتبع الرموز المقبولة التوزيع المستهدف الدقيق. الطول المقبول لكل خطوة يحدد السرعة.

التأثير الاستراتيجي

التكلفة والميزانية

تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.

قرارات أوضح

يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.

مراقبة الجودة

تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.

مستقبل تدفق المضاربة والتنبؤ بالرموز المتعددة

أصبحت أساليب التخمين الذاتي التي لا تحتاج إلى نموذج مسودة منفصل هي الطريقة الافتراضية في محركات الاستدلال، وتدفع الأبحاث معدلات القبول إلى أعلى مع رؤوس مسودة أفضل، ومرشحين منظمين على شكل شجرة، وتدريب النموذج الأساسي بشكل مشترك للتنبؤ متعدد الرموز (والذي يمكن أن يؤدي أيضًا إلى تحسين الجودة). توقع أن تتحد هذه التقنيات مع التكميم والتجميع بحيث يشعر المساعدون التفاعليون بالفورية حتى مع نمو النماذج.

التنفيذ في العالم الحقيقي

تقليل زمن استجابة مساعد الدردشة بمقدار 2 إلى 3x باستخدام رؤوس التنبؤ الإضافية على طراز ميدوسا

إضافة فك تشفير التخمين الذاتي إلى خادم الاستدلال بحيث لا يلزم استضافة نموذج مسودة منفصل

تسريع إكمال التعليمات البرمجية حيث يتم قبول تشغيل الرموز المميزة الطويلة والمتوقعة في أجزاء كبيرة

تقليل تكلفة وحدة معالجة الرسومات لكل طلب عن طريق استخراج المزيد من الرموز المميزة من كل تمريرة أمامية مرتبطة بالذاكرة

المخاطر والدرابزين

يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.

غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.

يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.

خارطة طريق التنفيذ

1

تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.

2

المعيار في ظل ظروف التحميل والبيانات الواقعية.

3

مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.

4

قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Speculative Streaming and Multi-Token Prediction quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

التدريب على التنبؤ بالرموز المتعددة

الأسئلة المتداولة

What is Speculative Streaming and Multi-Token Prediction?

يعمل التدفق التأملي والتنبؤ متعدد الرموز على تسريع عملية إنشاء نموذج اللغة عن طريق تخمين العديد من الرموز المستقبلية في وقت واحد والتحقق منها في مسار واحد، بدلاً من إنتاج رمز مميز واحد في كل مرة. لقد قاموا بقطع زمن الوصول دون تغيير النص الذي كان النموذج سيكتبه.

لماذا غالبًا ما يكون فك تشفير الانحدار التلقائي القياسي بطيئًا على وحدة معالجة الرسومات؟

يحتاج كل رمز مميز إلى تمرير أمامي خاص به، وتكون متسلسلة بشكل صارم، وبالتالي فإن وحدة معالجة الرسومات مرتبطة بعرض النطاق الترددي للذاكرة ولا يتم استغلالها بشكل كافٍ أثناء فك التشفير.

ماذا يفعل "الصياغة" في فك التشفير التأملي؟

يقترح مُحرر رخيص مجموعة كبيرة من الرموز المميزة التي يتحقق منها النموذج المستهدف الكبير بالتوازي.

كيف يتم الحفاظ على جودة الإخراج في فك التشفير التخميني؟

يضمن التحقق (المطابقة الجشعة أو أخذ عينات الرفض) أن تتبع الرموز المميزة المقبولة التوزيع الدقيق الذي كان من الممكن أن ينتجه النموذج المستهدف، لذلك لا يتغير الإخراج.

ما الذي يميز التنبؤ متعدد الرموز على طراز ميدوسا عن فك التشفير التأملي الكلاسيكي؟

تُدمج الأساليب على طراز ميدوسا الصياغة في النموذج برؤوس تنبؤ إضافية، مما يتجنب الحاجة إلى استضافة مسودة نموذج منفصلة.

لماذا يمكن للمحول التحقق من العديد من المواضع المرشحة بتكلفة زهيدة تقريبًا مثل تلك الموجودة أثناء فك التشفير؟

أثناء فك التشفير، يؤدي عنق الزجاجة إلى نقل الأوزان من الذاكرة، لذا فإن تسجيل مواضع إضافية في نفس المسار يضيف تكلفة حسابية قليلة.