فك التشفير التخميني
يؤدي فك التشفير التأملي إلى جعل نماذج اللغة الكبيرة تولد النص بشكل أسرع باستخدام نموذج "مسودة" صغير وسريع لتخمين العديد من الرموز المميزة، ثم جعل النموذج الكبير يتحقق منها جميعًا مرة واحدة.
نظرة عامة
It speeds up inference 2-3x with identical output quality.
الغوص العميق
عادةً ما يُنشئ LLM رمزًا نصيًا واحدًا في كل مرة: يتطلب كل رمز تمريرًا أماميًا كاملاً عبر النموذج العملاق، ولا يمكنك بدء الرمز التالي حتى ينتهي النموذج الحالي. يعد هذا بطيئًا لأنه مرتبط بالذاكرة، وليس مرتبطًا بالحساب - حيث تقضي وحدة معالجة الرسومات معظم وقتها في تحميل الأوزان، وليس إجراء العمليات الحسابية. فك التشفير التأملي يكسر عنق الزجاجة. يقترح نموذج مسودة صغير ورخيص جزءًا من خمسة رموز مرشحة، على سبيل المثال. يقوم نموذج "الهدف" الكبير بعد ذلك بمعالجة الخمسة جميعًا في تمريرة أمامية متوازية واحدة والتحقق منها. يتم قبول الرموز المميزة التي تطابق ما كان سيتم إنتاجه؛ في الخلاف الأول يصحح ويتجاهل الباقي. نظرًا لأن تكلفة التحقق من العديد من الرموز المميزة تعادل تكلفة إنشاء واحدة تقريبًا، فإن التخمينات المقبولة تكون مجانية تقريبًا.
البصيرة الفنية
الجزء الذكي هو قاعدة أخذ عينات الرفض التي تضمن أن يكون توزيع المخرجات مطابقًا رياضيًا لتشغيل النموذج المستهدف وحده - لذلك لا يتم تقريب الجودة، إنها دقيقة. يؤدي معدل القبول إلى زيادة السرعة: كلما كان النموذج الصغير يتنبأ بالنموذج الكبير بشكل أفضل، زاد عدد الرموز المميزة في كل خطوة تحقق. تضيف المتغيرات مثل Medusa رؤوس تنبؤ إضافية إلى النموذج المستهدف نفسه، وتقوم EAGLE بالصياغة في مساحة الميزات، مما يلغي الحاجة إلى مسودة نموذج منفصلة.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل فك التشفير المضاربة
أصبح فك التشفير التخميني هو الوضع الافتراضي في خدمة الحزم المكدسة مثل vLLM وTensorRT-LLM. توقع أن تهيمن أساليب الصياغة الذاتية (Medusa، EAGLE، Lookahead) لأنها تتجنب الحفاظ على نموذج ثانٍ، بالإضافة إلى التكهنات المستندة إلى الشجرة التي تتحقق من الفروع المرشحة المتعددة في كل خطوة. مع نمو النماذج، يزداد عنق الزجاجة المرتبط بالذاكرة سوءًا، مما يجعل المضاربة أكثر قيمة، وسيعمل المصممون المدركون للأجهزة على دفع عمليات التسريع في العالم الحقيقي إلى مستوى أعلى.
التنفيذ في العالم الحقيقي
نموذج مسودة 7B يقترح الرموز المميزة لنموذج الدردشة 70B لتقليل زمن الاستجابة في مساعد الإنتاج
تم تثبيت رؤوس Medusa على LLM بحيث تتنبأ بالعديد من الرموز المستقبلية في وقت واحد دون الحاجة إلى نموذج مسودة منفصل
يتيح vLLM فك التشفير التخميني لزيادة إنتاجية الرموز المميزة في الثانية على مجموعة الخدمة
تقوم EAGLE بصياغة مساحة الميزات المخفية للنموذج لتعزيز معدل القبول والسرعة الإجمالية
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
فك التشفير التخميني باستخدام EAGLE
الأسئلة المتداولة
What is Speculative Decoding?
يؤدي فك التشفير التأملي إلى جعل نماذج اللغة الكبيرة تولد النص بشكل أسرع باستخدام نموذج "مسودة" صغير وسريع لتخمين العديد من الرموز المميزة، ثم جعل النموذج الكبير يتحقق منها جميعًا مرة واحدة. إنه يسرع الاستدلال 2-3x بجودة إخراج متطابقة.
ما هي الفكرة الأساسية لفك التشفير المضاربة؟
يقترح نموذج المسودة السريعة رموزًا متعددة، ويقوم النموذج المستهدف الكبير بفحصها جميعًا في مسار متوازي واحد.
لماذا يكون إنشاء LLM العادي لرمز مميز واحد في كل مرة بطيئًا؟
تقوم كل خطوة بشكل أساسي بتحميل مصفوفات الوزن الضخمة من الذاكرة بدلاً من إجراء عمليات حسابية ثقيلة، لذلك لا يتم استخدام وحدة معالجة الرسومات بشكل كافٍ.
ماذا يحدث عند الرمز الأول عندما تختلف المسودة والنماذج المستهدفة؟
يتم قبول الرموز المميزة حتى الخلاف؛ بدءًا من عدم التطابق فصاعدًا، يتم رفضها ويتم الاحتفاظ بالرمز المميز الصحيح للنموذج المستهدف.
كيف يؤثر فك التشفير التخميني على جودة الإخراج؟
تضمن قاعدة أخذ العينات الرفضية أن التوزيع النهائي يتطابق تمامًا مع النموذج المستهدف، وبالتالي لا تتغير الجودة.
ما الذي يحدد بشكل مباشر سرعة فك التشفير التخميني؟
كلما زاد عدد الرموز المميزة التي يقبلها النموذج المستهدف لكل خطوة تحقق، زادت السرعة.