نماذج مسودة فك التشفير التأملية
يستخدم فك التشفير التخميني نموذج "مسودة" صغير وسريع لتخمين العديد من الرموز المميزة القادمة التي يتحقق منها النموذج الكبير بعد ذلك في مسار واحد.
نظرة عامة
It speeds up text generation 2-3x with no change to the output.
الغوص العميق
تولد نماذج اللغات الكبيرة نصًا مميزًا واحدًا في كل مرة، وتتطلب كل خطوة تمريرًا أماميًا كاملاً عبر مليارات المعلمات - بطيئة ومرتبطة بالذاكرة. يهاجم فك التشفير التأملي هذا عن طريق إقران النموذج "الهدف" الكبير بنموذج "المسودة" الرخيص. تقترح مسودة النموذج بسرعة مجموعة من 4 إلى 8 رموز مرشحة، على سبيل المثال. يقوم النموذج الكبير بعد ذلك بمعالجة كل هذه العناصر في تمريرة أمامية متوازية واحدة والتحقق من كل واحدة منها. يتم قبول الرموز المميزة التي تطابق ما كان سينتجه النموذج الكبير؛ يتم تصحيح عدم التطابق الأول وتجاهل الباقي. نظرًا لأن التحقق من عدة رموز مميزة في وقت واحد يكلف تقريبًا نفس تكلفة إنشاء رمز واحد، فإن عمليات التشغيل المقبولة تكون مجانية تقريبًا. والأهم من ذلك، أن خطوة أخذ عينات الرفض تضمن أن يكون التوزيع النهائي مطابقًا لتشغيل النموذج الكبير وحده - أي السرعة دون فقدان الجودة.
البصيرة الفنية
الحيلة الأساسية هي اختبار أخذ عينات الرفض المعدل. بالنسبة لكل رمز مميز تمت صياغته، تتم مقارنة احتمالية النموذج المستهدف مع احتمالية مسودة النموذج. إذا كان الهدف يعين احتمالًا مساويًا أو أعلى، فسيتم قبول الرمز المميز؛ وإلا يتم قبوله باحتمال يساوي النسبة، وعند الرفض يتم أخذ عينة من الرمز المميز المصحح من التوزيع المتبقي المعدل. هذه الرياضيات تجعل المخرجات مكافئة لأخذ العينات مباشرة من النموذج الكبير.
التأثير الاستراتيجي
السرعة والحجم
يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.
الوصول والوصول
فهو يوسع الوصول عبر اللغات وأنماط الاتصال.
قرارات أوضح
يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.
مستقبل نماذج مسودة فك التشفير التأملية
توقع أن تصبح نماذج المسودة بنية تحتية قياسية في خوادم الاستدلال مثل vLLM وTensorRT-LLM. تقوم متغيرات التخمين الذاتي (Medusa، EAGLE) بإسقاط نموذج المسودة المنفصل بالكامل عن طريق إضافة رؤوس تنبؤ خفيفة الوزن، وتتحقق الصياغة المبنية على الشجرة من استمرارية العديد من المرشحين في وقت واحد. ومع نمو نوافذ السياق وهيمنة تكاليف الخدمة، فإن القائمين على الصياغة الأكثر ذكاءً والمطابقة للنماذج والتحقق من الأجهزة سيدفعون معدلات القبول والإنتاجية إلى أعلى.
التنفيذ في العالم الحقيقي
يستخدم Anthropic وOpenAI وGoogle فك التشفير التخميني لخفض زمن الاستجابة وتكلفة العرض على مساعدي الدردشة الذين يخدمون ملايين المستخدمين.
vLLM وNVIDIA TensorRT-LLM يقدمان فك تشفير تخميني مدمج حتى يتمكن المضيفون الذاتيون من تسريع عمليات نشر Llama أو Mistral.
إقران نموذج مسودة 7B مع هدف 70B (على سبيل المثال، عائلة Llama-3) لمضاعفة الرموز المميزة تقريبًا في الثانية على وحدة معالجة رسومات واحدة.
تستخدم أدوات إكمال التعليمات البرمجية نموذج مسودة صغير لاقتراح نموذج معياري يتحقق منه النموذج الأكبر، مما يجعل الاقتراحات سريعة في المحرر.
المخاطر والدرابزين
يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.
يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.
قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.
خارطة طريق التنفيذ
حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.
استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.
احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.
تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Speculative Decoding Draft Models quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
التعديلات التأملية لنماذج التعليمات البرمجية
الأسئلة المتداولة
What is Speculative Decoding Draft Models?
يستخدم فك التشفير التخميني نموذج "مسودة" صغير وسريع لتخمين العديد من الرموز المميزة القادمة التي يتحقق منها النموذج الكبير بعد ذلك في مسار واحد. إنه يسرع عملية إنشاء النص 2-3x دون أي تغيير في الإخراج.
ما هو الدور الأساسي لنموذج "المسودة" في فك التشفير التأملي؟
يخمن نموذج المسودة الصغيرة الرموز المميزة القادمة بتكلفة زهيدة، والتي يتحقق منها النموذج المستهدف الكبير بعد ذلك في تمريرة متوازية واحدة.
لماذا يؤدي التحقق من الرموز المميزة المتعددة في وقت واحد إلى توفير الوقت؟
الجيل مرتبط بالذاكرة. يعد التحقق من عدة رموز مميزة في تمريرة واحدة مجمعة تقريبًا رخيصًا مثل خطوة واحدة، لذا فإن عمليات التشغيل المقبولة تكون مجانية تقريبًا.
ماذا يحدث للرموز المميزة التي تمت صياغتها بعد الرمز المميز الأول الذي يرفضه النموذج المستهدف؟
ويستمر القبول حتى الخلاف الأول؛ يتم تصحيح هذا الرمز المميز ويتم التخلص من جميع الرموز المميزة التي تمت صياغتها لاحقًا.
كيف يضمن فك التشفير التخميني عدم تدهور جودة الإخراج؟
يضمن اختبار أخذ عينات الرفض المعدل أن التوزيع النهائي للرمز المميز يطابق أخذ العينات مباشرة من النموذج المستهدف.
أي مما يلي يعد نهج "التكهن الذاتي" الذي يتجنب مسودة نموذج منفصل؟
تضيف Medusa وEAGLE رؤوس تنبؤ إضافية خفيفة الوزن إلى النموذج الرئيسي حتى تتمكن من صياغة الرموز المستقبلية الخاصة بها.