SmoothQuant وتنشيط الكمي
SmoothQuant هي تقنية تجعل من الممكن ضغط نماذج اللغة الكبيرة إلى أعداد صحيحة 8 بت لكل من الأوزان والتنشيطات دون إعادة التدريب.
نظرة عامة
It matters because activations in big models contain extreme outliers that normally wreck low-precision math, and SmoothQuant tames them.
الغوص العميق
عندما تقوم بتقليص نموذج من أعداد صحيحة ذات 16 بت إلى أعداد صحيحة ذات 8 بت، يتم ضغط الأوزان بسهولة ولكن عمليات التنشيط تمثل مشكلة: بعض القنوات تحمل قيمًا أكبر من 10 إلى 100 مرة من البقية، وإجبارها على شبكة أعداد صحيحة خشنة يدمر الدقة. SmoothQuant، قدمه شياو وآخرون. في عام 2022، لاحظ أن الأوزان سلسة وسهلة القياس بينما تكون عمليات التنشيط شائكة. لذا فهو ينقل الصعوبة رياضيًا: فهو يقسم قنوات التنشيط على مقياس لكل قناة ويضرب الأوزان المقابلة بنفس المقياس. يتم إلغاء العمليتين، مما يترك مخرجات النموذج دون تغيير، ولكن الآن يقع كلا الموتدين في نطاقات ودية. والنتيجة هي استنتاج W8A8 (أوزان وتنشيطات 8 بت) مع فقدان دقة يقترب من الصفر وتسريع بمعدل 2x تقريبًا وتوفير في الذاكرة.
البصيرة الفنية
الحيلة الأساسية هي عامل تجانس لكل قناة يتم حسابه كـ s = max(|X|)^alpha / max(|W|)^(1-alpha). يتم قياس التنشيط بمقدار 1/s والأوزان بمقدار s، لذلك يتم الحفاظ على منتج المصفوفة XW. نظرًا لأن القياس يتم استيعابه دون اتصال بالإنترنت في أوزان الطبقة السابقة أو في عملية مدمجة، فإنه يضيف تكلفة وقت تشغيل صفر. يتحكم معامل ألفا الفائق (غالبًا 0.5) في مقدار العبء الخارجي الذي ينتقل من التنشيط إلى الأوزان.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل SmoothQuant وتنشيط الكمي
أثبتت SmoothQuant أن القيم المتطرفة للتنشيط قابلة للترحيل وليست حتمية، وهذه الفكرة تدعم الآن خدمة الإنتاج INT8 وFP8. توقع أن يتم دمج التجانس مع المخططات الدقيقة مثل التكميم لكل مجموعة، والقياس المتعلم، وأبحاث التنشيط ذات 4 بت (على سبيل المثال، الأساليب الخارجية). مع نضوج أجهزة FP8 (Hopper، Blackwell)، سيستمر دمج موازنة أسلوب التجانس في خطوط أنابيب المترجم ومحرك الاستدلال بحيث يظل التكميم مجانيًا تقريبًا.
التنفيذ في العالم الحقيقي
تقديم LLM بمعلمة 70B في W8A8 على عدد أقل من وحدات معالجة الرسومات عن طريق خفض تكلفة الذاكرة ومضاعفة المصفوفة إلى النصف
تمكين استنتاج INT8 على نوى موتر NVIDIA Hopper/Blackwell التي تعمل أصلاً على تسريع العمليات الرياضية ذات الأعداد الصحيحة 8 بت
نشر نماذج الدردشة على نقاط نهاية سحابية محدودة التكلفة حيث تؤدي مضاعفة الإنتاجية إلى خفض فاتورة كل رمز بشكل مباشر
ضغط محولات التشفير للكلام أو الترجمة على الجهاز حيث تعمل نواة 8 بت بشكل أسرع وأكثر برودة
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the SmoothQuant and Activation Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
هندسة توجيه التنشيط والتمثيل
الأسئلة المتداولة
What is SmoothQuant and Activation Quantization?
SmoothQuant هي تقنية تجعل من الممكن ضغط نماذج اللغة الكبيرة إلى أعداد صحيحة 8 بت لكل من الأوزان والتنشيطات دون إعادة التدريب. وهذا مهم لأن عمليات التنشيط في النماذج الكبيرة تحتوي على قيم متطرفة تدمر عادةً الرياضيات منخفضة الدقة، ويقوم SmoothQuant بترويضها.
ما هي المشكلة التي يعالجها SmoothQuant على وجه التحديد في الاستدلال منخفض الدقة؟
تستهدف SmoothQuant القيم الخارجية الكبيرة التي تظهر في قنوات تنشيط معينة، والتي تدمر الدقة عندما يتم تحديد عمليات التنشيط إلى 8 بت.
كيف يعمل SmoothQuant على تسهيل عملية التنشيط؟
فهو يقسم قنوات التنشيط بمقياس لكل قناة ويضرب الأوزان المتطابقة بهذا المقياس، بحيث لا يتغير المنتج ولكن يصبح قياس كلا الموتدين أسهل.
ماذا يعني التدوين W8A8؟
يشير W8A8 إلى تكميم 8 بت لكل من الأوزان (W) وعمليات التنشيط (A)، ويتيح نظام SmoothQuant الحد الأدنى من فقدان الدقة.
لماذا لا يضيف مقياس SmoothQuant أي تكاليف إضافية لوقت التشغيل؟
يتم طي مقاييس التجانس في أوزان الطبقة السابقة أو عملية دمج مسبقًا، لذلك لا تحدث أي حسابات إضافية عند الاستدلال.
ما هو الدور الذي تلعبه معلمة ألفا الفائقة في SmoothQuant؟
يوازن ألفا (عادة 0.5) عامل التجانس، ويحدد مقدار صعوبة التكميم التي يتم نقلها من عمليات التنشيط إلى الأوزان.