GPTQ وAWQ التكميم بعد التدريب
GPTQ وAWQ هما طريقتان رائدتان لتقليص نماذج اللغة المدربة بالفعل إلى دقة 4 بت بحيث تعمل على أجهزة أصغر وأرخص.
نظرة عامة
They are why you can run a capable model on a single consumer GPU instead of a datacenter rack.
الغوص العميق
يقوم تكميم ما بعد التدريب (PTQ) بضغط النموذج النهائي دون إعادة تدريبه، ورسم أوزان عالية الدقة تصل إلى 4 بتات لربع الذاكرة تقريبًا. التحدي هو القيام بذلك دون تدمير الدقة. يقوم GPTQ (تحسين OBQ) بقياس الأوزان طبقة تلو الأخرى، باستخدام معلومات من الدرجة الثانية من مجموعة بيانات معايرة صغيرة لضبط الأوزان المتبقية والتعويض عن كل خطأ في التقريب. يأخذ AWQ (تكميم الوزن المدرك للتنشيط) زاوية مختلفة: فهو يلاحظ أن جزءًا صغيرًا من قنوات الوزن لها أهمية غير متناسبة، ويتم تحديدها من خلال النظر في أحجام التنشيط، وتحمي تلك القنوات البارزة عن طريق توسيع نطاقها بدلاً من تكميمها بقوة. يتيح كلاهما تشغيل نماذج مثل Llama بنظام 4 بت، وقد جعلتها أدوات مثل vLLM وllama.cpp وAutoGPTQ سائدة للاستدلال المحلي والفعال من حيث التكلفة.
البصيرة الفنية
يستخدم GPTQ تقريبًا لـ Hessian (انحناء الخسارة) لتحديد كيفية دفع أحد الأوزان لتقريب الوزن الآخر، مما يقلل من الخطأ الذي تم تقديمه. يتخطى AWQ معايير Hessians بالكامل: فهو يحسب عامل القياس لكل قناة بحيث تحافظ قنوات الوزن المهمة على دقتها الفعالة، ثم تقوم بالتكميم بشكل موحد. يحافظ كلاهما على عمليات التنشيط بدقة أعلى ويضغطان الأوزان فقط، نظرًا لأن الأوزان تهيمن على الذاكرة بينما يميل تكميم التنشيط إلى الإضرار بالدقة بشكل أكبر.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل GPTQ وAWQ التكميم بعد التدريب
يدفع التكميم أقل من 4 بتات نحو أنظمة 3 بت و2 بت ومختلطة الدقة، وغالبًا ما يتم دمجها مع التناثر. توقع اقترانًا أوثق مع محركات الخدمة، بحيث يعمل التكميم وضغط ذاكرة التخزين المؤقت KV وفك التشفير التخميني معًا. لقد أصبح دعم الأجهزة للتنسيقات منخفضة البت مثل NVFP4 وMXFP4 في طور النضج، وستقوم الأدوات الآلية بشكل متزايد باختيار عروض البت لكل طبقة. الهدف العام هو استخدام 4 بتات (وأقل) دون فقدان البيانات تقريبًا كإعداد افتراضي، مما يجعل النماذج القوية رخيصة الثمن للخدمة في كل مكان.
التنفيذ في العالم الحقيقي
تشغيل نموذج Llama ذو 70 مليار معلمة على وحدة معالجة رسومات استهلاكية واحدة سعة 24 جيجابايت باستخدام أوزان GPTQ ذات 4 بت.
يتم تقديم النماذج الكمية AWQ بإنتاجية عالية في vLLM لواجهات برمجة تطبيقات الإنتاج الفعالة من حيث التكلفة.
llama.cpp يستخدم أوزان GGUF الكمية لتشغيل نماذج اللغة محليًا على وحدة المعالجة المركزية للكمبيوتر المحمول.
تتيح مكتبات AutoGPTQ وAutoAWQ الخاصة بـ Hugging Face للمطورين تحديد حجم النموذج الذي تم تنزيله في بضعة أسطر من التعليمات البرمجية.
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the GPTQ and AWQ Post-Training Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
وظائف التأثير لإسناد بيانات التدريب
الأسئلة المتداولة
What is GPTQ and AWQ Post-Training Quantization?
GPTQ وAWQ هما طريقتان رائدتان لتقليص نماذج اللغة المدربة بالفعل إلى دقة 4 بت بحيث تعمل على أجهزة أصغر وأرخص. وهذا هو السبب وراء إمكانية تشغيل نموذج قادر على وحدة معالجة رسومات استهلاكية واحدة بدلاً من حامل مركز البيانات.
ماذا يعني "التكميم بعد التدريب"؟
يقلل التكميم بعد التدريب من دقة أوزان النموذج النهائي (على سبيل المثال، إلى 4 بت) دون إعادة تدريبه من الصفر.
ما هي المعلومات التي يستخدمها GPTQ للتعويض عن أخطاء التقريب عند القياس الكمي؟
يستخدم GPTQ مقياس Hessian تقريبيًا لفهم كيفية تأثير تكميم وزن واحد على الخسارة، ثم يضبط الأوزان المتبقية للتعويض.
ما هي الرؤية الرئيسية التي تدفع AWQ (تكميم الوزن المدرك للتنشيط)؟
يحدد AWQ قنوات الوزن البارزة باستخدام مقادير التنشيط ويحميها عن طريق القياس، نظرًا لأن بعض القنوات مهمة بشكل غير متناسب.
ما مقدار الذاكرة التي يوفرها التكميم 4 بت تقريبًا مقابل أوزان 16 بت؟
يؤدي الانتقال من 16 بت إلى 4 بت لكل وزن إلى تقليل ذاكرة الوزن إلى حوالي الربع، أي ما يقرب من 4 أضعاف التخفيض.
لماذا يقوم كل من GPTQ وAWQ عادةً بقياس الأوزان مع الحفاظ على عمليات التنشيط بدقة أعلى؟
الأوزان هي تكلفة الذاكرة الرئيسية، في حين أن عمليات التنشيط أكثر حساسية لفقدان الدقة، لذا فإن تكميم الوزن فقط هو النقطة الجيدة الشائعة.