التكميم النموذجي
يؤدي تكميم النموذج إلى تقليص الشبكة العصبية عن طريق تخزين أرقامها في عدد أقل من البتات، بحيث يعمل النموذج نفسه بشكل أسرع وعلى أجهزة أصغر.
نظرة عامة
It is the main reason large models can fit on a single GPU, a laptop, or even a phone.
الغوص العميق
عادةً ما تقوم النماذج المدربة بتخزين كل وزن كرقم فاصلة عائمة 32 بت أو 16 بت. يحل التكميم محل تلك التنسيقات ذات الدقة الأقل مثل الأعداد الصحيحة 8 بت (INT8) أو قيم 4 بت (INT4)، مما يؤدي إلى قطع الذاكرة تقريبًا من 4x إلى 8x. يمكن للنموذج الذي يحتوي على 70 مليار معلمة والذي يحتاج إلى حوالي 140 جيجابايت في 16 بت أن ينخفض إلى ما يقرب من 35 جيجابايت في 4 بت، مما يتناسب مع وحدة معالجة الرسومات الخاصة بالمستهلك. المهم هو الدقة: إن ضغط نطاق واسع من القيم في 256 أو 16 مجموعة يؤدي إلى فقدان التفاصيل. تختار الأساليب الحديثة مثل GPTQ وAWQ وتنسيق NF4 المستخدم في QLoRA عوامل قياس ذكية وتحمي الأوزان الأكثر حساسية، لذا غالبًا ما يكون فقدان الجودة صغيرًا. التكميم هو السبب وراء قدرة أدوات مثل llama.cpp وOllama على تشغيل نماذج قادرة محليًا دون الحاجة إلى مركز بيانات.
البصيرة الفنية
يقوم التكميم بتعيين القيم الحقيقية لشبكة أعداد صحيحة صغيرة باستخدام مقياس ونقطة صفر:store_int = round(value /scale) + Zero_point. إن اختيار المقياس جيدًا هو اللعبة بأكملها. يحافظ القياس لكل قناة أو لكل مجموعة على مقاييس منفصلة لشرائح مصفوفة الوزن، مما يحافظ على الدقة حيثما كان ذلك مهمًا. يقوم التكميم بعد التدريب فقط بتحويل النموذج النهائي، بينما يحاكي التدريب المدرك للتكميم التقريب أثناء التدريب بحيث تتعلم الشبكة كيفية تحمله، مما يوفر عادة دقة أفضل للبت المنخفض.
التأثير الاستراتيجي
التكلفة والميزانية
تؤدي قرارات الهندسة المعمارية إلى زيادة الأداء وتكلفة التشغيل لسنوات.
قرارات أوضح
يساعد التعليم الفني الفرق على اختيار المجموعة المناسبة، وليس فقط المجموعة الأحدث.
مراقبة الجودة
تعمل الخيارات الهندسية الأفضل على تقليل حوادث الموثوقية في الإنتاج.
مستقبل نموذج التكميم
توقع أن تصبح الدقة المنخفضة باستمرار أمرًا طبيعيًا. تعمل الأبحاث على دفع أوزان موثوقة ذات 4 بت، و2 بت، وحتى ثنائية، بالإضافة إلى مخططات مختلطة الدقة تحافظ على ارتفاع الطبقات الحساسة. الأجهزة التالية: تشتمل وحدات معالجة الرسومات ورقائق الهاتف الآن على وحدات رياضية أصلية INT8 وINT4 وFP8. تهدف التنسيقات مثل FP8 وMXFP4 إلى الجمع بين نطاق العوامات وحجم الأعداد الصحيحة. إلى جانب تقنيات مثل QLoRA، سيستمر التكميم في جعل النماذج ذات النطاق الحدودي أرخص في التشغيل والضبط الدقيق على الأجهزة اليومية.
التنفيذ في العالم الحقيقي
تشغيل نموذج Llama 7B أو 13B على جهاز كمبيوتر محمول باستخدام llama.cpp أو Ollama باستخدام ملفات GGUF ذات 4 بت.
يقوم QLoRA بضبط نموذج كبير على وحدة معالجة رسومات واحدة عن طريق الحفاظ على الأوزان الأساسية مجمدة في 4 بت NF4.
نشر نماذج INT8 على الهواتف ذات أوقات التشغيل على الجهاز حتى يعمل المساعدون دون اتصال وبشكل خاص.
خدمة نقاط نهاية API أرخص حيث يعمل تكميم INT8/FP8 تقريبًا على مضاعفة الإنتاجية وتقليل تكلفة الذاكرة.
المخاطر والدرابزين
يمكن أن يؤدي تحسين معيار واحد إلى إخفاء نقاط ضعف النظام الأوسع.
غالبًا ما يتم التقليل من تكاليف البنية التحتية والصيانة.
يمكن أن تنمو الفجوات الأمنية وقابلية المراقبة عندما تصبح الأنظمة أكثر تعقيدًا.
خارطة طريق التنفيذ
تحديد الكمون والجودة وأهداف التكلفة قبل التنفيذ.
المعيار في ظل ظروف التحميل والبيانات الواقعية.
مراقبة الأدوات للأخطاء والانجراف وتأثير المستخدم.
قم بإعداد مسارات التراجع والاستجابة للحوادث قبل القياس.
استمر في الاستكشاف
Free newsletter
Get the daily AI briefing
Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.
One email each weekday. Unsubscribe in one click. We never sell or share your address.
Test yourself
Take the Model Quantization quiz
Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.
Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation
الدليل التالي
السجلات النموذجية
الأسئلة المتداولة
What is Model Quantization?
يؤدي تكميم النموذج إلى تقليص الشبكة العصبية عن طريق تخزين أرقامها في عدد أقل من البتات، بحيث يعمل النموذج نفسه بشكل أسرع وعلى أجهزة أصغر. وهذا هو السبب الرئيسي وراء إمكانية احتواء النماذج الكبيرة على وحدة معالجة رسومات واحدة أو كمبيوتر محمول أو حتى هاتف.
ما الذي يتغير في المقام الأول من نموذج التكميم فيما يتعلق بالشبكة العصبية؟
يقوم التكميم بتخزين نفس المعلمات في عدد أقل من البتات (على سبيل المثال INT8 أو INT4 بدلاً من 16 أو 32 بت)، مما يقلل الذاكرة ويسرع العمليات الحسابية.
ما مقدار الذاكرة التي يمكن تحويل نموذج من 16 بت إلى 4 بت تقريبًا؟
إن الانتقال من 16 بت لكل وزن إلى 4 بتات يؤدي إلى خفض مساحة التخزين بحوالي أربعة أضعاف، ولهذا السبب يمكن احتواء النماذج الضخمة على وحدة معالجة رسومات واحدة.
ما هو الجانب السلبي الرئيسي للتكميم العدواني للبت المنخفض؟
يؤدي تعيين نطاق واسع من القيم على مستويات قليلة منفصلة إلى فقدان التفاصيل، مما قد يؤدي إلى تقليل الجودة ما لم يحمي القياس الذكي الأوزان الحساسة.
كيف يختلف التدريب المدرك للتكميم عن التكميم بعد التدريب؟
يؤدي التدريب المدرك للتكميم إلى إنشاء خطأ التقريب في حلقة التدريب، وبالتالي تتكيف الشبكة وتحافظ عادةً على دقة أكبر عند عرض البتات المنخفض.
ما هي التقنية التي تستخدم تكميم 4 بت لجعل الضبط الدقيق للنماذج الكبيرة ميسور التكلفة على وحدة معالجة رسومات واحدة؟
تحافظ QLoRA على النموذج الأساسي مجمداً بتنسيق NF4 4 بت وتقوم بتدريب أوزان المحولات الصغيرة، مما يسمح بضبط النماذج الكبيرة بدقة على أجهزة متواضعة.