دليل اللغة AI

التكميم

يعمل التكميم على تقليص نموذج الذكاء الاصطناعي عن طريق تخزين أرقامه بدقة أقل، لذلك يمكن أحيانًا تشغيل النموذج الذي يحتاج إلى وحدة معالجة رسومات لمركز البيانات على جهاز كمبيوتر محمول أو هاتف.

قراءة لمدة دقيقتينآخر تحديث

نظرة عامة

It is the main trick that makes large language models cheap and fast enough to deploy widely.

الغوص العميق

الشبكة العصبية هي في الغالب كومة عملاقة من الأرقام تسمى الأوزان، والتي يتم تخزينها عادة كقيم فاصلة عائمة 16 أو 32 بت. يقوم التكميم بإعادة تخزين تلك الأوزان باستخدام عدد أقل من البتات، عادة 8 بت (INT8) أو حتى أعداد صحيحة 4 بت. يؤدي الانتقال من 16 بت إلى 4 بت إلى خفض الذاكرة بمقدار أربعة أضعاف تقريبًا، لذا فإن النموذج الذي يحتوي على 70 مليار معلمة والذي يحتاج إلى حوالي 140 جيجابايت عند 16 بت يمكن أن يتناسب مع حوالي 35 جيجابايت عند 4 بت. تتحرك الأرقام الأصغر أيضًا عبر الذاكرة بشكل أسرع، مما يؤدي عادةً إلى تسريع عملية الإنشاء. المهم هو الدقة: يؤدي ضغط نطاق واسع من القيم إلى مستويات قليلة إلى حدوث خطأ في التقريب. تقلل الأساليب الجيدة من هذه الخسارة عن طريق اختيار عوامل القياس بعناية وحماية الأوزان الأكثر حساسية، وبالتالي يتصرف النموذج بشكل متماثل تقريبًا أثناء استخدام جزء صغير من الموارد.

البصيرة الفنية

تحصل كل مجموعة من الأوزان على عامل مقياس يقوم بتعيين القيم الحقيقية على مجموعة صغيرة من الأعداد الصحيحة؛ الضرب بالمقياس يعيد بناء الرقم الأصلي تقريبًا. تقوم أساليب التكميم بعد التدريب، مثل GPTQ وAWQ، بتحليل مجموعة بيانات معايرة صغيرة لتحديد الأوزان الأكثر أهمية وتعيين المقاييس لتقليل خطأ الإخراج، بدلاً من تقريب كل شيء بشكل أعمى. غالبًا ما يتم الاحتفاظ بعمليات التنشيط بدقة أعلى لأنها تختلف بشكل أكبر في وقت التشغيل. والنتيجة هي نموذج يقوم بتخزين أعداد صحيحة ذات 4 بتات ولكنه يحسب النتائج قريبة جدًا من الإصدار الكامل الدقة.

التأثير الاستراتيجي

السرعة والحجم

يمكن أن تتحرك مسارات عمل اللغة بشكل أسرع دون التضحية بالاتساق.

الوصول والوصول

فهو يوسع الوصول عبر اللغات وأنماط الاتصال.

قرارات أوضح

يمكن للفرق قضاء المزيد من الوقت في الحكم بينما تتعامل الأتمتة مع التكرار.

مستقبل التكميم

توقع أن يصبح التكميم هو الوضع الافتراضي وليس التحسين. يضيف بائعو الأجهزة دعمًا أصليًا للبتات 4 بت وحتى البتات الأقل، كما تعمل تقنيات مثل التدريب المدرك للتكميم على التسامح مع الدقة المنخفضة في النموذج منذ البداية، مما يقلل من فقدان الدقة بشكل أكبر. البحث في تمثيلات 2 بت و1 بت (ثنائي) نشط، بهدف تشغيل نماذج قادرة على الهواتف والرقائق المدمجة. ومع نمو الذكاء الاصطناعي الخاص والموجود على الجهاز، ستكون النماذج الكمية الفعالة عنصرًا أساسيًا في تشغيل المساعدين محليًا دون إرسال البيانات إلى السحابة.

التنفيذ في العالم الحقيقي

تشغيل نموذج دردشة مثل Llama محليًا على وحدة معالجة الرسومات للمستهلك باستخدام ملفات GGUF أو GPTQ ذات 4 بت بدلاً من الحاجة إلى بطاقات مركز بيانات متعددة.

المساعدون الموجودون على الجهاز على الهواتف، حيث تسمح طرز 8 بت أو 4 بت بتشغيل ميزات الكلام والنص دون اتصال بالشبكة.

خفض تكاليف الاستدلال السحابي لروبوت دعم العملاء من خلال تقديم نموذج INT8، وتناسب المزيد من الطلبات على كل وحدة معالجة رسومات.

الأجهزة المتطورة مثل الكاميرات الذكية أو مستشعرات إنترنت الأشياء التي تعمل على تشغيل نماذج لغة رؤية مدمجة ومكممة ضمن حدود ذاكرة ضيقة.

المخاطر والدرابزين

يمكن للحقائق المهلوسة إدخال التقارير أو تدفقات الدعم أو مخرجات البحث بهدوء.

يمكن أن تؤدي الحساسية السريعة إلى نتائج غير متناسقة عبر الطلبات المماثلة.

قد يتم كشف البيانات النصية الحساسة إذا كانت عناصر التحكم في الوصول ضعيفة.

خارطة طريق التنفيذ

1

حدد تنسيق الإخراج والنغمة ومعايير الجودة قبل بدء التشغيل.

2

استجابات أرضية من مصادر موثوقة عندما تكون الدقة مهمة.

3

احتفظ بنقطة تفتيش للمراجعة البشرية للمخرجات عالية المخاطر.

4

تتبع أنماط الفشل وأعد تدريب المطالبات أو سير العمل بانتظام.

استمر في الاستكشاف

Free newsletter

Get the daily AI briefing

Three verified AI stories every weekday morning, written in plain English. Free forever, no ads.

One email each weekday. Unsubscribe in one click. We never sell or share your address.

Test yourself

Take the Quantization quiz

Instant feedback on every answer, and a shareable certificate with a verifiable ID once you pass a course.

ابدأ الاختبار

Support free AI education. AI Understanding is a 501(c)(3) nonprofit — no ads, no paywall, ever. Make a donation

الدليل التالي

تكميم المتجهات المتبقية

الأسئلة المتداولة

What is Quantization?

يعمل التكميم على تقليص نموذج الذكاء الاصطناعي عن طريق تخزين أرقامه بدقة أقل، لذلك يمكن أحيانًا تشغيل النموذج الذي يحتاج إلى وحدة معالجة رسومات لمركز البيانات على جهاز كمبيوتر محمول أو هاتف. إنها الحيلة الرئيسية التي تجعل نماذج اللغات الكبيرة رخيصة الثمن وسريعة بما يكفي لنشرها على نطاق واسع.

ما الذي يغيره التكميم في المقام الأول فيما يتعلق بالشبكة العصبية؟

يقوم التكميم بإعادة تخزين أوزان النموذج بدقة رقمية أقل، مثل الأعداد الصحيحة 8 بت أو 4 بت بدلاً من العوامات 16 أو 32 بت.

ما مقدار الذاكرة التي يتم حفظها تقريبًا عن طريق نقل الأوزان من 16 بت إلى 4 بت؟

4 بتات هي ربع 16 بت، لذلك ينخفض ​​تخزين الوزن إلى الربع تقريبًا، أي انخفاض بمقدار 4x تقريبًا.

ما هو الجانب السلبي الرئيسي للتكميم العدواني؟

يؤدي تمثيل القيم بمستويات أقل إلى حدوث خطأ في التقريب، مما قد يؤدي إلى انخفاض جودة المخرجات إذا لم يتم إدارتها بعناية.

ما الذي تستخدمه طرق مثل GPTQ وAWQ لمجموعة بيانات معايرة صغيرة؟

تعمل أساليب ما بعد التدريب هذه على تحليل بعض مدخلات العينات لتعيين عوامل القياس وحماية الأوزان الحساسة، مع الحفاظ على المخرجات قريبة من الأصل.

لماذا يجعل التكميم في كثير من الأحيان النموذج أسرع، وليس أصغر فقط؟

تتطلب القيم ذات الدقة المنخفضة نطاقًا تردديًا أقل للذاكرة للتحميل والنقل، وهو ما يمثل غالبًا عنق الزجاجة أثناء الإنشاء، لذلك يتم تسريع الاستدلال.